본문 바로가기

전체 글

(7)
LSTM과 변형모델 LSTM(Long Short Term Memory)1. 개념 LSTM은 Sequence의 길이가 길어질수록 과거 정보의 학습이 어려워지는 장기 의존성 문제(Long-Term Dependency Problem)가 발생하는 기존 RNN 모델을 개선시킨 모델이다.기존 RNN 모델과 달리,Cell State 구조를 제안하고 Forget Gate, Input Gate, Output Gate를 추가한 구조이다. 2. 구조Forget Gate Forget Gate는 불필요한 과거 정보는 버리고 필요한 정보는 기억해서 전달하기 위해 만들어진 게이트이다.활성화 함수로 sigmoid 함수를 사용하였기 때문에 0~1의 값이 나온다.0에 가까울수록 이전 Cell State값이 작아져 과거의 정보를 전달하지 않고 1에 가까울수..
RNN(Recurrent Neural Network) RNN(Recurrent Neural Network)1. 개념  RNN(Recurrent Neural Network)은 순차적 데이터나 시계열 데이터를 처리하기 위해 만들어진 신경망의 유형이다. 입력 데이터의 순서를 고려하여 이전 단계의 정보를 현재 단계의 계산에 반영할 수 있도록 설계 되었으며, 그림에서 Whh파라미터가 전 단계의 정보를 현재 단계로 전달해주는 파라미터이다.RNN이 사용되는 주된 분야는 자연어 처리, 음성 인식, 시계열 분석에 주로 사용된다. 2. 구조● one to one : Vanilla Neural Network라고 부르며 단일 입력 벡터에 대응하는 단일 출력 벡터를 가지는RNN의 가장 기본적인 형태이다. ● one to many : 하나의 입력에 대해 다수의 출력을 생성하는 방식..
BGD vs SGD vs MGD 1. Gradient Descent(GD)1.1 개념Gradient Descent란 최적화 문제에서 Loss Function(손실함수)를 최소화하여 모델의 성능을 향상시키는 것을 말하며, 여기서 Loss function은 모델의 성능을 평가하는 함수로 일반적으로 예측 값과 실제 값 사이의 오차를 측정한다.  1.2 수식" data-ke-type="html">HTML 삽입미리보기할 수 없는 소스 여기서 wi는 현재의 가중치, wi+1은 다음 iteration의 가중치이며 α는 학습률(Learning Rate)이다. α는 하이퍼 파라미터로 학습 과정 전에 수동으로 설정해야 하는 변수이며, 적절한 하이퍼 파라미터 설정이 모델의 성능에 많은 영향을 끼친다.  학습률(Learning Rate)는 최적의 가중치에 ..
Batch Normalization(배치 정규화) 1. Data Normalization(데이터 정규화)1.1 개념Data Normalization은 각기 다른 스케일을 가진 데이터를 일정한 범위로 변환하여 데이터의 스케일이 달라서 발생하는 문제를 방지하고, 모델의 성능을 향상시키기 위해 사용된다. 1.2 Data Normaliztion이 왜 필요한가? 좌측 이미지를 보면 각 변수(w,b)가 다른 스케일을 가져서 각 축에 따라 길이가 달라 비대징척인 등고선을 보이는데 이 경우 최적화 과정이 비효율적이다. 우측 이미지는 각 변수가 정규화 되어서 대칭적인 등고선을 가지기 때문에 최적화 과정이 매우 효율적이여서 학습속도가 빨라지고 더 안정적인 학습이 가능하다. 2. Internal Covariate Shift2.1 개념 입력 데이터의 분포가 학습할 때와 테스..
Vanishing Gradient 문제 1. Vanishing Gradient란?Vanishing Gradient 문제는 딥러닝에서 인공 신경망을 학습할 때 주로 발생하는 현상으로, Backpropagation과정에서 Gradient가 input layer와 가까운 layer로 갈수록 점점 작아져서 거의 0에 가까워지는 문제를 말한다.이로 인해 인공 신경망의 초반 층의 parameter가 제대로 업데이트되지 않아 학습이 제대로 이루어지지 않는 현상이 일어난다. 2. 원인Vanishing Gradient 문제의 원인은 활성화 함수의 기울기에 있다.  " data-ke-type="html">HTML 삽입미리보기할 수 없는 소스 Backpropagation 과정에서 미분의 연쇄 법칙을 사용하면, 활성화 함수의 기울기가 연쇄적으로 곱해지게 된다. S..
QR 분해(QR Decomposition) QR 분해를 알기 위해서 직교행렬(Orthogonal Matrix)과 그람 슈미트 과정(Gram-Schmidt Process)에대해서 알아보자. 1. 직교행렬(Orthogonal Matrix)" data-ke-type="html">HTML 삽입미리보기할 수 없는 소스 직교행렬은 열벡터들이 서로 직교하며 각각의 크기가 1이라는 것을 말한다.위 식을 보면 행렬 Q는 q1,q2,q3라는 열벡터를 가지고 있고 각 열벡터들은서로 직교하며 크기가 1인 단위벡터(Unit Vector)이다. " data-ke-type="html">HTML 삽입미리보기할 수 없는 소스 직교 행렬의 또하나의 특징은 전치행렬과 역행렬이 같다는 것이다. 2. 그람 슈미트 과정(Gram-schmidt Process)a1,⋯,ak"..
Logit, Sigmoid, Softmax 함수 1. Logit 함수Logit 함수를 알기 위해서는 먼저 승산에 대해서 알아보자.  " data-ke-type="html">HTML 삽입미리보기할 수 없는 소스 여기서 p는 사건이 발생할 확률, 1-p는 사건이 발생하지 않을 확률을 뜻한다.odds는 p가 작을수록 0에 가까워지고 p가 클수록 분모가 작아지므로 계속해서 커진다.출력층 (0,∞)을 가지는 odds를 출력층의 범위의 균형을 맞춰주기 위해서 사용하는 것이 Logit함수이다. " data-ke-type="html">HTML 삽입미리보기할 수 없는 소스Logit함수는 확률 p는 (0,1)으로 실수 전체인  ( -∞,∞)를 출력해주기 때문에,분류 모델인 로지스틱 회귀에서 확률을 Log odds로 변환 해준다.또한, Logit함수의 역함수를 취하면 S..