문맥적 임베딩: ELMo부터 BERT까지
정적 임베딩의 다의어 문제를 해결하는 문맥적 임베딩의 원리, ELMo의 양방향 LSTM 레이어 표현, BERT의 트랜스포머 기반 서브워드 임베딩 추출법을 수식과 코드로 완전히 해설한다.
PALDYN LEARN
AI가 어떻게 작동하는지 배웁니다. 모델의 원리부터 그 아래를 떠받치는 수학, 실제로 굴리는 방법까지.
정적 임베딩의 다의어 문제를 해결하는 문맥적 임베딩의 원리, ELMo의 양방향 LSTM 레이어 표현, BERT의 트랜스포머 기반 서브워드 임베딩 추출법을 수식과 코드로 완전히 해설한다.
FastText가 문자 n-gram 기반의 부분 단어 모델로 OOV 문제를 해결하는 방법, 한국어 형태론에서의 강점, 실전 학습과 추론 코드를 완전히 해설한다.
GloVe가 공기 행렬의 전역 통계와 국소 문맥 창의 장점을 결합하는 방법, 목적 함수의 수학적 의미, 사전 학습 벡터 활용법을 깊이 있게 다룬다.
CBOW와 Skip-gram 아키텍처부터 네거티브 샘플링, 계층적 소프트맥스, 단어 유추 태스크까지 — Word2Vec의 작동 원리를 수식과 gensim 코드로 완전히 해설한다.
임베딩이 이산적인 토큰을 연속적인 고차원 벡터로 변환하는 원리, 임베딩 행렬의 구조, 코사인 유사도로 의미 관계를 측정하는 방법을 수식과 PyTorch 코드로 완전히 해설한다.
고정 Context Vector의 병목을 Attention이 어떻게 푸는지, Bahdanau·Luong·Scaled Dot-Product가 어디서 갈리는지, 그리고 Attention을 붙이고도 RNN에 남아 있던 세 한계를 Transformer가 어떻게 한꺼번에 걷어냈는지 한 흐름으로 잇는다.
입력과 출력의 길이가 다른 문제를 두 RNN을 이어 붙여 푸는 방법. 컨텍스트 벡터, Teacher Forcing과 노출 편향, 자기회귀 디코딩, Beam Search의 길이 정규화까지 계산을 따라가며 살펴본다.
셀 안에 게이트를 넣어 기억을 고르는 LSTM과 GRU, 그리고 읽는 방향을 하나 더 늘리는 양방향 RNN을 한 편에서 정리한다. 무엇이 파라미터를 25% 줄이고 무엇이 기울기를 살리는지 숫자로 따라간다.
MLP가 시퀀스를 못 다루는 이유부터 은닉 상태 갱신식, 입출력 형태 네 가지, 패딩과 손실 마스킹, BPTT의 기울기 곱, 그리고 RNN이 지금도 쓰이는 자리까지 코드와 함께 살펴본다.
깊은 신경망 학습을 방해하는 기울기 소실(Vanishing Gradient)과 기울기 폭발(Exploding Gradient)의 수학적 원인을 이해한다. ReLU, 잔차 연결, 배치 정규화, Gradient Clipping 등 현대적 해결책을 코드와 함께 정리한다.
훈련 중 뉴런을 무작위로 끄는 것만으로 과적합이 줄어드는 이유, Inverted Dropout이 기대값을 맞추는 계산, 앙상블 해석의 범위, Dropout2d·DropPath 변형과 p 고르기를 코드와 함께 살펴본다.
배치 정규화·레이어 정규화·그룹 정규화·RMSNorm이 같은 식을 어느 축으로 재느냐만 바꾼 것임을 보이고, 배치 크기·훈련/추론 모드·Pre-LN 배치까지 고르는 기준을 한 편에서 정리한다.
초기값이 왜 학습 성패를 가르는지를 분산 식 하나로 따라간다. 0 초기화가 막히는 지점, Xavier의 √6과 He의 2가 어디서 나오는지, 정규화 레이어가 있어도 초기화가 남는 자리를 정리한다.
다층 퍼셉트론(MLP)의 구조와 보편 근사 정리를 이해한다. 깊이와 너비의 트레이드오프, MNIST 분류기 완전 구현, 하이퍼파라미터 선택 가이드까지 실전 중심으로 MLP를 완전히 파악한다.
신경망 학습의 핵심인 순전파와 역전파를 수식과 코드로 완전히 이해한다. 연쇄 법칙이 어떻게 다층 신경망의 기울기를 계산하는지, PyTorch Autograd가 이를 어떻게 자동화하는지, 기울기가 이상할 때 어디를 보는지를 다룬다.
신경망의 비선형성을 담당하는 활성화 함수를 완전 정복한다. Sigmoid, Tanh, ReLU, Leaky ReLU, GELU, Swish의 수식·특성·한계를 비교하고, 실무에서 어떤 상황에 어떤 함수를 선택해야 하는지를 알아본다.
신경망의 구성 요소인 층(Layer), 가중치(Weight), 편향(Bias), 활성화 함수를 수학과 코드로 이해한다. 순전파(Forward Pass)가 어떻게 예측을 만드는지, 파라미터 수는 어떻게 계산하는지를 완전히 파악한다.
1957년 Rosenblatt의 퍼셉트론부터 학습 규칙, 수렴 정리, 한계(XOR 문제)까지. 딥러닝 시대를 연 최초의 학습 가능한 뉴런 모델을 코드와 함께 완전히 이해한다.
레이블 없이 클러스터링 품질을 측정하는 내부 지표(실루엣·Davies-Bouldin·Calinski-Harabász), 정답 레이블을 사용하는 외부 지표(ARI·NMI), 최적 K 선택 방법을 실전 코드와 함께 이해한다.
검색·추천의 순위 품질을 재는 세 지표를 손계산으로 따라간다. DCG의 이득과 할인, IDCG 정규화, AP의 분모 R, MRR이 버리는 것, 그리고 k와 라벨 출처가 지표 선택을 제한하는 자리까지 살펴본다.
MAE·MSE·RMSE·MAPE·R²의 공식·특성·적용 조건, 이상치 민감도 비교, Adjusted R²·Huber 손실, 잔차 분석으로 모델 진단하는 방법을 실전 코드와 함께 이해한다.
ROC 곡선의 TPR-FPR 트레이드오프, AUC의 확률론적 해석, PR-AUC와의 차이, 다중 클래스 확장, 최적 임계값 선택 방법을 실전 코드와 함께 완전히 이해한다.
혼동 행렬 네 칸에서 정확도·정밀도·재현율·F1·MCC가 어떻게 나오는지, 임계값이 그 네 칸을 어떻게 옮기는지, 그리고 다중 클래스와 불균형 데이터에서 무엇을 봐야 하는지 한 편에서 정리한다.
기대 오차를 편향·분산·환원불가 오차로 나누고, 학습 곡선으로 어느 쪽이 문제인지 가려낸 뒤, 복잡도 조절·정규화·조기 종료·증강·앙상블 중 무엇을 꺼내야 하는지까지 한 편에서 정리한다.