작은 모델을 우리 일에 맞추는 법
파인튜닝이 실제로 고치는 것은 지식이 아니라 행동입니다. 데이터 몇 건이 필요한지, LoRA가 무엇을 바꾸는지, 학습 전에 무엇을 먼저 만들어야 하는지를 정리합니다.
PALDYN LEARN
AI가 어떻게 작동하는지 배웁니다. 모델의 원리부터 그 아래를 떠받치는 수학, 실제로 굴리는 방법까지.
파인튜닝이 실제로 고치는 것은 지식이 아니라 행동입니다. 데이터 몇 건이 필요한지, LoRA가 무엇을 바꾸는지, 학습 전에 무엇을 먼저 만들어야 하는지를 정리합니다.
비용·지연·품질은 같은 방향으로 움직이지 않습니다. 폴백을 붙였을 때의 손익분기, 격차가 벌어지는 작업 유형, 그리고 내리기 전에 통과해야 할 네 관문을 정리합니다.
10억에서 100억 파라미터 사이의 모델이 다시 실무에 들어오고 있습니다. 무엇이 달라졌는지, 메모리는 어떻게 계산하는지, 무엇을 잘하고 무엇을 못하는지 정리합니다.
스키마를 통과한 출력에서 남는 의미 오류를 잡는 네 층의 검증, 오류를 되먹여 재시도하는 방법과 그 상한, 근거 인용을 스키마에 심어 자동 대조를 가능하게 하는 설계를 정리합니다.
JSON Schema로는 표현되지 않는 출력 형태를 문맥자유문법으로 강제하는 방법, GBNF 문법을 쓸 때 자주 걸리는 좌재귀·공백·모호성 문제, 그리고 카탈로그에서 문법을 생성하는 실무 형태를 정리합니다.
로짓 마스킹과 오토마톤 상태 전이로 스키마를 강제하는 원리, 토크나이저 경계 때문에 생기는 어려움, 컴파일·캐시 비용, 그리고 제약이 출력 품질을 오히려 떨어뜨리는 경우를 정리합니다.
구조화 출력에서 실제로 강제되는 JSON Schema 키워드와 조용히 무시되는 키워드를 구분하고, description·enum·필드 순서·중첩 깊이를 어떻게 설계해야 모델이 덜 틀리는지 정리합니다.
프롬프트로 JSON을 부탁하는 것, JSON 모드, 스키마 강제 세 가지가 각각 무엇을 보장하고 무엇을 보장하지 않는지, 그리고 어느 단계에서도 사라지지 않는 실패가 무엇인지 정리합니다.
정답 검증 가능성, 실패율, 지연 예산 세 가지로 추론 모델 도입을 판단하는 기준과, 추론 모델이 오히려 손해인 작업 유형, 그리고 트래픽을 등급으로 나눠 붙이는 실무 형태를 정리합니다.
사고 토큰이 요청 단가와 지연을 어떻게 바꾸는지 식으로 정리하고, 침묵 구간·꼬리 지연·캐시 무효화처럼 추론 모델에서만 생기는 운영 문제와 그 대응책을 다룹니다.
공개 추론 벤치마크 점수가 왜 시간이 지날수록 능력보다 노출량을 반영하게 되는지, 오염과 포화를 어떻게 알아채는지, 그리고 도입 판단에 쓸 자체 평가를 어떻게 세우는지 정리합니다.
교사 모델의 사고 궤적을 모아 작은 모델을 학습시키는 방법과, 정답 필터가 왜 품질의 대부분을 결정하는지, 그리고 증류로 넘어가지 않는 능력이 무엇인지 정리합니다.
"단계별로 생각해 봐"를 붙이는 것과 추론 모델을 쓰는 것은 무엇이 다른지, 둘을 겹치면 왜 손해가 나는지, 그리고 어느 쪽을 골라야 하는지를 비용·품질 기준으로 정리합니다.
사고 예산과 출력 상한의 관계, 난도에 따른 적응형 예산 배분, 예산 소진으로 답변이 잘리는 실패 모드와 그 방어책을 실무 코드와 운영 지표 중심으로 정리합니다.
규칙 검증기, 결과 보상 모델(ORM), 과정 보상 모델(PRM), 자기 검증의 특성과 한계를 비교하고, 여러 후보 중 정답을 골라내는 검증 계층을 실무에서 어떻게 구성할지 코드와 함께 정리합니다.
추론 모델이 되돌아가기와 자기 검증을 학습하는 원리를 검증 가능한 보상(RLVR)과 그룹 상대 정책 최적화를 중심으로 설명하고, 보상 해킹과 학습 붕괴를 막는 실무 장치를 정리합니다.
병렬 샘플링, 순차 수정, 트리 탐색으로 추론 시점 컴퓨트를 늘리는 방법과 각각의 비용·지연 특성, 그리고 수확 체감이 시작되는 지점을 실전 코드와 함께 정리합니다.
추론 모델이 일반 LLM과 구조적으로 어떻게 다른지, 사고 토큰이 정확도와 비용에 어떤 영향을 주는지, 그리고 어떤 작업에서만 그 대가가 회수되는지 실무 기준으로 정리합니다.
MMLU·HumanEval·SWE-bench·LMSYS Chatbot Arena 등 주요 LLM 벤치마크의 측정 방법, 한계, 벤치마크 해킹 문제, 그리고 실무에서 모델을 올바르게 비교하는 방법을 한국어로 완전 해설한다.
HyperCLOVA X, EXAONE, SOLAR 등 한국 LLM의 기술적 특징, 한국어 토크나이저의 효율성, 벤치마크 비교, API 사용법, 그리고 한국어 AI 서비스 구축 실전 가이드를 완전 해설한다.
가중치를 열어 프런티어를 쫓은 세 팀을 한자리에 놓는다. 슬라이딩 윈도우와 MLA가 어텐션 비용을 깎는 방식, MoE가 46.7B와 671B에서 되풀이하는 같은 셈, DeepSeek-R1이 정답 여부라는 보상 하나로 추론을 얻은 과정을 숫자로 따라간다.
Meta LLaMA 시리즈의 탄생 배경, LLaMA 1·2·3 버전별 혁신, 오픈소스 생태계(Vicuna·Alpaca·Code Llama), 로컬 실행 방법(Ollama·llama.cpp), 그리고 상업 모델과의 실전 비교를 한국어로 완전 해설한다.
Google Gemini 시리즈의 탄생 배경, Ultra·Pro·Flash·Nano 티어 구조, 1M 토큰 컨텍스트, 멀티모달 네이티브 설계, Gemini 2.0의 실시간 처리 능력, 그리고 Google AI Studio API 사용법을 한국어로 완전 해설한다.
Anthropic Claude 시리즈의 탄생 배경, Constitutional AI 원칙, Claude 1·2·3·3.5·4 모델별 특징, Haiku·Sonnet·Opus 티어 선택 기준, 그리고 실전 API 사용법을 한국어로 완전 해설한다.