KV 캐시 양자화 — 가중치보다 이쪽이 먼저 넘친다
긴 문맥에서 GPU 메모리를 실제로 잡아먹는 것은 가중치가 아니라 KV 캐시입니다. 캐시 크기를 계산하는 법, K와 V를 다르게 다뤄야 하는 이유, 어디까지 줄여도 되는지를 정리합니다.
PALDYN LEARN
AI가 어떻게 작동하는지 배웁니다. 모델의 원리부터 그 아래를 떠받치는 수학, 실제로 굴리는 방법까지.
긴 문맥에서 GPU 메모리를 실제로 잡아먹는 것은 가중치가 아니라 KV 캐시입니다. 캐시 크기를 계산하는 법, K와 V를 다르게 다뤄야 하는 이유, 어디까지 줄여도 되는지를 정리합니다.
양자화에서 스케일을 정하는 절차가 보정입니다. 무엇을 재는지, 데이터를 어디서 몇 개 뽑아야 하는지, 자르는 지점을 어떻게 고르는지, 그리고 잘못된 보정이 어떤 모양으로 드러나는지를 정리합니다.
범용 성능이 아니라 우리 과제 하나만 잘하는 작은 모델을 만드는 방법입니다. 교사에게 무엇을 받아야 하는지, 데이터를 어떻게 모으고 거르는지, 손익 분기가 어디인지를 정리합니다.
희소도 50%를 만들어도 추론이 안 빨라지는 이유를 짚고, 행·헤드·채널 단위로 덜어 내는 구조적 가지치기가 무엇을 어떻게 바꾸는지, 중요도를 어떻게 매기고 얼마나 회복시킬 수 있는지 정리합니다.
휴대폰과 산업용 기기의 NPU에 모델을 올리는 일이 GPU 배포와 어떻게 다른지 정리합니다. 미리 컴파일해야 하는 이유, 연산자 지원에서 막히는 지점, 그리고 NPU가 실제로 이기는 자리를 다룹니다.
설치 없이 웹 페이지 안에서 언어 모델을 돌리는 구조를 정리합니다. 첫 방문의 내려받기와 셰이더 컴파일, 버퍼 한계라는 진짜 벽, 그리고 어떤 서비스에 이 방식이 맞는지 다룹니다.
GPU 없이 모델을 서빙해야 할 때 무엇이 천장을 정하는지 정리합니다. 대역폭이 초당 토큰 수를 어떻게 묶는지, 양자화가 왜 CPU에서 더 효과적인지, 스레드와 배치를 어떻게 잡을지 다룹니다.
초안 모델이 앞질러 낸 토큰을 큰 모델이 한 번에 확인하면 출력은 그대로인데 속도가 붙습니다. 수용률과 초안 비용이 이득을 어떻게 정하는지, 별도 모델·n-gram·다중 헤드 중 무엇을 고를지 정리합니다.
한 요청 안에서 프리필과 디코드는 병목이 서로 다른 두 계산입니다. 한 GPU에 섞어 두면 왜 서로를 방해하는지, 노드를 나누면 무엇이 좋아지고 KV 캐시 전송이라는 새 비용은 얼마인지 정리합니다.
미세조정을 6주에 한 번씩 반복하면 한 번 할 때는 없던 문제가 생깁니다. 이어 붙이기와 다시 만들기의 차이, 데이터를 쌓는 방식, 고리를 도는 주기, 그리고 기준선 자체가 낡는 문제를 정리합니다.
검증 손실이 가장 낮은 체크포인트가 가장 좋은 체크포인트인 경우는 생각보다 드뭅니다. 왜 두 지표가 어긋나는지, 평가를 어떤 층으로 나눠 돌려야 학습이 느려지지 않는지 정리합니다.
미세조정한 모델이 목표 과제는 잘하는데 그 밖에서 이상해지는 현상입니다. 왜 일어나는지, 목표 점수만 보면 왜 안 보이는지, 그리고 건드리는 범위·리허설·학습률로 얼마나 줄일 수 있는지 정리합니다.
미세조정이 끝나면 파일 하나가 남습니다. 그 파일이 실제 트래픽을 받기까지 필요한 것 — 이름과 버전, 서버 적재 전략, 무중단 교체, 그리고 무엇보다 되돌리는 길을 정리합니다.
학습을 마친 LoRA 어댑터를 가중치에 합칠지 얹은 채 서빙할지, 그리고 어댑터 여럿을 하나로 합칠 때 값이 서로 상쇄되는 문제를 TIES·DARE 같은 방법으로 어떻게 다루는지 정리합니다.
합성 데이터는 만드는 단계보다 거르는 단계가 깁니다. 왜 이 방법이 통하는지, 씨앗·확장·거부 샘플링을 어떻게 조합하는지, 그리고 다양성 붕괴와 오염을 어떻게 잡아내는지 정리합니다.
검증기를 짤 수 없는 과제에서는 점수를 매기는 모델을 따로 학습합니다. 구조와 손실이 무엇을 최적화하는지, 데이터 일치도를 왜 먼저 재야 하는지, 그리고 보상은 오르는데 답이 나빠지는 지점을 어떻게 잡아내는지 정리합니다.
RLVR은 보상 모델 대신 검증기를 쓰는 학습입니다. 무엇이 검증 가능한 과제인지, 답 추출과 정규화가 왜 검증기의 절반인지, 그리고 격리·타임아웃·거짓 음성을 어떻게 다루는지 정리합니다.
GRPO는 같은 프롬프트에서 답을 여러 개 뽑아 그 평균을 기준선으로 씁니다. 가치 모델이 왜 사라졌는지, 무리 크기와 KL 항을 어떻게 잡는지, 그리고 어드밴티지가 0이 되어 학습이 멈추는 상황을 어떻게 피하는지 정리합니다.
DPO는 보상 모델 없이 선호 쌍만으로 모델을 정렬합니다. 손실 함수가 실제로 무엇을 하는지, 데이터를 어떻게 만들고 β를 어떻게 잡는지, 그리고 손실이 내려가는데 답이 나빠지는 상황을 어떻게 알아채는지 정리합니다.
품질을 1점 올리는 데 얼마가 드는지 재지 않으면 저울질을 할 수 없습니다. 파레토 프론티어로 후보를 거르는 법, 비용을 움직이는 레버들, 그리고 계단식 라우팅이 실제로 얼마를 아끼는지 계산해 봅니다.
오프라인 평가는 대리 지표라서 실제 사용자 행동과 어긋날 수 있습니다. 지표를 세 층으로 나누는 법, 표본 크기를 미리 정하는 법, 그리고 중간에 들여다보는 것이 왜 결론을 망치는지 정리합니다.
RAG 점수 하나로는 무엇을 고칠지 알 수 없습니다. Recall@k·MRR·nDCG가 실제로 무엇을 세는지, 근거 충실도를 어떻게 재는지, 그리고 두 구간 지표를 맞대 실패의 원인을 가리는 법을 정리합니다.
에이전트는 답 하나가 아니라 여러 걸음을 남깁니다. 최종 정답률만 보면 놓치는 것과, 도구 호출·단계 수·복구 여부를 어떻게 지표로 만들어 실패를 고칠 수 있는 이름으로 나눌지 정리합니다.
「5점: 매우 좋음」이라고 적힌 척도는 사람마다 다른 답을 냅니다. 축을 나누고 눈금마다 확인할 수 있는 조건을 붙여, 누가 채점해도 같은 점수가 나오는 기준을 만드는 방법을 정리합니다.