RESULT / 92

모델 운영2026.09.0416 MIN

KV 캐시 양자화 — 가중치보다 이쪽이 먼저 넘친다

긴 문맥에서 GPU 메모리를 실제로 잡아먹는 것은 가중치가 아니라 KV 캐시입니다. 캐시 크기를 계산하는 법, K와 V를 다르게 다뤄야 하는 이유, 어디까지 줄여도 되는지를 정리합니다.

모델 운영2026.09.0421 MIN

양자화 보정 — 데이터 128개가 모델 품질을 정한다

양자화에서 스케일을 정하는 절차가 보정입니다. 무엇을 재는지, 데이터를 어디서 몇 개 뽑아야 하는지, 자르는 지점을 어떻게 고르는지, 그리고 잘못된 보정이 어떤 모양으로 드러나는지를 정리합니다.

모델 운영2026.09.0315 MIN

과제 특화 증류 — 큰 모델의 답을 작은 모델에 옮긴다

범용 성능이 아니라 우리 과제 하나만 잘하는 작은 모델을 만드는 방법입니다. 교사에게 무엇을 받아야 하는지, 데이터를 어떻게 모으고 거르는지, 손익 분기가 어디인지를 정리합니다.

모델 운영2026.09.0215 MIN

엣지 NPU 런타임 — 모델을 기기 안 전용 칩에 올릴 때

휴대폰과 산업용 기기의 NPU에 모델을 올리는 일이 GPU 배포와 어떻게 다른지 정리합니다. 미리 컴파일해야 하는 이유, 연산자 지원에서 막히는 지점, 그리고 NPU가 실제로 이기는 자리를 다룹니다.

모델 운영2026.09.0214 MIN

브라우저에서 WebGPU로 모델을 돌린다

설치 없이 웹 페이지 안에서 언어 모델을 돌리는 구조를 정리합니다. 첫 방문의 내려받기와 셰이더 컴파일, 버퍼 한계라는 진짜 벽, 그리고 어떤 서비스에 이 방식이 맞는지 다룹니다.

모델 운영2026.09.0214 MIN

CPU만으로 LLM을 돌린다는 것

GPU 없이 모델을 서빙해야 할 때 무엇이 천장을 정하는지 정리합니다. 대역폭이 초당 토큰 수를 어떻게 묶는지, 양자화가 왜 CPU에서 더 효과적인지, 스레드와 배치를 어떻게 잡을지 다룹니다.

모델 운영2026.09.0216 MIN

투기적 디코딩 — 초안 모델을 무엇으로 세울 것인가

초안 모델이 앞질러 낸 토큰을 큰 모델이 한 번에 확인하면 출력은 그대로인데 속도가 붙습니다. 수용률과 초안 비용이 이득을 어떻게 정하는지, 별도 모델·n-gram·다중 헤드 중 무엇을 고를지 정리합니다.

모델 운영2026.09.0115 MIN

프리필과 디코드를 다른 기계에 나누기

한 요청 안에서 프리필과 디코드는 병목이 서로 다른 두 계산입니다. 한 GPU에 섞어 두면 왜 서로를 방해하는지, 노드를 나누면 무엇이 좋아지고 KV 캐시 전송이라는 새 비용은 얼마인지 정리합니다.

모델 운영2026.09.0114 MIN

지속 학습 — 모델을 한 번이 아니라 계속 고쳐 나갈 때

미세조정을 6주에 한 번씩 반복하면 한 번 할 때는 없던 문제가 생깁니다. 이어 붙이기와 다시 만들기의 차이, 데이터를 쌓는 방식, 고리를 도는 주기, 그리고 기준선 자체가 낡는 문제를 정리합니다.

모델 운영2026.09.0113 MIN

파국적 망각 — 새로 가르치면 알던 것을 잊는다

미세조정한 모델이 목표 과제는 잘하는데 그 밖에서 이상해지는 현상입니다. 왜 일어나는지, 목표 점수만 보면 왜 안 보이는지, 그리고 건드리는 범위·리허설·학습률로 얼마나 줄일 수 있는지 정리합니다.

모델 운영2026.08.2812 MIN

LoRA 어댑터 병합 — 여럿을 하나로 합치는 법

학습을 마친 LoRA 어댑터를 가중치에 합칠지 얹은 채 서빙할지, 그리고 어댑터 여럿을 하나로 합칠 때 값이 서로 상쇄되는 문제를 TIES·DARE 같은 방법으로 어떻게 다루는지 정리합니다.

모델 운영2026.08.2811 MIN

학습 데이터 합성 — 모델로 만든 데이터로 모델을 가르치기

합성 데이터는 만드는 단계보다 거르는 단계가 깁니다. 왜 이 방법이 통하는지, 씨앗·확장·거부 샘플링을 어떻게 조합하는지, 그리고 다양성 붕괴와 오염을 어떻게 잡아내는지 정리합니다.

모델 운영2026.08.2813 MIN

보상 모델 만들기 — 점수를 매기는 모델을 학습시킨다

검증기를 짤 수 없는 과제에서는 점수를 매기는 모델을 따로 학습합니다. 구조와 손실이 무엇을 최적화하는지, 데이터 일치도를 왜 먼저 재야 하는지, 그리고 보상은 오르는데 답이 나빠지는 지점을 어떻게 잡아내는지 정리합니다.

모델 운영2026.08.2814 MIN

RLVR — 채점 가능한 과제로만 학습시키기

RLVR은 보상 모델 대신 검증기를 쓰는 학습입니다. 무엇이 검증 가능한 과제인지, 답 추출과 정규화가 왜 검증기의 절반인지, 그리고 격리·타임아웃·거짓 음성을 어떻게 다루는지 정리합니다.

모델 운영2026.08.2815 MIN

GRPO — 가치 모델을 지우고 무리의 평균을 기준으로 삼기

GRPO는 같은 프롬프트에서 답을 여러 개 뽑아 그 평균을 기준선으로 씁니다. 가치 모델이 왜 사라졌는지, 무리 크기와 KL 항을 어떻게 잡는지, 그리고 어드밴티지가 0이 되어 학습이 멈추는 상황을 어떻게 피하는지 정리합니다.

모델 운영2026.08.2713 MIN

DPO 실전 — 선호 데이터로 모델을 미세조정하기

DPO는 보상 모델 없이 선호 쌍만으로 모델을 정렬합니다. 손실 함수가 실제로 무엇을 하는지, 데이터를 어떻게 만들고 β를 어떻게 잡는지, 그리고 손실이 내려가는데 답이 나빠지는 상황을 어떻게 알아채는지 정리합니다.

모델 운영2026.08.2712 MIN

비용과 품질의 저울 — 어디까지 싸게 만들 것인가

품질을 1점 올리는 데 얼마가 드는지 재지 않으면 저울질을 할 수 없습니다. 파레토 프론티어로 후보를 거르는 법, 비용을 움직이는 레버들, 그리고 계단식 라우팅이 실제로 얼마를 아끼는지 계산해 봅니다.

모델 운영2026.08.2713 MIN

온라인 A/B 테스트 — 오프라인 점수가 답하지 못하는 것

오프라인 평가는 대리 지표라서 실제 사용자 행동과 어긋날 수 있습니다. 지표를 세 층으로 나누는 법, 표본 크기를 미리 정하는 법, 그리고 중간에 들여다보는 것이 왜 결론을 망치는지 정리합니다.

모델 운영2026.08.2713 MIN

에이전트 궤적 평가 — 답이 맞아도 과정이 틀릴 수 있다

에이전트는 답 하나가 아니라 여러 걸음을 남깁니다. 최종 정답률만 보면 놓치는 것과, 도구 호출·단계 수·복구 여부를 어떻게 지표로 만들어 실패를 고칠 수 있는 이름으로 나눌지 정리합니다.