LLM·트랜스포머

LLM / 49번째 글

작은 모델이 다시 쓸 만해진 이유

10억에서 100억 파라미터 사이의 모델이 다시 실무에 들어오고 있습니다. 무엇이 달라졌는지, 메모리는 어떻게 계산하는지, 무엇을 잘하고 무엇을 못하는지 정리합니다.

PALDYN Team10 MIN READ

몇 해 전만 해도 "작은 모델"은 큰 모델을 살 수 없을 때의 차선책이라는 뜻에 가까웠다. 지금은 상황이 다르다. 10억에서 100억 파라미터 사이의 모델들이 특정한 일에서는 충분히 쓸 만한 답을 내고, 그 일이 실무에서 차지하는 비중이 생각보다 크다는 것이 드러났다.

여기서 말하는 작은 모델은 성능이 낮은 모델이 아니라 크기 때문에 다른 자리에서 돌 수 있는 모델이다. 그 자리가 어디이고 무엇이 바뀌어 여기까지 왔는지를 정리해 본다.

작다는 것은 어느 정도인가

크기를 나누는 절대적 기준은 없지만, 실무에서는 "어디서 돌릴 수 있는가"로 구간이 갈린다.

파라미터 구간별로 도는 자리와 맡는 일

메모리 계산은 어렵지 않다. 파라미터 수를 PP, 파라미터 하나당 바이트를 bb라 하면 가중치가 차지하는 크기는 대략 이렇다.

M가중치≈P×bM_{\text{가중치}} \approx P \times b

16비트면 b=2b=2, 8비트면 1, 4비트면 0.5다. 즉 70억 파라미터 모델은 16비트로 14GB, 4비트로 3.5GB 정도가 된다. 소비자용 그래픽 카드 한 장이나 통합 메모리를 쓰는 노트북에 들어가는 크기다.

그런데 이 값이 전부가 아니다. 추론 중에는 지금까지 본 토큰의 키·값이 메모리에 남는다.

MKV≈2×L×Hkv×dh×S×bkvM_{\text{KV}} \approx 2 \times L \times H_{kv} \times d_h \times S \times b_{kv}

LL은 층 수, HkvH_{kv}는 키·값 헤드 수, dhd_h는 헤드 차원, SS는 문맥 길이다. 여기서 중요한 것은 SS에 비례한다는 점이다. 가중치가 들어간다고 끝이 아니라 긴 문맥을 넣으면 그만큼 더 필요하다. 작은 모델을 노트북에 올렸는데 문맥을 길게 주자 갑자기 느려지는 일이 이래서 생긴다.

무엇이 달라졌는가

같은 크기의 모델이 몇 해 전보다 훨씬 나아진 데는 서너 가지 이유가 겹쳐 있다.

학습 데이터의 질. 웹을 긁어모은 것을 그대로 쓰던 시기가 지나고, 걸러 내고 다시 쓰고 교과서처럼 정리한 데이터로 학습하는 방식이 자리 잡았다. 파라미터가 적을수록 데이터 품질의 영향이 크다 — 담을 수 있는 양이 적으니 무엇을 담느냐가 더 중요해진다.

큰 모델로부터의 증류. 큰 모델이 만든 답과 풀이 과정을 작은 모델의 학습 데이터로 쓴다. 사람이 쓴 정답만으로 배우는 것보다 훨씬 촘촘한 신호를 받는다. 지금 나오는 작은 모델 상당수가 이 방식으로 만들어진다.

더 오래 학습하기. 파라미터 수에 비해 데이터를 훨씬 많이 넣는 쪽이 추론 비용 관점에서 유리하다는 것이 분명해졌다. 학습은 한 번이고 추론은 수억 번이므로, 학습을 길게 해서 작은 모델을 좋게 만드는 편이 총비용에서 이긴다.

양자화와 실행기의 발전. 4비트로 줄여도 품질 손실이 작은 기법들이 자리 잡았고, 노트북과 휴대폰에서 이를 실제로 돌리는 실행기가 성숙했다. 크기를 3분의 1로 줄이는 일이 예전만큼 위험하지 않다.

잘하는 일과 못하는 일

작은 모델의 능력은 고르게 낮아진 것이 아니라 특정 종류의 일에서만 크게 떨어진다. 이 구분이 실무 판단의 거의 전부다.

잘하는 일 왜 되는가
분류·라벨링 답의 공간이 좁고 판단이 국소적이다
정해진 형식으로 추출 문서에 답이 그대로 있다
짧은 요약·다시 쓰기 새 지식이 필요 없다
의도 파악과 라우팅 한 문장만 보면 된다
정해진 도구 고르기 후보가 목록으로 주어진다
못하는 일 왜 안 되는가
여러 단계 추론 중간에 한 번 어긋나면 회복하지 못한다
넓은 세상 지식 파라미터에 담긴 사실의 양이 적다
긴 문서 전체를 아우르는 판단 문맥이 길어질수록 놓치는 폭이 크다
애매한 지시의 해석 빈틈을 메우는 능력이 약하다
스스로 계획 세우기 목표를 단계로 쪼개는 데서 무너진다

두 표를 나란히 놓으면 규칙 하나가 보인다. 밖에서 주어지는 정보가 많고 답의 형태가 정해져 있을수록 작은 모델로 충분하다. 반대로 모델이 스스로 채워야 할 것이 많을수록 격차가 벌어진다.

지식 부족은 검색으로 상당 부분 메울 수 있다는 점도 중요하다. 작은 모델이 사실을 모르는 것은 문제지만, 근거 문서를 넣어 주고 "여기서 답하라"고 하면 사정이 달라진다. 그래서 작은 모델과 검색은 궁합이 좋다.

실제로 쓰이는 자리

작은 모델이 큰 모델을 대체하는 그림보다는, 큰 모델이 하던 일 중 일부를 떼어 가는 그림이 실제에 가깝다.

  • 전처리와 분류. 들어온 요청이 어떤 갈래인지 가르고, 개인정보가 섞였는지 보고, 언어를 감지한다. 요청마다 반드시 도는 자리라 단가가 그대로 총비용이 된다.
  • 대량 일괄 처리. 문서 수십만 건에 태그를 붙이거나 표를 뽑는 일. 건당 품질 차이가 작고 건수가 많아 비용 차이가 결정적이다.
  • 기기 안에서 도는 기능. 자동 완성, 문장 다듬기, 화면 요약처럼 네트워크 없이 즉시 반응해야 하는 것들. 지연과 개인정보 두 이유가 함께 작동한다.
  • 초안 만들기. 작은 모델이 먼저 초안을 내고 큰 모델이 다듬거나 검증한다.

넷 다 공통점이 있다. 한 번의 실패가 치명적이지 않고, 실패를 알아챌 방법이 있다.

고를 때 실제로 보는 것

크기와 벤치마크 점수만 보고 고르면 대개 나중에 막힌다. 실무에서 먼저 확인할 것은 따로 있다.

항목 확인하는 이유
라이선스 상업적 사용과 재배포 조건이 모델마다 다르다
실제 문맥 길이 표기된 길이와 쓸 만한 길이가 다르다
도구 호출 지원 학습되지 않은 모델은 형식을 자주 어긴다
한국어 성능 영어 점수와 별개다. 직접 재야 안다
양자화된 배포본 없으면 직접 만들어야 하고 품질 확인도 필요하다

마지막 줄을 덧붙이면, 작은 모델은 종류가 많고 빨리 바뀐다. 특정 모델에 코드를 묶어 두기보다 바꿔 끼울 수 있는 구조로 두고, 자기 데이터로 만든 평가 묶음을 갖고 있는 편이 낫다. 새 모델이 나왔을 때 반나절이면 답이 나온다.

작은 모델을 쓸지 말지는 결국 하나의 질문으로 좁혀진다 — 이 일이 앞의 표에서 어느 쪽에 있는가. 다음 글에서는 그 판단을 비용·지연·품질 세 축으로 놓고 어디까지 내려도 되는지를 따져 본다.


읽어주셔서 감사합니다. 😊

LATEST

LLM·트랜스포머의 최신 글

LLM·트랜스포머2026.08.14

작은 모델을 우리 일에 맞추는 법

파인튜닝이 실제로 고치는 것은 지식이 아니라 행동입니다. 데이터 몇 건이 필요한지, LoRA가 무엇을 바꾸는지, 학습 전에 무엇을 먼저 만들어야 하는지를 정리합니다.

15 MIN
LLM·트랜스포머2026.08.06

문법으로 출력을 제약하기

JSON Schema로는 표현되지 않는 출력 형태를 문맥자유문법으로 강제하는 방법, GBNF 문법을 쓸 때 자주 걸리는 좌재귀·공백·모호성 문제, 그리고 카탈로그에서 문법을 생성하는 실무 형태를 정리합니다.

11 MIN
LLM·트랜스포머2026.08.06

제약 디코딩: 스키마가 토큰을 막는 방식

로짓 마스킹과 오토마톤 상태 전이로 스키마를 강제하는 원리, 토크나이저 경계 때문에 생기는 어려움, 컴파일·캐시 비용, 그리고 제약이 출력 품질을 오히려 떨어뜨리는 경우를 정리합니다.

12 MIN