RESULT / 51

LLM·트랜스포머2026.08.1415 MIN

작은 모델을 우리 일에 맞추는 법

파인튜닝이 실제로 고치는 것은 지식이 아니라 행동입니다. 데이터 몇 건이 필요한지, LoRA가 무엇을 바꾸는지, 학습 전에 무엇을 먼저 만들어야 하는지를 정리합니다.

LLM·트랜스포머2026.08.1310 MIN

작은 모델로 내려도 되는지 판단하는 법

비용·지연·품질은 같은 방향으로 움직이지 않습니다. 폴백을 붙였을 때의 손익분기, 격차가 벌어지는 작업 유형, 그리고 내리기 전에 통과해야 할 네 관문을 정리합니다.

LLM·트랜스포머2026.08.1310 MIN

작은 모델이 다시 쓸 만해진 이유

10억에서 100억 파라미터 사이의 모델이 다시 실무에 들어오고 있습니다. 무엇이 달라졌는지, 메모리는 어떻게 계산하는지, 무엇을 잘하고 무엇을 못하는지 정리합니다.

LLM·트랜스포머2026.08.0611 MIN

형태는 맞는데 값이 틀릴 때

스키마를 통과한 출력에서 남는 의미 오류를 잡는 네 층의 검증, 오류를 되먹여 재시도하는 방법과 그 상한, 근거 인용을 스키마에 심어 자동 대조를 가능하게 하는 설계를 정리합니다.

LLM·트랜스포머2026.08.0611 MIN

문법으로 출력을 제약하기

JSON Schema로는 표현되지 않는 출력 형태를 문맥자유문법으로 강제하는 방법, GBNF 문법을 쓸 때 자주 걸리는 좌재귀·공백·모호성 문제, 그리고 카탈로그에서 문법을 생성하는 실무 형태를 정리합니다.

LLM·트랜스포머2026.08.0612 MIN

제약 디코딩: 스키마가 토큰을 막는 방식

로짓 마스킹과 오토마톤 상태 전이로 스키마를 강제하는 원리, 토크나이저 경계 때문에 생기는 어려움, 컴파일·캐시 비용, 그리고 제약이 출력 품질을 오히려 떨어뜨리는 경우를 정리합니다.

LLM·트랜스포머2026.08.0612 MIN

JSON Schema로 출력 형태를 못 박기

구조화 출력에서 실제로 강제되는 JSON Schema 키워드와 조용히 무시되는 키워드를 구분하고, description·enum·필드 순서·중첩 깊이를 어떻게 설계해야 모델이 덜 틀리는지 정리합니다.

LLM·트랜스포머2026.08.0613 MIN

구조화 출력: 모델의 답을 프로그램이 쓸 수 있는 형태로

프롬프트로 JSON을 부탁하는 것, JSON 모드, 스키마 강제 세 가지가 각각 무엇을 보장하고 무엇을 보장하지 않는지, 그리고 어느 단계에서도 사라지지 않는 실패가 무엇인지 정리합니다.

LLM·트랜스포머2026.08.0511 MIN

추론 모델을 언제 쓸 것인가

정답 검증 가능성, 실패율, 지연 예산 세 가지로 추론 모델 도입을 판단하는 기준과, 추론 모델이 오히려 손해인 작업 유형, 그리고 트래픽을 등급으로 나눠 붙이는 실무 형태를 정리합니다.

LLM·트랜스포머2026.08.0511 MIN

추론 모델의 비용과 지연을 다루는 법

사고 토큰이 요청 단가와 지연을 어떻게 바꾸는지 식으로 정리하고, 침묵 구간·꼬리 지연·캐시 무효화처럼 추론 모델에서만 생기는 운영 문제와 그 대응책을 다룹니다.

LLM·트랜스포머2026.08.0511 MIN

추론 벤치마크 읽는 법

공개 추론 벤치마크 점수가 왜 시간이 지날수록 능력보다 노출량을 반영하게 되는지, 오염과 포화를 어떻게 알아채는지, 그리고 도입 판단에 쓸 자체 평가를 어떻게 세우는지 정리합니다.

LLM·트랜스포머2026.08.0513 MIN

추론 증류: 큰 모델의 사고를 작은 모델에 옮긴다

교사 모델의 사고 궤적을 모아 작은 모델을 학습시키는 방법과, 정답 필터가 왜 품질의 대부분을 결정하는지, 그리고 증류로 넘어가지 않는 능력이 무엇인지 정리합니다.

LLM·트랜스포머2026.08.0513 MIN

추론 모델과 CoT 프롬프팅: 같은 사고, 다른 자리

"단계별로 생각해 봐"를 붙이는 것과 추론 모델을 쓰는 것은 무엇이 다른지, 둘을 겹치면 왜 손해가 나는지, 그리고 어느 쪽을 골라야 하는지를 비용·품질 기준으로 정리합니다.

LLM·트랜스포머2026.07.2914 MIN

사고 예산 제어: 얼마나 생각하게 할 것인가

사고 예산과 출력 상한의 관계, 난도에 따른 적응형 예산 배분, 예산 소진으로 답변이 잘리는 실패 모드와 그 방어책을 실무 코드와 운영 지표 중심으로 정리합니다.

LLM·트랜스포머2026.07.2916 MIN

검증자 모델: 답을 고르는 눈을 따로 기른다

규칙 검증기, 결과 보상 모델(ORM), 과정 보상 모델(PRM), 자기 검증의 특성과 한계를 비교하고, 여러 후보 중 정답을 골라내는 검증 계층을 실무에서 어떻게 구성할지 코드와 함께 정리합니다.

LLM·트랜스포머2026.07.2915 MIN

테스트 타임 컴퓨트: 추론 시점에 계산을 더 쓴다는 것

병렬 샘플링, 순차 수정, 트리 탐색으로 추론 시점 컴퓨트를 늘리는 방법과 각각의 비용·지연 특성, 그리고 수확 체감이 시작되는 지점을 실전 코드와 함께 정리합니다.

LLM·트랜스포머2026.07.2914 MIN

추론 모델은 무엇이 다른가: 사고 토큰과 그 청구서

추론 모델이 일반 LLM과 구조적으로 어떻게 다른지, 사고 토큰이 정확도와 비용에 어떤 영향을 주는지, 그리고 어떤 작업에서만 그 대가가 회수되는지 실무 기준으로 정리합니다.

LLM·트랜스포머2026.05.1211 MIN

LLM 벤치마크 완전 해부: MMLU, HumanEval, LMSYS Chatbot Arena

MMLU·HumanEval·SWE-bench·LMSYS Chatbot Arena 등 주요 LLM 벤치마크의 측정 방법, 한계, 벤치마크 해킹 문제, 그리고 실무에서 모델을 올바르게 비교하는 방법을 한국어로 완전 해설한다.

LLM·트랜스포머2026.05.129 MIN

한국 LLM 완전 해부: EXAONE, HyperCLOVA X, SOLAR

HyperCLOVA X, EXAONE, SOLAR 등 한국 LLM의 기술적 특징, 한국어 토크나이저의 효율성, 벤치마크 비교, API 사용법, 그리고 한국어 AI 서비스 구축 실전 가이드를 완전 해설한다.

LLM·트랜스포머2026.05.1242 MIN

오픈 웨이트 도전자들: Mistral, Qwen, DeepSeek

가중치를 열어 프런티어를 쫓은 세 팀을 한자리에 놓는다. 슬라이딩 윈도우와 MLA가 어텐션 비용을 깎는 방식, MoE가 46.7B와 671B에서 되풀이하는 같은 셈, DeepSeek-R1이 정답 여부라는 보상 하나로 추론을 얻은 과정을 숫자로 따라간다.

LLM·트랜스포머2026.05.129 MIN

LLaMA 패밀리 완전 해부: 오픈소스 LLM 혁명

Meta LLaMA 시리즈의 탄생 배경, LLaMA 1·2·3 버전별 혁신, 오픈소스 생태계(Vicuna·Alpaca·Code Llama), 로컬 실행 방법(Ollama·llama.cpp), 그리고 상업 모델과의 실전 비교를 한국어로 완전 해설한다.

LLM·트랜스포머2026.05.1210 MIN

Gemini 패밀리 완전 해부: Google의 멀티모달 LLM 전략

Google Gemini 시리즈의 탄생 배경, Ultra·Pro·Flash·Nano 티어 구조, 1M 토큰 컨텍스트, 멀티모달 네이티브 설계, Gemini 2.0의 실시간 처리 능력, 그리고 Google AI Studio API 사용법을 한국어로 완전 해설한다.