오프라인 강화학습 — 쌓인 로그만으로 정책을 배우기
실제 서비스에서 탐색은 곧 사용자에게 나쁜 행동을 해 보는 일입니다. 이미 쌓인 로그만으로 정책을 배우려 할 때 왜 Q값이 혼자 부풀어 오르는지, 그 부풀음을 누르는 세 갈래 대응, 행동 복제라는 기준선의 무게, 그리고 배포 전에 성능을 재는 일이 왜 가장 어려운지를 정리합니다.
PALDYN LEARN
AI가 어떻게 작동하는지 배웁니다. 모델의 원리부터 그 아래를 떠받치는 수학, 실제로 굴리는 방법까지.
실제 서비스에서 탐색은 곧 사용자에게 나쁜 행동을 해 보는 일입니다. 이미 쌓인 로그만으로 정책을 배우려 할 때 왜 Q값이 혼자 부풀어 오르는지, 그 부풀음을 누르는 세 갈래 대응, 행동 복제라는 기준선의 무게, 그리고 배포 전에 성능을 재는 일이 왜 가장 어려운지를 정리합니다.
영어 라벨만으로 학습한 분류기가 한국어 문장을 그대로 처리하는 일이 실제로 일어납니다. 여러 언어가 한 표현 공간에 겹쳐 놓이는 원리, 그 겹침이 무너지는 조건, 번역해서 학습할지 번역해서 추론할지 고르는 기준, 그리고 언어별로 나눠 재야 하는 이유를 정리합니다.
계약서와 이메일을 데이터베이스에 넣으려면 글에서 값을 뽑아 칸에 채워야 합니다. 개체명·관계·사건의 세 층위, 값을 정규화하는 일이 왜 절반인지, 근거 위치를 함께 남겨야 하는 이유, 규칙·전용 모델·언어 모델의 갈림길, 그리고 필드별로 재는 평가법을 정리합니다.
소리를 글자로 바꿨다가 다시 소리로 만드는 경로는 억양과 감정을 가운데서 버립니다. 소리를 곧바로 소리로 옮기는 방식이 무엇을 얻고 무엇을 포기하는지, 소리를 토큰으로 다루는 원리, 목소리를 그대로 옮길 때의 위험, 그리고 평가가 왜 어려운지를 정리합니다.
회의 녹음을 글로 옮기면 누가 한 말인지가 사라집니다. 화자 분리가 푸는 문제와 네 걸음짜리 처리 과정, 겹쳐 말한 구간이 왜 가장 어려운지, DER이라는 지표가 무엇을 세는지, 그리고 음성 인식과 붙일 때 실제로 부딪히는 자리를 정리합니다.
사진 한 장에서 거리 지도를 얻는 단안 깊이 추정을 정리합니다. 왜 크기와 거리가 함께 정해지지 않는지, 순서·배율 미상·미터 단위 세 종류의 출력이 어떻게 다른지, 시차와 깊이의 역수 관계, 미터로 올리는 방법, 그리고 자주 무너지는 자리를 다룹니다.
사람의 관절 자리를 찾아 동작을 다루는 자세 추정을 정리합니다. 키포인트가 무엇을 담는지, 사람부터 찾는 경로와 관절부터 찾는 경로의 차이, 히트맵과 좌표 회귀, 2D에서 3D로 갈 때의 근본적 모호함, 그리고 실무에서 튀는 자리를 다룹니다.
클래스 목록 없이 점·상자·텍스트로 「이것」을 지시해 마스크를 얻는 분할 모델을 정리합니다. 무거운 인코더를 한 번만 돌리는 구조, 점 하나가 만드는 모호함과 그 대응, 영상으로 넓힐 때 생기는 문제, 그리고 실무에서 밟는 함정을 다룹니다.
이미지 속 한 지점을 말로 가리키고 좌표로 답받는 일을 정리합니다. 지시 표현·구절 그라운딩·영역 설명 세 갈래, 모델이 좌표를 내는 세 가지 방식, 리사이즈와 여백 때문에 좌표가 어긋나는 자리, 그리고 자주 밟는 실패 유형을 다룹니다.
입력만 여러 모달리티를 받던 모델이 출력까지 열리면 무엇이 달라지는지 정리합니다. 모든 모달리티를 토큰으로 바꾸는 방법, 출력이 입력보다 훨씬 어려운 이유, 조립형 대비 무엇을 얻고 무엇을 잃는지, 그리고 언제 이 구조를 고르는지를 다룹니다.
음성 대화를 붙일 때 실제로 다루게 되는 것은 지연 예산과 상태 관리입니다. ASR·LLM·TTS 3단 구성과 통합 음성 모델의 차이, 말이 끝났다고 판정하는 문제, 끼어들기가 왜 단순한 멈춤이 아닌지, 그리고 스트리밍 중 도구 호출을 다루는 법을 정리합니다.
텍스트 검출과 문자 인식으로 나뉘던 OCR이 VLM 한 번으로 끝나기까지의 지형을 정리합니다. 두 방식이 각각 무엇을 잘하고 무엇을 못 하는지, 한글에서 특히 어려운 것, CER과 필드 완전 일치율의 차이, 그리고 둘을 겹쳐 쓰는 실무 구성입니다.
원하는 그림이 안 나올 때 무엇을 어떤 순서로 만져야 하는지 정리합니다. 시드와 재현성, CFG·steps·샘플러가 실제로 하는 일, ControlNet과 마스크로 형태를 고정하는 법, LoRA까지 가는 기준, 그리고 한 번에 하나만 바꿔 보는 실험 방법입니다.
영상을 모델에 넣을 때 실제로 정하는 것은 프레임 샘플링과 토큰 예산입니다. 균등 샘플링이 놓치는 것, 시간 정보를 어떻게 남기는지, 긴 영상을 두 번에 나눠 보는 구조, 오디오 트랙을 함께 쓰는 법, 그리고 근거 시각까지 내는 평가를 정리합니다.
차트 이미지와 복잡한 표에서 값을 뽑아낼 때 무엇이 왜 틀리는지 정리합니다. 축과 범례를 읽는 문제, 계층 머리를 가진 표가 한 줄로 펴질 때 생기는 손실, 그림에 바로 묻기와 값으로 되돌리기의 갈림, 그리고 상대 오차로 재는 평가입니다.
긴 문맥에서 GPU 메모리를 실제로 잡아먹는 것은 가중치가 아니라 KV 캐시입니다. 캐시 크기를 계산하는 법, K와 V를 다르게 다뤄야 하는 이유, 어디까지 줄여도 되는지를 정리합니다.
양자화에서 스케일을 정하는 절차가 보정입니다. 무엇을 재는지, 데이터를 어디서 몇 개 뽑아야 하는지, 자르는 지점을 어떻게 고르는지, 그리고 잘못된 보정이 어떤 모양으로 드러나는지를 정리합니다.
계약서·세금계산서·보고서에서 값을 뽑아내는 일의 실제 난점을 정리합니다. 읽는 차례, 표의 구조, 전통 파이프라인과 VLM의 갈림, 그리고 값과 함께 근거 좌표를 뽑아 사람 검수를 가능하게 만드는 방법입니다.
글만 있는 문서가 아니라 도표·사진·스캔이 섞인 자료를 검색해 답하게 만드는 구성입니다. 그림을 색인에 넣는 세 가지 길, 색인 형태와 생성 형태를 나누는 이유, 새로 생기는 실패 방식을 정리합니다.
말로 주고받는 AI 에이전트를 만들 때 실제로 어려운 것은 모델이 아니라 시간 관리입니다. 이어 붙인 구성과 음성 대 음성 모델의 차이, 발화 끝 판단, 끼어들기 처리, 도구 호출 중의 침묵을 정리합니다.
범용 성능이 아니라 우리 과제 하나만 잘하는 작은 모델을 만드는 방법입니다. 교사에게 무엇을 받아야 하는지, 데이터를 어떻게 모으고 거르는지, 손익 분기가 어디인지를 정리합니다.
희소도 50%를 만들어도 추론이 안 빨라지는 이유를 짚고, 행·헤드·채널 단위로 덜어 내는 구조적 가지치기가 무엇을 어떻게 바꾸는지, 중요도를 어떻게 매기고 얼마나 회복시킬 수 있는지 정리합니다.
휴대폰과 산업용 기기의 NPU에 모델을 올리는 일이 GPU 배포와 어떻게 다른지 정리합니다. 미리 컴파일해야 하는 이유, 연산자 지원에서 막히는 지점, 그리고 NPU가 실제로 이기는 자리를 다룹니다.
설치 없이 웹 페이지 안에서 언어 모델을 돌리는 구조를 정리합니다. 첫 방문의 내려받기와 셰이더 컴파일, 버퍼 한계라는 진짜 벽, 그리고 어떤 서비스에 이 방식이 맞는지 다룹니다.