AI 기초

GUIDE / 4번째 글

기호주의에서 데이터 중심으로: AI가 지식을 얻는 방식이 바뀐 70년

사람이 규칙을 쓰던 기호주의 AI에서 데이터가 규칙을 만드는 통계적 AI로 넘어온 과정을 따라가고, 그 전환이 왜 데이터 플라이휠·스케일링 법칙·데이터 품질 경쟁으로 이어졌는지, 두 패러다임이 LLM 안에서 어떻게 다시 만나는지 정리한다.

PALDYN Team48 MIN READ

지난 글에서 AI를 할 수 있는 일의 폭과 맡은 기능을 기준으로 Narrow·General·Super 세 층으로 갈랐다. 그 분류는 AI를 밖에서 본 것이다. 이 글은 안으로 들어간다 — 기계가 무엇인가를 「안다」고 할 때 그 지식은 어디서 오는가. 이 물음에 두 진영이 정반대의 답을 냈고, 그 대결의 결과가 오늘 AI가 만들어지는 방식을 그대로 정했다.

답은 둘뿐이다. 사람이 아는 것을 규칙으로 적어 넣거나, 데이터를 잔뜩 주고 기계가 규칙을 스스로 찾게 하거나. 앞쪽이 기호주의 AI이고 뒤쪽이 통계적 AI다. 70년 가까이 이어진 이 대결은 뒤쪽의 승리로 기울었는데, 이긴 이유가 알고리즘이 아니라 데이터였다는 점이 이 글의 뼈대다. 데이터가 규칙을 만드는 시대가 되자 경쟁의 자리도 데이터로 옮겨 갔고, 데이터의 양·품질·독점이 곧 모델의 힘이 됐다. 그리고 그 끝에서 두 패러다임은 LLM 안에서 다시 만난다.

기호주의 AI

기호 조작 가설

기호주의 AI(Symbolic AI)는 인간의 지능이 기호를 조작하는 능력이고, 그 조작은 규칙으로 명시적으로 적을 수 있다는 가설 위에 선 패러다임이다. 여기서 기호(symbol)는 「톰」·「부모」·「스팸」처럼 세상의 무엇인가를 가리키는 이름표이고, 지능이란 이 이름표들을 논리 규칙에 따라 이어 붙이고 바꿔 쓰는 일이라는 것이다. 나중에 붙은 별명이 GOFAI(Good Old-Fashioned AI), 「좋았던 옛날 방식의 AI」다.

1956년 다트머스 회의에서 AI라는 이름이 붙은 뒤 수십 년간 이 가설이 연구의 주류였다. 체스 프로그램, 수학 정리를 스스로 증명하는 프로그램, 문장을 문법 규칙으로 분석하는 자연어 이해 시스템이 모두 이 줄기에서 나왔다. 지식이 규칙이라면 지식을 늘리는 일은 규칙을 더 적는 일이고, 그것은 사람이 할 수 있는 일이었다. 그 시절의 낙관은 여기서 나왔다.

Prolog와 전문가 시스템

이 패러다임이 어떻게 생겼는지는 논리 프로그래밍 언어 하나로 충분히 보인다. Prolog는 사실과 규칙을 적어 두면 질문에 대한 답을 논리적으로 도출해 주는 언어다.

% 사실(facts)
부모(톰, 밥).
부모(톰, 리즈).
부모(밥, 앤).

% 규칙(rule)
조부모(X, Z) :- 부모(X, Y), 부모(Y, Z).

% 질의
% ?- 조부모(톰, 앤).
% true

세 줄의 사실과 한 줄의 규칙이 지식의 전부다. 「X가 Y의 부모이고 Y가 Z의 부모이면 X는 Z의 조부모다」라는 규칙을 적어 두면, 「톰이 앤의 조부모인가」라는 질문에 시스템이 부모(톰, 밥)과 부모(밥, 앤)을 찾아 연결하고 참이라고 답한다. 아무 데이터도 학습하지 않았다. 사람이 적은 규칙을 기계가 실행했을 뿐이고, 그것이 곧 기호주의의 정의다.

같은 틀을 크게 키운 것이 전문가 시스템(expert system)이다. 특정 분야 전문가의 판단을 「이런 조건이면 이렇게 하라」는 if-then 규칙 수백~수천 개로 옮겨 적은 프로그램이다. 1970년대 스탠퍼드에서 만든 MYCIN은 세균 감염을 진단하고 항생제를 골라 주는 의료 전문가 시스템으로, 수백 개의 규칙으로 감염 전문의에 견줄 만한 판단을 내놓았다. 규칙을 적을 사람만 있으면 어느 분야든 이렇게 만들 수 있다는 것이 당시의 믿음이었다.

기호주의의 강점

기호주의의 가장 큰 강점은 설명 가능성(explainability), 곧 결과가 나온 이유를 단계별로 되짚을 수 있다는 성질이다. 「왜 이 이메일이 스팸인가」에 「발신자가 차단 목록에 있고 본문에 '무료 클릭' 패턴이 있어서」라고 답할 수 있다. 어느 규칙이 발화했는지 그대로 보여 주면 되고, 그 규칙은 사람이 적은 것이라 사람이 읽을 수 있다. 의료나 법률처럼 판단의 근거를 따져 물어야 하는 자리에서 이 성질은 장식이 아니라 요구 사항이다.

두 번째 강점은 데이터가 거의 필요 없다는 점이다. 규칙은 전문가의 머리에서 나오지 사례 더미에서 나오지 않는다. 사례가 열 개뿐인 희귀 질환도, 아직 한 번도 일어나지 않은 상황도 규칙으로는 적을 수 있다. 세 번째는 수정이 즉시 반영된다는 점이다. 규칙 하나를 고치면 그 순간부터 동작이 바뀌고, 무엇이 바뀌었는지도 정확히 안다. 재학습도 없고 검증 데이터도 없다.

이 세 성질은 뒤에서 볼 통계적 AI가 정확히 갖지 못한 것들이다. 그래서 기호주의는 졌지만 사라지지 않았다 — 이 글의 마지막 절에서 그 유산이 어디에 남아 있는지 다시 본다.

지식 획득 병목

치명적인 약점은 규칙을 누가 적는가에 있었다. 지식 획득 병목(knowledge acquisition bottleneck)은 전문가의 머릿속 지식을 규칙으로 꺼내 적는 일이 시스템을 만드는 전 과정에서 가장 느리고 비싼 단계가 되는 현상이다. 전문가는 자기가 어떻게 판단하는지를 말로 다 풀어내지 못하고, 규칙을 받아 적는 사람은 그 과정에서 빠뜨리고, 적어 놓은 규칙은 수천 개가 되면 서로 충돌한다. 규칙 A가 「열이 있으면 감염」이라 하고 규칙 B가 「백혈구가 정상이면 감염 아님」이라 할 때 둘 다 해당하는 환자에게 시스템은 무엇을 답해야 하는가. 예외를 규칙으로 덧대면 그 예외의 예외가 또 나온다.

더 근본적인 벽은 말로 적을 수 없는 지식이다. 「고양이 사진을 보고 고양이인지 판단하라」를 규칙으로 적어 보면 안다. 귀가 뾰족하다는 것을 픽셀로 어떻게 정의하는가. 옆에서 찍은 고양이, 웅크린 고양이, 절반이 가려진 고양이는 어떤 규칙에 걸리는가. 사람은 이 일을 아무 규칙 없이 해내지만, 자기가 어떻게 하는지는 설명하지 못한다. 규칙이 없는 곳에서 규칙을 적으라는 요구 자체가 성립하지 않았다.

불확실성도 논리의 약점이었다. 규칙은 참 아니면 거짓인데 세상은 「아마도」로 가득하다. 증상이 70% 확률로 이 병을 가리킨다는 것을 if-then으로 표현하려면 논리 밖의 장치를 덧붙여야 했고, 그 장치는 늘 임시방편이었다. 이 세 벽 — 규칙의 수, 적을 수 없는 지식, 불확실성 — 앞에서 기호주의 프로젝트들은 1980년대 말부터 차례로 멈췄다.

통계적 AI

패턴 학습

통계적 AI(Statistical AI)는 지식을 사람이 적어 넣는 대신, 충분한 데이터를 주고 컴퓨터가 그 안의 패턴을 스스로 찾게 하는 패러다임이다. 규칙이 없어진 것이 아니다. 규칙을 누가 만드는가가 바뀌었다. 기호주의에서는 사람이 규칙을 쓰고 기계가 실행했다면, 통계적 AI에서는 사람이 사례를 모으고 기계가 규칙을 찾는다. 찾아낸 규칙은 if-then 문장이 아니라 가중치 벡터나 확률 분포의 모양을 하고 있어서 사람이 읽기는 어렵지만, 그 대신 사람이 적을 수 없던 것까지 담긴다.

1990년대에 이 방향이 주류로 올라섰다. SVM(서포트 벡터 머신, 두 부류를 가장 넓은 여백으로 가르는 경계를 찾는 분류기), 나이브 베이즈(단어 하나하나가 어느 부류에서 더 자주 나오는지를 확률로 세어 합치는 분류기), 결정 트리(데이터에서 질문의 순서를 스스로 골라 가지를 치는 모델) 같은 알고리즘이 전문가 시스템보다 실제 문제에서 더 잘 작동했다. 이론이 더 아름다워서가 아니었다. 사람이 규칙을 적는 데 걸리는 시간보다 데이터를 모으는 시간이 짧아졌기 때문이다.

스팸 필터

같은 문제를 두 방식으로 풀어 나란히 놓으면 차이가 한눈에 들어온다. 이메일이 스팸인지 판단하는 필터를 만든다고 하자.

같은 문제, 다른 접근 방식

기호주의 쪽은 개발자가 규칙을 직접 적는다. 「본문에 '무료'와 '클릭'이 함께 있으면 스팸」, 「발신 도메인이 특정 국가면 스팸」 같은 조건문이 필터의 전부다. 첫날에는 잘 돌아간다. 문제는 둘째 주부터다. 스팸 발송자가 「무료」를 「무.료」로 바꾸면 규칙이 빗나가고, 정상 메일에 「무료 배송」이 들어 있으면 오탐이 난다. 고치는 방법은 규칙을 하나 더 적는 것뿐인데, 스팸 발송자는 그 규칙을 피하는 변형을 다음 날 또 만든다. 규칙을 적는 쪽은 늘 한 발 늦고, 필터는 스팸을 따라가는 것이지 앞서지 못한다.

통계적 쪽은 규칙을 한 줄도 적지 않는다. 스팸과 정상 메일을 레이블(label) — 사례마다 붙인 정답 표시 — 과 함께 모아 모델에 넣는다.

from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.linear_model import LogisticRegression

emails = ["무료 클릭하세요!", "내일 회의 일정 공유", ...]
labels = [1, 0, ...]                      # 1=스팸, 0=정상

vec = TfidfVectorizer()                   # 텍스트 → 단어 가중치 벡터
clf = LogisticRegression().fit(vec.fit_transform(emails), labels)

clf.predict(vec.transform(["당신이 당첨되었습니다! 지금 클릭하세요"]))  # [1]

여기서 TF-IDF는 어떤 단어가 그 문서에는 자주 나오지만 전체 문서에서는 드물수록 높은 값을 주는 가중치 방식이고, 로지스틱 회귀는 그 가중치들의 선형 결합을 0과 1 사이의 확률로 눌러 부류를 정하는 분류기다. 학습이 끝나면 모델은 「어떤 단어 조합이 스팸과 얼마나 연관되는가」를 수만 개의 가중치로 들고 있다. 그 가중치 어디에도 「무료」라는 규칙은 없지만, 「무료」와 「클릭」과 「당첨」이 함께 나오는 메일을 스팸으로 고르는 경계는 들어 있다. 「무.료」가 등장하면 규칙을 고치는 것이 아니라 그 사례를 데이터에 더하고 다시 학습한다.

관리 대상의 이동

두 코드의 차이를 한 줄로 줄이면 개발자가 관리하는 대상이 규칙에서 데이터로 바뀌었다는 것이다. 기호주의에서 시스템의 품질은 규칙의 품질이었고, 좋은 시스템을 만드는 일은 좋은 규칙을 쓰는 일이었다. 통계적 AI에서 시스템의 품질은 데이터의 품질이고, 좋은 시스템을 만드는 일은 좋은 데이터를 모으는 일이다. 뒤에서 데이터 이야기가 한 절씩 길어지는 이유가 이 한 줄에 있다.

이 방향의 극단이 딥러닝이다. 전통적 머신러닝은 여전히 사람이 특징(feature) — 모델에 넣을 수치 항목, 위 예에서는 단어별 TF-IDF 값 — 을 골라 줘야 했다. 딥러닝은 그 특징 추출까지 데이터에서 배운다. 원본 픽셀을 넣으면 「귀가 뾰족하다」에 해당하는 내부 표현을 층을 쌓으며 스스로 만든다. 앞 절에서 규칙으로 적을 수 없다고 했던 고양이 판별이 정확히 이 방식으로 풀렸다. 사람이 설명하지 못하는 지식을 데이터가 대신 적어 준 것이다.

대차대조표

기호주의 AI vs 통계적 AI

기호주의 AI 통계적 AI
지식의 출처 사람이 적은 규칙 데이터에서 찾은 패턴
지식의 모양 논리식·if-then·온톨로지 가중치 벡터·확률 분포
필요한 데이터 거의 없음 많을수록 좋음
설명 가능성 높음 — 발화한 규칙을 보인다 낮음 — 가중치는 읽을 수 없다
수정 규칙 한 줄, 즉시 반영 데이터 추가 후 재학습
약한 자리 적을 수 없는 지식, 불확실성 학습 분포 밖의 입력

표의 한 칸이 다른 칸의 거울이다. 한쪽의 강점이 곧 다른 쪽의 약점이고, 특히 마지막 줄이 중요하다. 통계적 AI는 학습 데이터가 덮은 영역 안에서는 사람보다 잘하지만, 그 영역 밖으로 한 발만 나가면 무엇이 틀렸는지도 모른 채 틀린다. 분포 외 입력(out-of-distribution input)은 학습 데이터에 없던 종류의 입력을 가리키는 말이고, 이 글 끝의 할루시네이션 이야기가 여기서 시작된다.

데이터의 규모

데이터 폭발

통계적 AI가 이긴 결정적 이유는 알고리즘의 우열이 아니다. 1990년대의 SVM과 2010년대의 심층 신경망은 원리로만 보면 수십 년 전에 이미 있던 아이디어다. 달라진 것은 데이터의 양이다. 인터넷이 문서를, 스마트폰이 사진과 위치와 클릭을, 소셜 미디어가 사람 사이의 관계를 매일 쏟아 냈다. 「충분한 데이터를 주면 기계가 패턴을 찾는다」는 발상은 오래됐지만 「충분한 데이터」가 실제로 존재하게 된 것은 이때부터다.

그러자 두 패러다임의 비용 구조가 뒤집혔다. 규칙을 적는 비용은 사람의 시간이라 데이터가 늘어도 줄지 않는다. 데이터에서 패턴을 찾는 비용은 데이터가 늘수록 사례당 비용이 떨어지고 결과는 좋아진다. 같은 문제에 같은 돈을 쓴다면 규칙을 적는 쪽이 매년 불리해지는 구조이고, 이 추세는 한 번 시작되자 돌아오지 않았다.

패러다임 스펙트럼

두 패러다임은 스위치처럼 켜고 끄는 것이 아니라 하나의 눈금 위에 있다. 눈금은 얼마나 많은 데이터를 먹고, 그 대신 얼마나 설명을 포기하는가다.

데이터 중심 패러다임의 스펙트럼

왼쪽 끝의 규칙 기반 시스템은 데이터가 거의 필요 없고 설명성이 가장 높다. 한 칸 오른쪽의 전통적 머신러닝 — 로지스틱 회귀, SVM, 결정 트리 여럿을 묶은 랜덤 포레스트 — 은 수천에서 수만 건의 레이블 데이터로 돌아가고 어느 특징이 결정에 얼마나 기여했는지 대략은 읽을 수 있다. 딥러닝은 수십만에서 수백만 건을 먹고 설명성을 거의 내준다. 그다음이 파운데이션 모델, 곧 특정 과제가 아니라 범용 데이터로 한 번 크게 사전학습해 두고 여러 과제에 갖다 쓰는 모델이고, 수십억 토큰을 읽는다. 오른쪽 끝의 대규모 LLM은 수조 토큰이다. 여기서 토큰은 모델이 텍스트를 읽는 단위로, 단어 하나가 대략 한두 토큰이다.

눈금을 오른쪽으로 옮길 때마다 데이터는 자릿수 단위로 늘고 설명은 한 단계씩 사라진다. 이것이 오늘 AI가 「왜 그렇게 답했는지 모르겠다」는 소리를 듣는 구조적 이유이고, 그 값을 치르고 산 것이 사람이 적지 못하던 지식이다. 트레이드오프이지 진보만은 아니다 — 데이터가 열 건뿐인 문제에 LLM을 갖다 대는 것은 눈금의 반대쪽 끝에 서야 할 문제에 잘못된 도구를 든 것이다.

스케일링 법칙

눈금의 오른쪽 끝을 향한 질주에 이론적 근거를 준 것이 2020년 OpenAI 연구팀이 발표한 스케일링 법칙(scaling laws)이다. 언어 모델의 손실이 모델 크기·데이터 규모·연산량 각각에 대해 멱함수(power law) — 변수를 일정 배로 늘리면 결과가 일정 비율로 변하는 관계 — 로 줄어든다는 실험적 발견이다. 데이터 규모 하나만 떼어 적으면 이런 모양이다.

L(D)≈(DcD)αDL(D) \approx \left(\frac{D_c}{D}\right)^{\alpha_D}

스케일링 법칙의 멱함수 곡선

LL 이 손실, DD 가 학습 토큰 수, DcD_c 와 αD\alpha_D 가 실험으로 맞춘 상수다. 지수 αD\alpha_D 가 1보다 훨씬 작은 값이라 데이터를 열 배로 늘려도 손실이 열 배로 줄지는 않는다 — 지수가 0.1이면 열 배 데이터에 손실이 약 20% 준다. 대신 그 20%가 예측 가능하다는 것이 핵심이다. 열 배를 더 넣으면 또 20%가 준다. 데이터 열 배, 파라미터 열 배, 연산 열 배가 각각 얼마를 돌려줄지 그래프에서 미리 읽을 수 있으니, 수천억 파라미터 모델에 막대한 예산을 쓰는 결정이 도박이 아니라 투자가 됐다. GPT-3 이후의 대형 모델들이 이 곡선을 근거로 세워졌다. 법칙 자체는 스케일링 법칙에서 따로 다뤘다.

Chinchilla

그러나 「데이터가 많을수록 좋다」가 「크면 클수록 좋다」로 미끄러지자 문제가 생겼다. 2022년 DeepMind의 Chinchilla 논문은 그때까지의 대형 LLM들이 모델 크기에 비해 데이터를 너무 적게 썼다는 결론을 냈다. 같은 연산 예산이라면 큰 모델을 적은 데이터로 학습하는 것보다 적당한 크기의 모델을 훨씬 많은 데이터로 학습하는 쪽이 더 낮은 손실에 닿는다는 것이다. 논문이 세운 700억 파라미터 모델이 네 배 큰 기존 모델을 앞섰고, 파라미터 하나에 토큰 스무 개쯤이 연산 대비 최적이라는 경험칙이 여기서 나왔다.

이 결과가 뜻하는 것은 스케일링 법칙의 부정이 아니라 세 축의 배분이다. 모델·데이터·연산 중 무엇을 먼저 늘려야 하는지는 정해져 있지 않았고, 답은 「데이터를 생각보다 훨씬 더」였다. 그래서 2022년 이후 경쟁의 병목은 파라미터가 아니라 학습에 쓸 만한 토큰을 얼마나 확보하는가로 옮겨 갔다. 위의 스펙트럼 그림이 오른쪽 끝에 「수확 체감 구간」과 「한계 논쟁」을 적어 둔 것도 같은 맥락이다 — 인터넷의 좋은 텍스트는 유한하고, 그것을 다 읽고 나면 다음 열 배는 어디서 오는가. 그 물음이 다음 두 절의 주제다. 논문의 수치를 직접 뜯어본 기록은 Chinchilla 정독에 있다.

데이터 자산

새로운 석유

「데이터가 새로운 석유다」라는 말은 2006년 수학자 클라이브 험비(Clive Humby)가 처음 썼다. 그때의 뜻은 정제였다. 원유는 땅에서 퍼낸 그대로는 쓸 수 없고 정제해야 연료가 되듯, 날것의 데이터도 처리하고 분석해야 가치가 생긴다는 비유였다. 지금도 맞는 말이지만 현대 AI에서는 비유의 무게가 다른 쪽으로 옮겨 갔다.

두 번째 뜻은 독점이다. 석유 회사의 경쟁력이 유전의 위치와 규모에서 나오듯, AI 기업의 경쟁력은 남이 갖지 못한 고품질 데이터 자산에서 나온다. 구글은 전 세계의 검색 패턴을, 메타는 수십억 명이 서로 어떻게 이어져 있는지를 담은 소셜 그래프를, 틱톡은 수십억 건의 시청 행동을 갖고 있다. 이 데이터는 돈으로 살 수 없다. 경쟁사가 아무리 많은 예산을 들여도 같은 규모의 사용자를 같은 기간 동안 관찰하지 않고는 만들어지지 않기 때문이다. 앞 절에서 규칙이 데이터에 졌다고 했는데, 그 결과 유전을 가진 회사와 못 가진 회사가 갈렸다.

데이터 플라이휠

이 독점이 스스로 커지는 구조를 데이터 플라이휠(data flywheel)이라 부른다. 플라이휠은 한 번 돌기 시작하면 관성으로 계속 도는 무거운 바퀴이고, 데이터 중심 패러다임에서 가장 중요한 경제적 개념이다.

데이터 플라이휠 효과

바퀴는 다섯 칸으로 돈다. 더 많은 사용자가 서비스를 쓰고, 사용 로그와 피드백이 쌓이고, 그 데이터로 모델을 다시 학습하고, 추천 정확도나 답변 품질이 좋아지고, 그 차이가 다른 서비스에 대한 경쟁 우위가 된다. 그리고 그 우위가 다시 더 많은 사용자를 끌어와 첫 칸으로 돌아간다. 어느 칸에서 시작하든 한 바퀴를 돌면 출발점이 앞으로 가 있다. 각 칸의 이득은 작아도 곱해지면서 쌓이고, 그래서 선두와 후발의 격차는 시간이 갈수록 좁혀지지 않고 벌어진다.

ChatGPT가 2022년 말에 나온 뒤 벌어진 일이 그대로 이것이다. OpenAI가 수억 명의 사용자와 주고받은 대화 — 어떤 질문이 들어오고, 어떤 답에 사람이 만족하고, 어떤 답을 고쳐 달라고 하는지 — 를 쌓는 동안, 경쟁사는 그 데이터 없이 모델을 개선해야 했다. 모델 아키텍처는 논문으로 따라잡을 수 있지만 수억 명이 남긴 피드백은 논문에 없다.

후발 주자의 진입로

플라이휠이 도는 시장에 뒤늦게 들어온 쪽은 어디서 시작하는가. 답은 대개 셋 중 하나다. 남이 못 가진 다른 유전을 찾거나 — 특정 산업의 내부 문서, 특정 언어의 말뭉치, 특정 기기의 센서 데이터 — 공개된 데이터를 남보다 더 잘 정제하거나, 데이터를 만들어 내거나다. 첫째는 사업의 문제이고 둘째와 셋째는 엔지니어링의 문제인데, 다음 절이 그 둘을 다룬다.

여기서 한 가지를 짚어 둔다. 플라이휠은 「많이 모으면 이긴다」는 뜻이 아니다. 그림의 아래쪽에 적힌 경고가 그것이다 — 바퀴를 돌리는 것은 데이터의 양이 아니라 쓸 만한 데이터의 양이고, 쓸모없는 로그가 아무리 쌓여도 모델은 좋아지지 않는다. 양의 경쟁은 곧 품질의 경쟁이 된다.

데이터 품질

GIGO 원칙

GIGO(Garbage In, Garbage Out)는 나쁜 데이터를 넣으면 아무리 좋은 모델이라도 나쁜 결과를 낸다는 오래된 원칙이다. 통계적 AI에서는 이 말이 비유가 아니라 기계적 사실이다. 모델은 데이터에서 규칙을 찾으므로 데이터에 틀린 것이 있으면 틀린 규칙을 찾는다. 사람이 적은 규칙은 읽어 보면 틀린 것이 보이지만, 데이터가 만든 규칙은 가중치 속에 숨어 있어서 무엇이 잘못 배워졌는지 밖에서 알 수 없다.

나쁜 데이터는 보통 세 얼굴로 온다. 레이블 오류는 정상 메일에 스팸 표시가 붙어 있는 것이다 — 모델은 그 메일의 특징을 스팸의 특징으로 배운다. 결측치는 값이 비어 있는 칸이다 — 비어 있는 이유가 무작위가 아니라면(특정 병원만 어떤 검사를 안 한다든지) 그 빈칸 자체가 잘못된 신호가 된다. 편향은 데이터가 세상의 일부만 담고 있는 것이다 — 낮에 찍은 사진만 있으면 밤에 찍은 고양이는 고양이가 아니다. 세 가지 모두 같은 모델, 같은 코드로 학습해도 결과를 완전히 바꾼다. 사례가 열 건뿐인 표에서 레이블 하나가 뒤집히면 그 표로 그은 경계선 자체가 옮겨 간다. 수억 줄에서는 어느 줄이 틀렸는지 찾을 수도 없다.

필터링 파이프라인

LLM 규모에서는 이 문제가 산업이 된다. 수조 토큰의 출처는 대부분 Common Crawl — 웹 전체를 주기적으로 긁어 공개하는 아카이브 — 같은 크롤링 데이터인데, 여기에는 욕설과 가짜 정보와 자동 생성된 저품질 텍스트와 개인정보가 좋은 문서와 뒤섞여 있다. Llama 3나 FineWeb 같은 모델·데이터셋의 기술 보고서가 학습 데이터의 필터링 파이프라인에 많은 지면을 쓰는 이유다. 아키텍처는 몇 문단이면 설명이 끝나지만 데이터를 어떻게 걸렀는가는 그렇지 않다.

파이프라인은 대개 네 단계를 지난다.

단계 거르는 것 기준
언어 필터 대상 언어가 아닌 문서 언어 감지 결과
품질 필터 문장이 안 되는 텍스트 퍼플렉서티 같은 점수
중복 제거 같거나 거의 같은 문서 정확 매칭·근사 매칭
유해 콘텐츠 필터 욕설·혐오·개인정보 분류기나 규칙

퍼플렉서티(perplexity)는 어떤 텍스트를 언어 모델이 얼마나 「놀라며」 읽는지를 재는 값으로, 잘 쓰인 문장은 낮고 깨진 텍스트나 문자 나열은 높다. 이 값이 어느 문턱을 넘는 문서를 버리면 품질 필터가 된다. 중복 제거가 따로 한 단계인 것은 웹에 같은 문서가 수백 번 복제돼 있기 때문이다. 같은 문서를 백 번 읽은 모델은 그 문서를 통째로 외우고, 외운 것을 그대로 뱉는다. 걸러 낸 뒤 남는 것은 원본의 일부이고, 파이프라인에 따라서는 대부분을 버리기도 한다. 세부 기법은 데이터 품질 관리와 데이터 중복 제거에서 다룬다.

주목할 것은 이 표의 마지막 열이다. 「기준」 칸에 적힌 것은 전부 규칙이다. 언어 감지의 문턱값, 퍼플렉서티의 상한, 유해 콘텐츠의 정의 — 데이터가 규칙을 만드는 시대에 그 데이터를 고르는 일은 다시 사람이 적은 규칙이 한다. 기호주의가 사라지지 않았다는 것을 여기서 한 번 더 본다.

합성 데이터

실무에서 가장 자주 부딪히는 벽은 웹에 널린 텍스트가 아니라 레이블이 붙은 고품질 데이터의 부족이다. 의료·법률·금융 같은 전문 도메인은 데이터를 구하는 것 자체가 어렵고, 구해도 전문가가 레이블을 붙여야 하며, 개인정보 때문에 밖으로 못 나온다. 앞 절에서 후발 주자의 세 번째 길로 적은 「만들어 낸다」가 이 벽의 답이다.

합성 데이터(synthetic data)는 사람이 모은 것이 아니라 프로그램이나 모델이 생성한 학습 데이터다. 강력한 LLM에 「이 주제에 관한 질문-답변 쌍을 난이도를 섞어 만들어 달라」고 요청해 수천 건을 받아 내고, 그것으로 더 작은 모델을 파인튜닝 — 이미 학습된 모델을 추가 데이터로 조금 더 학습시키는 것 — 하는 식이다. Llama 3나 Phi-3 같은 모델이 이 방식으로 성능을 크게 끌어올렸다. 인터넷의 좋은 텍스트가 유한하다는, Chinchilla 이야기 끝에 던진 물음에 대해 지금까지 나온 가장 실용적인 답이기도 하다.

물론 공짜는 아니다. 생성한 모델의 편향과 오류가 그대로 옮겨 오고, 생성 결과로 다시 생성 모델을 학습하는 일이 반복되면 데이터의 다양성이 줄어든다. 그래서 합성 데이터는 만들어 놓고 끝이 아니라 검증이 절반이다 — 실제 데이터와 섞고, 사람이 표본을 확인하고, 정해진 문제 묶음으로 성능을 재는 벤치마크에 올린다. 만드는 법과 검증하는 법은 합성 데이터에서 따로 본다.

데이터 중심 AI

이 모든 경험을 하나의 방법론으로 이름 붙인 것이 앤드류 응(Andrew Ng)이 제창한 데이터 중심 AI(Data-Centric AI)다. 기존 개발이 데이터를 고정해 두고 모델을 바꿔 성능을 올렸다면, 데이터 중심 접근은 모델을 고정해 두고 데이터를 고쳐 성능을 올린다. 방향을 뒤집은 것이다.

실무에서 이 뒤집기가 자주 이기는 이유는 단순하다. 오늘의 모델은 대부분 이미 충분히 좋고, 성능이 막히는 자리는 아키텍처가 아니라 데이터에 있다. 레이블이 일관되지 않아 같은 사례를 두 사람이 다르게 표시했거나, 실제 서비스에서 자주 오는 엣지 케이스 — 학습 데이터에 드물게만 있는 극단 사례 — 가 빠져 있거나, 한 부류가 다른 부류의 백 배라 모델이 다수 쪽만 배우는 불균형이 있거나다. 레이블 지침을 다시 쓰고, 엣지 케이스를 수백 건 더 모으고, 소수 부류를 보강하는 쪽이 모델을 갈아 끼우는 것보다 더 큰 향상을 낸 경험을 많은 팀이 갖고 있다.

이 절을 한 문장으로 줄이면, 데이터를 관리한다는 말이 실제로 뜻하는 일이 여기 적힌 것들이다 — 거르고, 만들고, 고치고, 채우는 일.

패러다임의 융합

뉴로-기호 AI

현대의 실용적 AI 시스템은 한쪽만 쓰지 않는다. 뉴로-기호 AI(neuro-symbolic AI)는 신경망이 잘하는 것과 기호 체계가 잘하는 것을 한 시스템 안에 붙이는 방향이고, LLM이 도구를 쓰는 방식이 가장 눈에 띄는 실례다. 언어를 이해하고 생성하는 능력은 통계적 학습 — 오늘 LLM의 표준 구조인 Transformer를 수조 토큰으로 학습한 결과 — 에서 온다. 그러나 정확한 계산이나 최신 정보 조회는 학습으로 얻는 것이 아니라 계산기와 검색 API 같은 기호주의적 도구에 맡긴다. ChatGPT가 답하기 전에 파이썬 코드를 샌드박스에서 실제로 돌려 보고, Claude가 도구 호출로 우리가 정의한 함수를 부르는 것이 그것이다.

tools = [{
    "name": "calculate",
    "description": "정확한 수학 계산 수행",
    "input_schema": {
        "type": "object",
        "properties": {"expression": {"type": "string"}},
        "required": ["expression"],
    },
}]
# 모델은 질문을 읽고 "10000000 * 1.073 ** 15"를 도구에 넘긴다 — 계산은 모델이 하지 않는다

도구를 부르는 LLM의 분업

이 배치가 정확히 앞의 대차대조표를 따른다. 「7.3% 복리로 15년 뒤 원금 1000만 원이 얼마인가」에서 질문을 읽고 무엇을 계산해야 하는지 아는 일은 데이터가 만든 지식이고, 1.073151.073^{15} 를 소수점 아래까지 정확히 구하는 일은 규칙이 하는 지식이다. 언어 모델은 앞의 것을 잘하고 뒤의 것을 못하며, 계산기는 그 반대다. 둘을 이으면 각자 못하는 것을 상대가 메운다. 도구를 정의하고 부르는 절차는 도구 호출과 MCP에서 다룬다.

지식 그래프와 온톨로지

기호주의의 유산은 도구 호출보다 오래전부터 살아 있었다. 지식 그래프(knowledge graph)는 「서울 — 수도이다 — 대한민국」처럼 개체와 개체 사이의 관계를 그래프로 적어 둔 구조화된 지식이고, 온톨로지(ontology)는 어떤 분야의 개념들이 무엇이고 서로 어떤 관계인지를 규정한 체계다. 둘 다 이 글의 첫 절에서 본 Prolog의 사실과 규칙의 직계 후손이다.

구글 검색 결과 옆에 뜨는 Knowledge Panel은 지식 그래프에서 꺼낸 것이고, 의료 AI가 진단명을 다루는 질병 분류 체계는 온톨로지다. 통계적 모델이 문장을 읽고 「이 환자는 당뇨병일 가능성이 높다」를 내면, 온톨로지가 당뇨병이 어느 상위 분류에 속하고 어떤 합병증과 이어지는지를 확실한 사실로 댄다. 확률로 추정한 것과 정의로 확정된 것이 한 시스템에서 역할을 나눈다. 검색 증강 생성을 그래프 위에 세우는 그래프 RAG도 이 결합의 한 갈래다.

할루시네이션

두 패러다임을 이해하면 「AI가 왜 가끔 이상한 답을 하는가」가 미스터리가 아니게 된다. 통계적 AI는 학습 데이터에서 본 패턴으로 답한다. 그러므로 학습 데이터에 없던 상황, 그리고 패턴이 아니라 정확한 논리 추론이 필요한 문제 — 여러 단계의 수학, 코드의 버그 찾기, 특정 사실의 진위 확인 — 에서 실수한다. 대차대조표의 마지막 줄에 적은 「학습 분포 밖의 입력」이 바로 그 자리다.

할루시네이션(hallucination)은 모델이 사실이 아닌 것을 사실처럼 유창하게 내놓는 현상이고, 그 뿌리 중 하나가 여기에 있다. 모델은 「그럴듯한 다음 단어」의 분포를 배웠지 「참인 문장」의 목록을 배운 것이 아니다. 없는 논문 제목을 지어내는 것은 논문 제목이 보통 어떤 모양인지를 아주 잘 배운 결과이지, 배우지 못한 결과가 아니다. 그래서 모델을 더 크게 만드는 것만으로는 이 문제가 없어지지 않는다. 규칙이 필요한 자리에 확률을 세운 구조적 결과이기 때문이다. 증상과 대처는 LLM의 한계와 환각에서 따로 다룬다.

규칙의 복귀

그래서 오늘 AI 엔지니어링의 핵심 과제는 통계적 모델에 기호주의적 요소를 다시 붙이는 일이다. RAG(검색 증강 생성)는 답하기 전에 관련 문서를 검색해 모델에 넣어 주는 방식으로, 「학습 데이터에 없던 것」을 답할 때마다 밖에서 가져온다. 함수 호출은 계산·조회·실행을 규칙이 확실한 프로그램에 넘기고 결과만 받는다. 코드 실행 도구는 모델이 쓴 코드를 실제로 돌려 맞는지 확인한다. 셋 다 하는 일은 같다 — 확률이 흔들리는 자리에 확정된 사실과 규칙을 세운다. 기본 원리는 RAG 완전 정복에서 시작한다.

70년을 한 문장으로 접으면 이렇다. 사람이 규칙을 적던 시대가 지식 획득 병목에 막혔고, 데이터가 규칙을 만드는 시대가 그 병목을 넘었으며, 그래서 경쟁은 데이터의 양과 품질과 독점으로 옮겨 갔고, 그 끝에서 데이터가 만든 모델은 자기가 못하는 것을 규칙에 다시 맡기고 있다. 어느 한쪽이 이긴 것이 아니라 역할이 갈린 것이다.

다음 글에서는 이 융합이 지금 실제 시장에서 어떤 모습으로 벌어지고 있는지를 한 장의 지도로 본다. 어느 회사들이 파운데이션 모델을 두고 경쟁하고, 그 모델을 만들고 돌리는 인프라와 도구가 어디에 서 있으며, 그 위에서 어떤 산업이 바뀌고 있는지를 층별로 본다. 이 글에서 본 데이터 경쟁이 그 지도의 어느 층에서 벌어지고 있는지는 읽으면서 맞춰 보면 된다.


읽어주셔서 감사합니다. 😊

LATEST

AI 기초의 최신 글

AI 기초2026.08.19

가드레일을 테스트한다는 것

가드레일 테스트는 단위 테스트와 성질이 다릅니다. 세트를 두 벌로 나누는 이유, 통과 기준을 절대값 대신 기준선으로 잡는 법, 세트가 오염되는 경로, 표본 크기가 결정에 미치는 영향을 정리합니다.

43 MIN
AI 기초2026.08.19

거절도 설계한다: 안 된다고 말하는 법

거절은 안전 장치의 마지막 동작이면서 사용자가 제품을 평가하는 순간입니다. 켜고 끄는 스위치 대신 다섯 칸 사다리를 쓰는 법, 좋은 거절 문구의 조건, 과잉 거절을 재는 방법을 정리합니다.

41 MIN
AI 기초2026.08.19

콘텐츠 조정: 정책을 판정 가능한 것으로 만들기

정책 문서가 있어도 판정은 안 됩니다. 두 사람이 같은 라벨을 붙일 수 있게 정책을 쪼개는 법, 임계값을 둘로 두는 이유, 검토 큐가 터지지 않게 설계하는 법, 라벨마다 따로 봐야 하는 지표를 정리합니다.

50 MIN