AI 기초

GUIDE / 2번째 글

AI 역사 — 1956년 다트머스에서 LLM 시대까지

AI의 70년 역사를 두 번의 겨울과 세 번의 부흥으로 정리합니다. 왜 AI는 실패를 반복했고, 딥러닝 혁명은 어떻게 가능했는지 맥락으로 이해합니다.

PALDYN Team39 MIN READ

지난 글에서 AI·ML·DL·LLM이 서로를 포함하는 집합 관계임을 살펴봤습니다. 이번 글은 그 집합들이 어떤 순서로, 무엇에 밀려 생겼는지를 따라갑니다.

AI의 70년을 「꾸준히 좋아진 기술」로 읽으면 지금 무슨 일이 벌어지고 있는지 알기 어렵습니다. 실제 모양은 톱니에 가깝습니다. 약속이 먼저 나오고, 예산이 그 약속을 믿고 들어오고, 결과가 약속에 못 미치는 것이 드러나면 예산이 한꺼번에 빠집니다. 그리고 예산이 빠진 자리에서 다음 방법이 조용히 자랍니다. 두 번의 겨울과 세 번의 부흥이 전부 이 모양이었고, 지금 우리가 서 있는 자리도 그 톱니의 어느 지점입니다. 그래서 이 글은 연표를 외우려는 것이 아니라 무엇이 매번 같은 자리에서 무너졌는지를 봅니다.

다트머스 회의

튜링 테스트

1950년 앨런 튜링은 논문 Computing Machinery and Intelligence를 「기계가 생각할 수 있는가」라는 물음으로 엽니다. 그리고 바로 그 물음을 버립니다. '생각'과 '기계'를 사전처럼 정의하려 들면 말싸움으로 끝난다고 본 것입니다. 대신 그는 답할 수 있는 형태로 물음을 바꿔 놓습니다. 이미테이션 게임은 심판이 보이지 않는 상대와 글로만 대화하고 그 상대가 사람인지 기계인지 맞히는 놀이입니다. 기계가 심판을 충분히 자주 속인다면 「생각한다」고 부르자는 제안이고, 오늘날 튜링 테스트라 부르는 것이 이것입니다.

이 바꿔치기가 AI라는 분야의 성격을 미리 정해 버렸습니다. 안에서 무슨 일이 일어나는지는 묻지 않고 밖으로 나온 행동만 본다는 태도입니다. 덕분에 연구는 철학에서 공학으로 내려올 수 있었습니다. 재는 방법이 생겼으니 고칠 방향도 생긴 것입니다. 대신 「행동이 같으면 같은 것인가」라는 물음은 답을 얻은 것이 아니라 미뤄졌을 뿐이고, 70년 뒤 LLM 앞에서 그대로 되돌아옵니다.

이미테이션 게임의 배치

1956년 제안서

1955년 존 매카시는 다음 해 여름 다트머스 대학에서 두 달짜리 연구 모임을 열자는 제안서를 씁니다. 마빈 민스키, 클로드 섀넌, IBM의 너새니얼 로체스터가 함께 이름을 올렸고, 「인공지능」(artificial intelligence)이라는 말이 여기서 처음 활자로 나옵니다. 1956년 여름의 그 모임이 AI 연구의 공식 출발점입니다.

제안서의 핵심은 한 문장입니다 — 학습을 비롯한 지능의 모든 측면은 원리상 기계가 흉내 낼 수 있을 만큼 정확하게 기술할 수 있다. 여기에 이 분야의 첫 작업 가설이 들어 있습니다. 지능이 규칙으로 적히는 것이라면 그 규칙을 찾아 적기만 하면 된다는 것입니다. 뒤에 기호주의(symbolic AI)라 불리게 되는 노선이고, 이후 20년 동안 AI는 곧 이 노선이었습니다. 기호로 다루는 방식과 통계로 다루는 방식이 어디서 갈라지는지는 기호주의와 통계적 접근에서 따로 다룹니다.

제안서에는 두 달이면 상당 부분이 풀릴 것이라는 전망도 적혀 있습니다. 이 문장이 이후 70년 동안 주어만 바꿔 가며 반복됩니다. 무엇이 문제인지는 아는데 얼마나 걸릴지는 모르는 상태에서, 「곧 됩니다」가 예산 신청서의 기본값이 된 것입니다.

초기 성과

낙관에는 근거가 있었습니다. 아서 새뮤얼의 체커 프로그램은 자기 자신과 두면서 판을 평가하는 함수의 계수를 고쳐 나갔고, 몇 해 뒤에는 만든 사람보다 잘 두게 됩니다. 기계가 배운다는 것을 처음 눈으로 보여 준 프로그램입니다. 뉴얼과 사이먼의 논리 이론가(Logic Theorist)는 『수학 원리』 2장에 실린 정리 쉰두 개 가운데 서른여덟 개를 스스로 증명했고, 그중 하나는 책에 실린 것보다 짧은 증명이었습니다.

1957년 프랭크 로젠블랫의 퍼셉트론은 이 흐름에 신경망을 더합니다. 입력마다 가중치를 두고 그 합이 문턱을 넘으면 1, 아니면 0을 내는 아주 단순한 장치인데, 예시를 보여 주면 가중치가 스스로 조정된다는 점이 새로웠습니다. 자세한 동작은 퍼셉트론에 있습니다. 규칙을 사람이 한 줄씩 적지 않아도 된다는 첫 신호였고, 언론은 곧 걷고 말하고 스스로를 복제하는 기계가 나온다고 전했습니다.

여기까지가 첫 10년입니다. 세 갈래 — 학습하는 게임 프로그램, 정리를 증명하는 탐색, 예시로 조정되는 가중치 — 가 모두 작동했습니다. 다만 셋 다 사소한 크기의 문제에서만 확인됐다는 사실은 아직 아무도 문제로 삼지 않았습니다.

두 번의 겨울

라이트힐 보고서

문제는 크기였습니다. 논리 이론가나 일반 문제 해결기(General Problem Solver)가 쓰는 방법은 가능한 수를 늘어놓고 뒤지는 탐색인데, 한 걸음 나아갈 때마다 선택지가 곱해집니다. 한 수에 열 갈래면 다섯 수 앞은 10만 갈래이고 열 수 앞은 100억 갈래입니다. 장난감 문제에서 잘 돌던 프로그램이 실제 크기의 문제에서 그대로 멎는 이유가 이것이고, 이것을 조합 폭발(combinatorial explosion)이라고 부릅니다. 컴퓨터가 천 배 빨라져도 한 수 반쯤 더 볼 수 있을 뿐이라, 하드웨어를 기다려서 풀리는 종류의 문제가 아니었습니다.

1969년 민스키와 파퍼트의 Perceptrons는 다른 쪽 벽을 보였습니다. 층이 하나인 퍼셉트론은 XOR처럼 직선 하나로 갈라지지 않는 것을 원리상 배울 수 없다는 증명입니다. 층을 여럿 쌓으면 된다는 것은 그때도 알려져 있었지만, 층이 여럿일 때 가중치를 어떻게 조정할지가 정리되어 있지 않았습니다.

1973년 영국 정부가 의뢰한 라이트힐 보고서가 이 둘을 하나로 묶습니다. AI가 실험실 규모에서 보인 성과는 실제 규모로 옮겨지지 않으며 그 원인은 조합 폭발이라는 것입니다. 영국은 대학 몇 곳만 남기고 AI 예산을 끊었고, 미국에서는 그보다 앞선 1966년 ALPAC 보고서가 기계 번역 지원을 이미 끊어 놓은 상태였습니다. 제1차 AI 겨울(1974~1980)입니다.

전문가 시스템

겨울을 끝낸 것은 새 알고리즘이 아니라 목표를 줄인 것이었습니다. 「지능 일반」 대신 좁은 분야 하나를 골라, 그 분야 전문가의 판단을 if-then 규칙 수백에서 수천 개로 옮겨 적는 방식입니다. 이것이 전문가 시스템(expert system)입니다.

# 전문가 시스템의 뼈대 — 조건이 다 맞는 첫 규칙을 쓴다
def diagnose(symptoms):
    rules = [
        ({"발열", "두통", "목경직"}, "수막염 의심 — 즉시 응급실"),
        ({"흉통", "호흡곤란"}, "심장 문제 의심 — 즉시 119"),
        ({"발열", "기침", "인후통"}, "감기 가능성 높음"),
        ({"발열", "기침"}, "독감 가능성"),
    ]
    observed = set(symptoms)
    for required, diagnosis in rules:
        if required.issubset(observed):
            return diagnosis
    return "추가 검사 필요"


print(diagnose(["발열", "기침", "인후통"]))  # → 감기 가능성 높음

규칙의 순서가 곧 우선순위라는 점을 눈여겨볼 만합니다. 위험한 진단을 위에 두지 않으면 감기 규칙이 먼저 걸려 수막염을 놓칩니다. 규칙이 넷일 때는 눈으로 보이지만 수천 개가 되면 보이지 않고, 이 성질이 뒤에서 이 방식의 발목을 잡습니다.

스탠퍼드의 MYCIN은 혈액 감염을 진단하고 항생제를 추천했고, 규칙 600개 남짓으로 전문의에 견줄 만한 정확도를 냈습니다. 카네기멜런에서 만들어 DEC에 들어간 XCON은 주문받은 컴퓨터 부품 조합이 실제로 조립되는지 검사했고, 연간 4천만 달러를 아꼈다고 보고됐습니다. 목표를 좁히자 조합 폭발이 사라진 것입니다. 뒤질 공간이 「모든 문제」가 아니라 「혈액 감염」이 되었기 때문입니다.

돈이 돌아왔습니다. 일본 정부는 1982년 5세대 컴퓨터 프로젝트로 10년 안에 사람처럼 추론하는 컴퓨터를 만들겠다고 선언했고 미국과 영국이 맞불을 놨습니다. Lisp을 빠르게 돌리는 전용 컴퓨터를 파는 회사들이 생겼습니다.

지식 병목

전문가 시스템은 두 자리에서 무너집니다.

첫째는 지식 병목입니다. 규칙은 사람이 적어야 하고, 적을 수 있는 사람은 그 분야 전문가뿐이며, 전문가는 자기가 아는 것의 상당 부분을 규칙으로 말하지 못합니다. 경험 많은 의사가 「환자를 보면 안다」고 할 때 그 안다는 것을 if-then으로 옮기는 일은 새 연구에 가깝습니다. 게다가 규칙이 수천 개를 넘으면 새로 넣은 규칙 하나가 기존 규칙 몇 개와 부딪히는지 아무도 확인하지 못합니다. XCON은 유지에만 사람이 상시로 붙어 있어야 했습니다.

둘째는 상식의 부재입니다. 규칙에 없는 입력이 들어오면 시스템은 「모르겠다」가 아니라 엉뚱한 답을 자신 있게 냅니다. 사람이라면 당연히 걸러 낼 것을 걸러 내지 못하는데, 그 당연한 것이 규칙으로 적혀 있지 않기 때문입니다. 이 구멍을 메우려면 세상에 대한 배경 지식을 통째로 적어 넣어야 하고, 그것은 원래 피하려던 「지능 일반」 문제입니다.

1987년 Lisp 전용 컴퓨터 시장이 먼저 무너집니다. 범용 워크스테이션이 더 싸고 빨라졌기 때문입니다. 일본의 5세대 프로젝트도 목표에 닿지 못한 채 끝납니다. 제2차 AI 겨울(1987~1993)입니다.

기대와 예산

두 겨울은 원인이 달랐습니다. 첫 번째는 탐색이 커지지 않아서였고 두 번째는 규칙이 유지되지 않아서였습니다. 그런데 무너진 방식은 같습니다. 성과가 아니라 약속이 예산을 끌어왔고, 약속과 성과의 거리가 드러나는 순간 예산이 한꺼번에 빠졌습니다. 기술이 조금씩 나빠져서 겨울이 온 것이 아니라, 기술은 그대로인데 기대가 먼저 무너진 것입니다.

겨울이 기술을 지우지도 않았습니다. 두 번 모두 연구는 이름을 바꿔 계속됐습니다. 「인공지능」이라고 쓰면 심사에서 떨어지니 「정보 검색」·「패턴 인식」·「의사결정 지원」이라고 적었습니다. 사라진 것은 방법이 아니라 그 이름, 그리고 이름에 붙어 있던 예산이었습니다. 다음 부흥이 매번 직전 겨울 동안 자란 것에서 나온 이유도 여기에 있습니다.

AI 역사 타임라인

통계적 학습

규칙과 데이터

두 번째 겨울 동안 자란 것은 새 알고리즘이 아니라 다른 전제였습니다. 지식을 규칙으로 적는 대신 데이터에서 확률로 추정한다는 것입니다.

먼저 갈린 곳은 기계 번역과 음성 인식이었습니다. 두 분야는 규칙 쪽이 가장 오래 매달렸고 가장 확실하게 실패한 자리입니다. 문법 규칙을 정교하게 적을수록 예외가 규칙보다 빨리 늘었기 때문입니다. 1980년대 후반 IBM 연구진은 반대로 갔습니다. 캐나다 의회의 영어·프랑스어 회의록처럼 같은 내용이 두 언어로 나란히 있는 뭉치를 놓고, 어떤 단어가 어떤 단어로 옮겨지는지의 확률을 세어 번역기를 만든 것입니다. 문법을 한 줄도 적지 않은 이 번역기가 규칙 기반 번역기를 이겼습니다.

두 분야가 먼저 갈린 데에는 이유가 있습니다. 정답이 이미 대량으로 존재했습니다. 번역문과 녹취록은 AI 연구를 위해서가 아니라 원래부터 만들어지고 있던 것이고, 연구자는 그것을 모으기만 하면 됐습니다. 데이터가 이미 쌓여 있는 곳에서 통계가 먼저 이겼다는 이 순서는 이후 모든 전환에서 그대로 반복됩니다.

커널과 앙상블

1990년대 중반부터 2010년대 초까지 실무를 지배한 것은 신경망이 아니었습니다.

SVM(support vector machine)은 1995년에 정리된 방법으로, 두 부류를 가르는 경계 가운데 양쪽 가장 가까운 점까지의 여백이 최대인 것을 고릅니다. 여백을 최대로 잡는다는 기준 하나가 「어떤 경계가 새 데이터에도 통할 것인가」에 답을 주고, 여기에 커널 기법을 붙이면 직선으로 갈리지 않는 데이터도 다룰 수 있습니다(SVM).

다른 쪽에는 앙상블이 있었습니다. 약한 모형 여럿의 답을 모으면 하나짜리 강한 모형보다 낫다는 발상입니다. 1997년 AdaBoost는 앞 모형이 틀린 예시에 가중치를 더 주며 모형을 차례로 쌓았고, 2001년 브레이먼의 랜덤 포레스트는 데이터와 변수를 무작위로 갈라 만든 결정 트리 수백 개의 투표를 씁니다(랜덤 포레스트).

SVM의 최대 여백과 앙상블의 투표

이 시기 방법들의 공통점은 적은 데이터에서 잘 돈다는 것입니다. 예시 수천 개로 쓸 만한 성능이 나왔고 왜 되는지에 대한 이론적 보장도 있었습니다. 대신 값을 다른 데서 치렀습니다. 사람이 특징을 손으로 설계해야 했습니다. 이미지를 분류하려면 먼저 모서리와 색 분포를 뽑아 주는 코드를 사람이 써야 했고, 성능의 대부분이 모형이 아니라 그 코드에서 나왔습니다. 특징을 잘 설계하는 사람이 곧 좋은 결과를 내는 사람이었습니다.

ImageNet

2009년 페이페이 리 연구진이 ImageNet을 공개합니다. 1,400만 장이 넘는 사진에 사람이 손으로 이름표를 붙인 데이터셋이고, 대회용으로 잘라 낸 부분만 해도 1,000개 부류에 학습용 사진 120만 장입니다.

당시로서는 이상한 투자였습니다. 다들 알고리즘을 고치고 있는데 사진에 이름표를 붙이는 데 몇 해를 쓴 것입니다. 판단의 근거는 단순했습니다. 사람이 설계한 특징을 계속 손보는 대신, 데이터가 충분히 크면 모형이 특징까지 스스로 배울 것이라는 예상입니다. 이 예상이 3년 뒤에 확인됩니다. 그리고 그때부터 「무엇을 고칠 것인가」의 답이 알고리즘에서 데이터로 옮겨 갑니다.

딥러닝의 세 조건

AlexNet

2012년 ImageNet 대회에서 토론토 대학의 AlexNet이 상위 5개 안에 정답이 드는지를 기준으로 오차 15.3%를 냅니다. 2위가 26.2%였습니다. 해마다 1~2%포인트씩 좁혀지던 격차가 한 해에 10%포인트 넘게 벌어진 것입니다. 이런 폭의 차이는 「조금 더 잘 튜닝했다」로 설명되지 않습니다.

# AlexNet 핵심 구조 (단순화)
import torch.nn as nn


class AlexNetSimplified(nn.Module):
    def __init__(self, num_classes=1000):
        super().__init__()
        self.features = nn.Sequential(
            nn.Conv2d(3, 64, kernel_size=11, stride=4),
            nn.ReLU(inplace=True),
            nn.MaxPool2d(kernel_size=3, stride=2),
            nn.Conv2d(64, 192, kernel_size=5, padding=2),
            nn.ReLU(inplace=True),
            nn.MaxPool2d(kernel_size=3, stride=2),
        )
        self.classifier = nn.Sequential(
            nn.Dropout(),
            nn.Linear(192 * 6 * 6, 4096),
            nn.ReLU(inplace=True),
            nn.Linear(4096, num_classes),
        )

    def forward(self, x):
        x = self.features(x)
        x = x.view(x.size(0), -1)
        return self.classifier(x)

구조 자체는 새롭지 않았습니다. 합성곱 신경망은 1990년대에 이미 있었고 우편번호 손글씨 인식에 쓰이고 있었습니다. 달라진 것은 그 구조를 파라미터 6천만 개 규모로, 사진 120만 장에 대고, 끝까지 학습시킬 수 있게 된 조건이었습니다. 조건은 셋이고 셋이 같은 시기에 갖춰졌습니다.

GPU 경제

AlexNet은 GPU 두 장으로 엿새쯤 학습했습니다. 같은 것을 그 시절 CPU로 돌렸다면 몇 달입니다.

왜 GPU였는지는 계산의 모양을 보면 나옵니다. 신경망 학습에서 시간의 대부분은 행렬 곱셈이고, 행렬 곱셈은 같은 종류의 연산을 서로 독립적으로 수백만 번 하는 일입니다. 이런 일은 빠른 코어 몇 개보다 느린 코어 수천 개가 동시에 도는 편이 낫습니다. GPU는 원래 화면의 픽셀을 동시에 칠하려고 그렇게 만들어진 장치였는데, 그 모양이 우연히 신경망이 필요로 하는 모양과 같았습니다.

여기서 진짜로 바뀐 것은 성능이 아니라 실험 주기입니다. 한 번 학습에 석 달이 걸리면 연구자는 1년에 네 번 시도할 수 있습니다. 엿새면 쉰 번입니다. 학습률과 층 수와 초기화를 바꿔 가며 쉰 번 돌려 본 사람이 네 번 돌려 본 사람을 이기는 것은 당연한 일입니다. 하드웨어는 모형을 좋게 만든 것이 아니라 시행착오를 싸게 만들었습니다. 딥러닝이 이론보다 경험칙이 앞서는 분야가 된 이유도 여기에 있습니다.

CPU와 GPU의 연간 실험 횟수 비교

활성화와 정규화

세 번째 조건은 알고리즘 쪽에서 풀린 몇 가지입니다. 신경망을 깊게 쌓지 못한 이유는 그래디언트 소실이었습니다. 학습 신호가 뒤에서 앞으로 전달될 때 층마다 1보다 작은 수가 곱해져, 층이 깊으면 앞쪽 층에 닿을 무렵 신호가 0에 가까워지는 현상입니다. 0.5를 열 번 곱하면 0.001이고, 앞쪽 층은 사실상 학습되지 않습니다(그래디언트 소실).

세 가지가 이 자리를 풀었습니다.

  • ReLU — 음수를 0으로 만들고 양수는 그대로 통과시키는 활성화 함수입니다. 양수 쪽 기울기가 1이라 몇 번을 곱해도 신호가 줄지 않습니다(활성화 함수).
  • 초기화 — 가중치의 처음 값을 층 크기에 맞춘 분산으로 뽑으면 신호가 층을 지나며 커지지도 작아지지도 않습니다(가중치 초기화).
  • 드롭아웃과 정규화 — 학습 중 뉴런 일부를 무작위로 끄거나 층마다 값의 분포를 다시 맞춰, 파라미터가 많아도 데이터를 통째로 외우지 않게 합니다(드롭아웃).

셋이 다 있어야 했다는 점이 중요합니다. 데이터만 있고 GPU가 없으면 학습이 끝나지 않고, GPU만 있고 데이터가 없으면 외워 버리고, 둘 다 있어도 깊게 쌓으면 신호가 사라졌습니다. 2012년은 발명의 해가 아니라 세 조건이 처음으로 동시에 갖춰진 해입니다. 그리고 이 셋 가운데 둘은 AI 연구가 만든 것이 아닙니다. GPU는 게임 산업이, 데이터는 인터넷이 만들었습니다.

이후는 빨랐습니다. 2014년 GAN, 2015년 152층짜리 ResNet, 2016년 알파고가 이세돌 9단을 4대 1로 이깁니다. 특징을 손으로 설계하던 자리가 5년 만에 사라졌습니다.

트랜스포머

어텐션

2017년 구글 연구진의 Attention Is All You Need는 당시 자연어처리의 기본 부품이던 순환 신경망을 통째로 뺐습니다.

RNN은 문장을 앞에서 뒤로 한 단어씩 읽습니다. 열 번째 단어를 처리하려면 아홉 번째까지 끝나 있어야 하므로 순서대로만 계산할 수 있고, 앞쪽 정보는 뒤로 갈수록 흐려집니다. 어텐션은 이 둘을 한꺼번에 없앱니다. 각 단어가 문장 안의 모든 단어를 한 번에 보고 「누구를 얼마나 볼지」를 점수로 매긴 뒤, 그 점수로 가중 평균한 값을 자기 표현으로 삼습니다. 스무 단어 떨어진 단어도 한 걸음 거리이고, 단어마다의 계산이 서로 독립이라 GPU에 그대로 얹힙니다(셀프 어텐션).

# 셀프 어텐션의 계산 순서
import torch
import torch.nn.functional as F


def scaled_dot_product_attention(Q, K, V):
    d_k = Q.size(-1)
    scores = torch.matmul(Q, K.transpose(-2, -1)) / (d_k ** 0.5)  # 누구를 볼지 점수
    weights = F.softmax(scores, dim=-1)                            # 합이 1이 되게
    return torch.matmul(weights, V)                                # 가중 평균

여기서 앞 절의 이야기가 이어집니다. 트랜스포머의 진짜 성질은 정확도가 아니라 크게 만들수록 잘 되고, 크게 만드는 것이 하드웨어에서 실제로 가능하다는 것입니다. RNN은 돈을 아무리 부어도 순서대로 계산해야 해서 그 돈을 다 쓰지 못했습니다. 계산을 살 수 있는 시대에 계산을 쓸 수 있는 구조가 나온 것이고, 그 뒤 8년의 흐름은 대부분 이 한 문장의 결과입니다.

사전학습과 미세조정

2018년 같은 해에 BERT와 GPT-1이 나옵니다. 하나는 양방향 인코더이고 하나는 단방향 디코더라 구조는 다르지만 방식은 같습니다. 이름표 없는 글을 대량으로 읽히며 가려진 단어 맞히기 또는 다음 단어 맞히기를 시키고(사전학습), 그렇게 만든 모형을 풀려는 과제의 작은 데이터로 조금 더 학습시키는 것입니다(미세조정).

여기서 데이터 문제의 성격이 바뀝니다. 그전까지 지도학습은 사람이 붙인 이름표를 필요로 했고, 그것이 ImageNet에 몇 해가 든 이유였습니다. 그런데 다음 단어 맞히기는 이름표가 글 자체에 이미 들어 있습니다. 「나는 밥을」 다음에 무엇이 오는지는 원문이 알려 줍니다. 사람이 손댈 필요가 없어졌으니 인터넷에 있는 글 전부가 학습 데이터가 된 것입니다(사전학습).

프롬프트

2020년 GPT-3은 파라미터 1,750억 개짜리였고, 크기보다 더 놀라운 것은 쓰는 방법이었습니다. 새 과제를 시키는 데 미세조정이 필요하지 않았습니다. 무엇을 원하는지 말로 적고 예시를 두어 개 보여 주면 그대로 했습니다.

이것이 실무의 모양을 바꿨습니다. 과제마다 데이터를 모으고 모형을 학습시키고 배포하던 자리가 문장을 쓰는 자리로 줄어든 것입니다. 2022년 11월 ChatGPT가 나온 뒤 닷새 만에 사용자 100만 명, 두 달 만에 1억 명을 넘긴 것도 이 때문입니다. 처음으로 AI를 쓰는 데 코드가 필요 없어졌고, 그래서 이번 부흥은 앞의 두 번과 달리 연구비가 아니라 사용자에게서 시작했습니다.

스케일링 법칙

2020년 전후로 정리된 스케일링 법칙은 모형 크기·데이터 양·계산량을 늘렸을 때 손실이 얼마나 줄어드는지가 꽤 매끄러운 곡선을 따른다는 관찰입니다. 다음 모형이 얼마나 좋아질지를 학습 전에 어림할 수 있다는 뜻이라, 수천억 원짜리 투자 판단의 근거가 됐습니다(스케일링 법칙).

두 가지를 함께 봐야 합니다. 첫째, 그 곡선은 거듭제곱 꼴이라 같은 폭으로 좋아지려면 매번 몇 배씩 더 부어야 합니다. 둘째, 2022년 친칠라 연구는 그때까지의 큰 모형들이 데이터에 비해 크기만 컸다는 것을 보였습니다. 파라미터 700억 개짜리를 토큰 1조 4천억 개로 학습시킨 모형이 파라미터 2,800억 개짜리보다 나았습니다. 크기를 키우는 것과 잘 만드는 것은 같은 말이 아니었고, 이 지적 이후 경쟁의 축이 파라미터 수에서 데이터의 양과 질로 옮겨 갑니다.

AI 기술 진화 3단계

세 번째 겨울

이전 붐과의 차이

두 번의 겨울을 아는 사람이 지금을 보며 묻는 것은 하나입니다. 이번에도 같은가.

다른 점이 있습니다. 앞의 두 붐에서 돈을 낸 쪽은 정부와 소수의 대기업이었고, 성과를 확인하는 자리는 연구 보고서였습니다. 보고서 한 편이 예산을 끊을 수 있었던 것도 그래서입니다. 지금은 값을 치르고 쓰는 사용자가 있고 매달 청구서가 나갑니다. 무너지더라도 라이트힐 보고서 같은 한 번의 판정으로 무너지지는 않습니다.

기술 쪽도 다릅니다. 전문가 시스템은 규칙에 없는 입력 앞에서 아무것도 하지 못했고, 그래서 실험실 밖으로 나오지 못했습니다. 지금 모형은 처음 보는 입력에도 그럴듯한 것을 내놓습니다. 이것이 강점인 동시에 다음 항목의 문제이기도 합니다.

겨울의 조건

앞의 두 번을 보면 겨울을 부른 것은 기술의 한계 자체가 아니라 약속과 성과의 거리였습니다. 그 거리를 지금 벌리고 있는 것이 셋 있습니다.

  • 환각 — 모형은 모른다고 말하는 대신 그럴듯한 문장을 만듭니다. 규칙에 없으면 멈추던 전문가 시스템과 정확히 반대이고, 틀렸다는 것을 확인하는 비용을 사용자가 냅니다(LLM의 한계와 환각).
  • 비용 — 스케일링 법칙의 거듭제곱은 뒤집어 읽으면 다음 도약의 값이 매번 몇 배라는 뜻입니다. 계산과 전력이 그 값을 감당할 만큼 싸지지 않으면 곡선은 어딘가에서 멈춥니다.
  • 검증 — 무엇이 얼마나 좋아졌는지 재는 방법이 아직 약합니다. 벤치마크 점수와 실제로 쓸 때의 만족이 자주 어긋나고, 시험 문제가 학습 데이터에 섞여 들어가는 오염(contamination) 문제도 있습니다.

셋 다 「곧 됩니다」로 덮을 수 있는 종류라는 점이 위험합니다. 덮이는 동안 기대가 앞서가고, 어느 시점에 거리가 한꺼번에 드러납니다. 두 겨울이 그 자리에서 시작했습니다.

반복되는 형태

70년을 관통하는 것을 표로 적으면 이렇습니다.

반복되는 것 다트머스~1974 전문가 시스템 딥러닝~지금
무엇이 열었나 탐색과 학습의 첫 성공 목표를 좁힌 것 데이터·GPU·학습 기법
무엇이 막았나 조합 폭발 지식 병목과 상식 부재 환각·비용·검증
예산의 근거 연구 계획서 절감 사례 사용료 매출
무엇이 남았나 탐색·휴리스틱 지식 표현·추론 규칙 아직 진행 중

읽어 둘 것은 두 가지입니다. 하나는 막힌 자리에서 방법이 바뀌었지 목표가 바뀌지 않았다는 것입니다. 규칙이 막히자 통계로 갔고, 특징 설계가 막히자 표현 학습으로 갔고, 이름표가 막히자 다음 단어 맞히기로 갔습니다. 매번 앞에서 사람이 하던 일을 하나씩 기계로 넘긴 것입니다.

다른 하나는 다음 방법이 언제나 직전 겨울 동안 자라고 있었다는 것입니다. 통계 기계 번역은 두 번째 겨울 한복판에서 나왔고, 합성곱 신경망도 아무도 신경망을 하지 않던 시기에 만들어졌습니다. 그래서 지금 물어야 할 것은 「겨울이 오는가」보다 「지금 조용히 자라고 있는 것은 무엇인가」입니다. 지형이 지금 어떻게 생겼는지는 AI 지형에서 이어서 봅니다.


읽어주셔서 감사합니다. 😊

LATEST

AI 기초의 최신 글

AI 기초2026.08.19

가드레일을 테스트한다는 것

가드레일 테스트는 단위 테스트와 성질이 다릅니다. 세트를 두 벌로 나누는 이유, 통과 기준을 절대값 대신 기준선으로 잡는 법, 세트가 오염되는 경로, 표본 크기가 결정에 미치는 영향을 정리합니다.

43 MIN
AI 기초2026.08.19

거절도 설계한다: 안 된다고 말하는 법

거절은 안전 장치의 마지막 동작이면서 사용자가 제품을 평가하는 순간입니다. 켜고 끄는 스위치 대신 다섯 칸 사다리를 쓰는 법, 좋은 거절 문구의 조건, 과잉 거절을 재는 방법을 정리합니다.

41 MIN
AI 기초2026.08.19

콘텐츠 조정: 정책을 판정 가능한 것으로 만들기

정책 문서가 있어도 판정은 안 됩니다. 두 사람이 같은 라벨을 붙일 수 있게 정책을 쪼개는 법, 임계값을 둘로 두는 이유, 검토 큐가 터지지 않게 설계하는 법, 라벨마다 따로 봐야 하는 지표를 정리합니다.

50 MIN