AI 기초

GUIDE / 3번째 글

Narrow AI vs General AI vs Super AI — 세 가지 AI 유형 완전 정리

Narrow AI, AGI, ASI의 차이를 명확히 정리합니다. 현재 ChatGPT와 Claude는 어디에 속하며, AGI는 언제 올 수 있는지 다양한 관점을 살펴봅니다.

PALDYN Team36 MIN READ

지난 글에서 AI가 70년 동안 두 번의 겨울을 지나 LLM 시대까지 온 과정을 살펴봤습니다. 이번 글은 AI를 능력의 범위로 가르는 세 유형, Narrow AI · AGI · ASI를 정리합니다.

이 셋은 기술의 이름이 아닙니다. 같은 시스템을 놓고 "이것이 얼마나 넓게 쓸모 있는가"를 묻는 잣대이고, 그래서 어떤 모델이 어느 칸에 들어가는지는 그 잣대를 어떻게 세웠느냐에 따라 달라집니다. 2022년 ChatGPT 이후 "AGI가 왔다"와 "아직 멀었다"가 몇 년째 평행선인 이유가 여기 있습니다. 두 진영은 대체로 같은 사실을 보고 있고, 다른 정의를 쓰고 있습니다. 정의를 먼저 세워 두면 뉴스에서 "AGI 임박"이라는 문장을 만났을 때 무엇을 확인해야 하는지가 분명해집니다.

좁은 AI

좁은 AI(Narrow AI, 특화 인공지능)는 미리 정해진 한 과제 안에서만 능력을 발휘하는 AI입니다. 그 과제 안에서는 사람을 크게 넘어서기도 하지만, 경계 밖으로 한 발만 나가면 아무것도 하지 못합니다.

한 과제의 범위

여기서 "한 과제"라는 말은 세 가지가 미리 정해져 있다는 뜻입니다. 입력이 어떤 꼴인지, 출력이 어떤 꼴인지, 그리고 잘했는지를 무엇으로 재는지입니다. AlphaGo를 예로 들면 입력은 바둑판의 상태, 출력은 다음 착수, 잣대는 승률입니다. 이 셋이 정해져 있기 때문에 수백만 판을 자동으로 두며 학습할 수 있었습니다.

같은 이유로 이 시스템에 체스판을 주면 "못 둔다"기보다 무엇이 정답인지가 정의되어 있지 않습니다. 성능이 모자란 것이 아니라 문제가 존재하지 않는 쪽에 가깝습니다. 좁은 AI에서 중요한 것은 능력의 크기가 아니라 경계가 사람 손으로 미리 그어져 있다는 사실입니다.

그리고 그 경계는 학습이 끝난 뒤에 저절로 넓어지지 않습니다. 새 영역을 다루게 하려면 사람이 데이터를 모으고, 잣대를 새로 정의하고, 다시 학습시켜야 합니다. 넓히는 주체가 언제나 바깥에 있다는 점이 뒤에 나올 AGI와의 결정적인 차이입니다.

지금 쓰는 모델들

오늘날 화제가 되는 시스템은 사실상 전부 이 칸에 들어갑니다.

시스템 특화 영역 경계 밖
AlphaGo / AlphaZero 보드게임 자연어 대화 불가
AlphaFold 단백질 구조 예측 게임·언어 불가
Whisper 음성 → 텍스트 이미지 인식 불가
DALL·E / Midjourney 이미지 생성 코드 작성 불가
GPT-4o · Claude · Gemini 언어(멀티모달 포함) 물리 세계 직접 조작 불가

AlphaFold가 이 성격을 가장 깨끗하게 보여 줍니다. 수십 년 동안 실험실에서 풀던 문제를 계산으로 대체할 만큼 잘하지만, 그 능력은 단백질 바깥의 어디로도 옮겨 가지 않습니다. 잘하는 정도와 넓이가 서로 독립이라는 것이 좁은 AI의 정의입니다.

목록의 마지막 줄이 논쟁의 자리입니다. GPT-4o나 Claude는 번역도 하고 코드도 쓰고 요약도 하는데 왜 여전히 좁은 AI로 분류하느냐는 반응이 흔합니다.

다능과 범용

답의 핵심은 수행 가능한 과제의 수가 아니라 그 능력이 어디서 왔는가입니다.

LLM은 "다음 토큰 예측"이라는 하나의 학습 과제로 만들어졌습니다. 웹과 책과 코드에 사람이 이미 써 놓은 것을 압축한 결과로 수백 가지 일이 따라 나온 것이지, 각각의 일을 따로 배운 것이 아닙니다. 그래서 능력의 넓이는 학습 데이터에 그 일이 얼마나 들어 있었는가를 거의 그대로 따라갑니다. 이런 성질을 다능(multi-task)이라고 부릅니다.

범용(general)은 다른 것을 묻습니다. 학습할 때 없었던 종류의 과제를 마주쳤을 때 스스로 그 능력을 만들어 내는가입니다. 백과사전은 항목이 수십만 개라도 새 항목을 스스로 쓰지 않습니다. 항목 수는 다능의 지표이지 범용의 지표가 아닙니다.

여기에 반론도 있습니다. 사람의 능력도 결국 겪은 것의 분포에서 나온 것 아니냐는 지적입니다. 실제로 사람 역시 완전히 처음 보는 것을 즉석에서 해내지는 못하고, 비슷한 경험을 끌어와 맞춰 봅니다. 그렇다면 둘의 차이는 원리가 아니라 정도의 문제이고, "얼마나 적은 경험으로 얼마나 먼 곳까지 옮겨 가는가"를 재는 잣대가 필요합니다. 그 잣대 이야기는 아래 「능력 측정」에서 이어집니다.

AI 유형 스펙트럼

AGI의 정의

AGI(Artificial General Intelligence, 범용 인공지능)는 흔히 "인간이 할 수 있는 모든 지적 작업을 수행하는 AI"로 정의됩니다. 문장은 짧은데 이 짧은 문장이 논쟁의 절반을 만들어 냅니다.

인간 수준

이 정의는 세 군데가 흐릿합니다.

첫째, 어떤 인간인가입니다. 평균적인 성인인지, 그 분야의 전문가인지, 인류 최고 수준인지에 따라 이미 도달한 영역의 목록이 크게 달라집니다. 표준화된 지식 시험만 놓고 보면 오늘의 모델은 평균적인 응시자를 이미 넘어섰습니다.

둘째, "모든 작업"의 목록이 어디에도 없습니다. 사람이 하는 지적 활동을 빠짐없이 적은 표가 존재하지 않으므로, 무엇을 통과하면 도달인지 판정할 방법이 없습니다.

셋째, "지적"의 범위입니다. 몸이 있어야 하는 일 — 낯선 부엌에서 커피를 내리거나 고장 난 기계를 뜯어보는 일 — 을 포함시키느냐에 따라 남은 거리가 몇 년과 몇십 년으로 갈립니다.

같은 문장을 읽고 한쪽은 "이미 왔다"고, 다른 쪽은 "멀었다"고 말하는 이유가 여기 있습니다. 정의가 흐리면 논쟁은 사실이 아니라 낱말을 두고 벌어집니다.

과제 집합

그래서 정의를 시험 목록으로 바꾸려는 시도가 계속 있었습니다.

가장 오래된 것이 튜링 테스트입니다. 사람 심사자가 대화만으로 상대가 기계인지 사람인지 가려내지 못하면 통과입니다. 이후 나온 것들은 대개 몸이나 사회적 맥락을 끌어들입니다. 커피 테스트는 처음 들어간 집에서 부엌을 찾아 커피를 내리게 하고, 취업 테스트는 사람이 하던 일자리를 그대로 맡아 해내게 합니다. 대학 학위 테스트는 강의를 듣고 시험을 쳐서 학위를 받게 합니다.

이런 목록에는 공통된 약점이 둘 있습니다. 하나는 목록을 통과해도 목록 바깥은 여전히 알 수 없다는 것이고, 다른 하나는 목록이 공개되는 순간 그것을 겨냥한 최적화가 시작된다는 것입니다. 시험을 통과하도록 만든 시스템이 시험이 재려던 능력을 가졌다는 보장은 없습니다.

한 걸음 나은 접근은 하나의 선 대신 격자를 쓰는 것입니다. 2023년에 DeepMind 연구진이 제안한 「Levels of AGI」가 그런 방식으로, 성능(얼마나 잘하는가)과 범용성(얼마나 넓게 쓰이는가)을 별도의 축으로 두고 각 칸에 이름을 붙였습니다. 이 격자에서 보면 오늘의 LLM은 범용 쪽 축에서는 초기 단계이고, 좁은 축에서는 이미 사람을 넘어선 칸(체스, 단백질 구조 예측)이 따로 존재합니다. AI 전체를 한 점으로 찍지 않아도 되는 것이 이 방식의 이점입니다.

성능과 범용성 격자

세 가지 축

실무에서 판단할 때는 아래 셋을 따로 재는 편이 훨씬 유용합니다. 하나로 뭉뚱그린 "지능"보다 다투기가 쉽기 때문입니다.

자율성은 목표를 사람이 매번 주어야 하는지, 아니면 큰 목표를 받아 스스로 쪼개고 중간 실패를 수습하며 이어 가는지를 봅니다. 요즘의 에이전트 논의가 거의 이 축 위에 있습니다.

전이는 한 영역에서 배운 구조를 다른 영역에 옮겨 쓰는 능력입니다. 바둑에서 익힌 "지금 손해를 보고 나중에 이득을 얻는다"는 감각을 협상이나 일정 계획에 가져다 쓸 수 있는가 하는 물음입니다.

표본 효율(sample efficiency)은 같은 수준에 도달하는 데 필요한 예시의 수를 말합니다. 사람은 새 보드게임의 규칙을 몇 판 보고 익히지만, 지금의 학습 방식은 같은 수준에 이르는 데 훨씬 많은 사례를 필요로 합니다. 이 격차가 좁혀지는지를 보는 것이 "정도의 문제"를 숫자로 다투는 방법입니다.

정의와 시점

세 축을 갈라 놓고 나면 "AGI는 언제 오는가"라는 질문이 왜 답이 갈리는지가 보입니다. 정의를 낮게 잡으면 이미 지났고, 높게 잡으면 수십 년입니다. 예측이 다른 것이 아니라 재는 대상이 다른 것입니다.

실제로 업계에서도 단계를 나눠 쓰는 관행이 자리 잡았습니다. OpenAI가 2024년에 내부적으로 다섯 단계 — 대화하는 단계, 추론하는 단계, 행동하는 단계, 새로운 것을 발명하는 단계, 조직을 운영하는 단계 — 를 쓴다고 알려진 것이 대표적입니다. 이런 단계 구분의 쓸모는 순위가 아니라, 어느 단계를 두고 말하는지를 밝히도록 강제하는 데 있습니다.

그러니 "AGI 몇 년"이라는 숫자를 들으면 먼저 되물어야 합니다. 어떤 정의로 말하는가. 이 질문에 답이 없는 예측은 검증할 수도 반박할 수도 없습니다.

초지능과 지능 폭발

ASI(Artificial Super Intelligence, 초지능)는 사실상 모든 인지 영역에서 인류 최고 수준을 넘어서는 AI를 가리킵니다. 지금 존재하지 않고, 어떻게 만들지도 알려져 있지 않은 가정 위의 개념입니다.

재귀적 자기 개선

이 개념이 진지하게 다뤄지는 이유는 하나의 논증 때문입니다. 1965년에 수학자 I. J. Good이 정리한 형태가 원형입니다. 사람보다 뛰어난 기계가 나오면 그 기계가 할 수 있는 일 중에는 더 나은 기계를 설계하는 일도 들어 있고, 그렇게 만들어진 다음 세대는 또 그다음 세대를 더 빨리 만듭니다. 이 되먹임이 계속되면 능력이 짧은 기간에 폭발적으로 커진다는 것이 지능 폭발(intelligence explosion) 논증입니다. 2014년에 나온 닉 보스트롬의 『Superintelligence』가 이 논증과 그 위험을 체계적으로 정리했습니다.

세대마다의 능력을 InI_n 이라 하고 개선 속도가 현재 능력에 비례한다고 두면 다음 꼴이 됩니다.

In+1=In+αIn2I_{n+1} = I_n + \alpha I_n^2

이 식은 빠르게 발산합니다. 다만 발산은 결론이 아니라 가정을 다시 쓴 것입니다. "능력이 높을수록 개선이 빠르다"를 식에 넣었으니 폭발이 나오는 것이 당연합니다. 이 논증을 평가한다는 것은 곧 그 가정을 검토한다는 뜻입니다.

폭발론의 전제

식이 성립하려면 최소한 넷이 필요합니다.

첫째, 지능이 하나의 축 위의 양이어야 합니다. 여러 능력이 각각 다른 속도로 늘어난다면 곱해서 하나의 수로 만들 수 없습니다.

둘째, 개선 속도가 그 양에 비례해야 합니다.

셋째, 개선의 난이도가 세대마다 일정해야 합니다. 만약 다음 개선이 지난번보다 어렵다면 — 즉 수확이 체감한다면 — 곡선은 발산하지 않고 완만해집니다. 과학의 여러 분야에서 실제로 관찰된 것은 발산이 아니라 체감 쪽입니다.

넷째, 개선에 필요한 자원이 함께 늘지 않아야 합니다. 그런데 지금까지의 능력 향상은 아이디어만으로 오지 않았습니다. 데이터, 계산 장비, 전력, 그리고 실제 세계에서 돌려 보는 실험이 함께 있어야 했습니다. 이것들은 코드처럼 즉시 복제되지 않고 물리적인 시간이 걸립니다.

지능 폭발의 되먹임과 네 전제

2008년의 이른바 「AI-Foom 논쟁」이 정확히 이 지점을 두고 벌어졌습니다. 한쪽은 능력이 한 시스템 안에서 국소적으로 급격히 커질 수 있다고 봤고, 다른 쪽은 개선이 경제 전체에 퍼져 있는 자원에 묶여 있어 완만하게 넓게 일어난다고 봤습니다. 어느 쪽도 아직 관측으로 결판나지 않았습니다.

정책적 함의

시점을 모른다는 것과 대비가 필요 없다는 것은 다른 말입니다. 확률이 낮아도 되돌릴 수 없는 결과라면 미리 준비하는 것이 합리적입니다. 초지능 논의가 정책에 남긴 몫은 대체로 그 성격입니다.

다만 이 논의와 지금 실제로 일어나는 피해를 섞지 않는 것이 중요합니다. 오늘의 규제 논의 — 위험 등급에 따른 의무, 평가와 사고 보고, 학습 연산량 기준선 — 는 초지능이 아니라 좁은 AI 단계에서 이미 나타나는 문제를 겨냥합니다. 잘못된 자동 판정, 편향, 개인정보 유출, 대규모 허위정보 같은 것들입니다. 먼 시나리오를 근거로 지금의 문제를 미루거나, 반대로 지금 문제가 있다는 이유로 장기 위험 연구를 접는 것 모두 같은 혼동입니다. 이 갈래는 AI 안전 개요와 AI 규제에서 더 자세히 다룹니다.

능력 측정

세 유형 사이 어디쯤 와 있는지를 말하려면 재야 합니다. 그런데 지금 쓰는 잣대는 대부분 좁은 AI를 재도록 만들어져 있습니다.

벤치마크의 한계

낙관론이 가장 자주 드는 근거가 점수 곡선입니다.

벤치마크 모델 점수
MMLU GPT-3 (2020) 43.9%
MMLU GPT-4 (2023) 86.4%
MMLU Claude 3.5 (2024) 88.7%
MMLU o3 (2025) 93.0%
HumanEval GPT-3 0%
HumanEval Codex 28%
HumanEval GPT-4 67%
HumanEval Claude 3.5 92%

MMLU에서 인간 전문가 평균으로 흔히 인용되는 값이 89.8% 언저리이니, 4~5년 만에 그 선을 지난 셈입니다. 곡선만 보면 남은 것도 곧 지날 것처럼 보입니다.

여기서 조심할 것은 이 표가 재는 대상입니다. 이것은 정해진 문제집에서의 점수이지 범용성이 아닙니다. 문제집은 유한하고, 대개 공개되어 있고, 만든 사람의 관심사에 따라 편중되어 있습니다. 정확히 그 이유로 점수가 오르는 방식이 두 가지 있습니다. 능력이 늘어서 오를 수도 있고, 그 문제집에 맞춰져서 오를 수도 있습니다.

오염과 과적합

오염(contamination)은 평가에 쓸 문제나 그 변형이 학습 데이터 안에 이미 들어가 있는 상태를 말합니다. 웹을 통째로 긁어 학습하는 이상, 공개된 벤치마크는 발표된 시점부터 조금씩 오염됩니다. 문제와 풀이가 블로그, 논문, 코드 저장소에 그대로 옮겨지기 때문입니다.

증상은 알아보기 쉽습니다. 공개 세트에서는 점수가 오르는데, 같은 난이도로 새로 만든 비공개 문제에서는 그만큼 오르지 않습니다. 이 격차가 벌어질수록 그 벤치마크는 잣대로서의 수명이 다한 것입니다.

과적합은 조금 다른 문제입니다. 벤치마크가 목표가 되는 순간 그것은 더 이상 좋은 잣대가 아니라는, 이른바 굿하트의 법칙입니다. 연구도 제품도 점수로 평가받으므로 자원은 점수가 오르는 쪽으로 흘러갑니다. 나쁜 의도가 없어도 일어납니다.

확인하는 방법은 하나뿐입니다. 같은 것을 묻되 겉모습을 바꿔 다시 내는 것입니다. 초등 수준의 문장제 문제 모음인 GSM8K를 두고, 등장인물 이름과 숫자만 바꿔 같은 구조의 문제를 새로 만들어 다시 재 본 실험이 있었습니다. 점수는 떨어졌고, 답과 무관한 문장을 한 줄 끼워 넣자 더 크게 떨어졌습니다. 사람이라면 무시하고 지나갈 문장이 계산을 흔든 것입니다. 이 결과가 능력이 없다는 증명은 아니지만, 점수 한 칸을 이해의 크기로 읽으면 안 된다는 근거로는 충분합니다.

점수가 오르는 두 갈래

표본 효율

그래서 아예 다른 것을 재려는 흐름이 있습니다. 2019년에 프랑수아 숄레가 「On the Measure of Intelligence」에서 낸 제안이 대표적입니다. 지능은 이미 쌓인 기술의 양이 아니라 새 기술을 얻는 효율이라는 것입니다. 이 정의를 따르면, 아무리 많은 것을 할 줄 알아도 그것이 방대한 학습에서 온 것이라면 지능의 증거로 세지 않습니다.

이 정의를 시험으로 옮긴 것이 ARC입니다. 작은 격자 그림 몇 쌍을 보여 주고 그 안에 숨은 규칙을 알아내 새 격자에 적용하게 합니다. 문제마다 규칙이 다르고 예시는 두세 개뿐이라, 미리 외워 둘 것이 거의 없습니다. 사람은 대체로 쉽게 풀고 모델은 오래 어려워했습니다.

2024년 말에 높은 연산량을 쓴 추론 모델이 이 시험에서 큰 폭의 점수를 내면서 논쟁이 붙었습니다. 한 문제에 막대한 계산을 들여 푸는 방식이 "적은 예시로 익히는 능력"의 증거인지, 아니면 다른 자원으로 같은 곳에 도달한 것인지가 쟁점이었습니다. 이후 더 어렵게 설계된 후속 판이 나오자 점수는 다시 내려갔습니다.

여기서 얻을 교훈은 어느 쪽이 이겼는가가 아닙니다. 잣대는 한 번 세워 두는 물건이 아니라 계속 다시 만들어야 하는 물건이라는 것입니다. 어떤 벤치마크든 발표되는 순간부터 낡기 시작합니다.

현재 위치

넘어선 영역

이미 사람보다 잘하는 영역은 분명히 있습니다. 바둑과 체스, 단백질 구조 예측, 대량의 문서를 분류하고 요약하는 속도, 그리고 여러 표준화된 지식 시험입니다.

이 목록에는 공통점이 있습니다. 정답이 명확히 정의되고, 채점이 자동으로 되며, 데이터가 많거나 스스로 만들어 낼 수 있다는 것입니다. 세 조건이 갖춰진 곳에서 지금의 학습 방식은 대단히 강합니다. 그리고 이 세 조건은 앞에서 말한 좁은 AI의 정의와 정확히 겹칩니다.

남은 구멍

반대로 여전히 어려운 것들도 목록의 성격이 뚜렷합니다.

긴 호흡의 일이 그렇습니다. 며칠짜리 목표를 스스로 단계로 쪼개고, 중간에 잘못된 판단을 알아채고, 되돌아와 고치는 흐름은 아직 사람의 감독 없이 안정적으로 돌아가지 않습니다.

물리 세계도 그렇습니다. 여기에는 오래된 관찰이 있습니다. 사람에게 어려워 보이는 일(체스, 적분)이 기계에는 쉽고, 사람에게 너무 쉬워 의식조차 하지 않는 일(처음 보는 물건을 집어 올리기, 어질러진 방을 지나가기)이 기계에는 어렵다는 모라벡의 역설입니다. 진화가 오래 다듬은 능력일수록 코드로 옮기기 어렵다는 설명이 따라붙습니다.

새 상황에서의 표본 효율도 그대로 남아 있습니다. 그리고 자기 한계를 아는 것 — 모르는 것을 모른다고 말하고 멈추는 것 — 은 오히려 성능이 오를수록 눈에 띄는 문제가 됐습니다. 틀린 답이 그럴듯해질수록 사람이 걸러 내기 어려워지기 때문입니다.

이 목록의 공통점은 앞의 목록을 뒤집은 것입니다. 채점이 자동이 아니고, 데이터가 적고, 세계와 주고받아야 합니다.

빗나간 예측

시점 예측의 역사도 함께 볼 필요가 있습니다.

1956년 다트머스 회의의 제안서는 열 명이 두 달 동안 모이면 상당한 진전을 낼 수 있다고 적었습니다. 1965년에 허버트 사이먼은 20년 안에 기계가 사람이 하는 어떤 일이든 할 수 있게 되리라고 썼습니다. 1970년 무렵 마빈 민스키가 잡지 인터뷰에서 몇 년 안에 평균적인 인간 수준의 기계가 나온다고 말한 것도 자주 인용됩니다. 그 뒤에 온 것은 두 번의 겨울이었습니다.

빗나간 예측에는 반복되는 구조가 있습니다. 지금 빠르게 좋아지는 축의 기울기를, 아직 손도 대지 못한 축에 그대로 옮겨 그리는 것입니다. 언어 능력이 4년 만에 이만큼 늘었으니 자율성과 물리 세계도 비슷한 속도로 따라올 것이라는 추론이 그렇습니다. 두 축의 조건이 같다는 근거가 있어야 성립하는 추론인데, 그 근거가 대체로 빠져 있습니다.

그렇다고 "그러니 오지 않는다"로 가면 같은 실수를 방향만 바꿔 반복하는 것입니다. 빗나간 기록은 시점 예측을 의심할 근거이지 가능성 자체를 부정하는 근거가 아닙니다. 실제로 지난 몇 년 사이 회의론 쪽에서 "이건 절대 안 될 것"이라고 꼽았던 항목 여럿이 넘어갔습니다. 남은 것은 확신이 아니라, 무엇을 보면 생각을 바꿀지 미리 정해 두는 태도입니다.

AGI 달성 논쟁

분류의 쓰임

기대치 설정

설계할 때 이 분류를 쓰는 방법은 간단합니다. 맡기려는 과제의 경계를 문장으로 적어 보는 것입니다. 입력이 무엇이고 출력이 무엇이며 잘한 것을 무엇으로 재는지 세 줄로 적히면 지금 기술로 맡길 수 있는 꼴입니다. 적히지 않으면 아직 사람이 붙어 있어야 하는 일이고, 프롬프트를 아무리 다듬어도 잘 되지 않습니다.

실패하는 방식이 다르다는 점도 함께 봐야 합니다. 좁은 AI는 범위 밖에서 조용히 틀립니다. 오류를 내며 멈추는 것이 아니라 그럴듯한 출력을 그대로 내놓습니다. 그래서 실제 시스템에서는 모델을 더 좋은 것으로 바꾸는 일보다 범위 밖 입력을 걸러 내고, 확신도가 낮을 때 사람에게 넘기고, 결과를 검증하는 장치를 두는 일이 더 크게 작동할 때가 많습니다.

기대치를 낮추라는 말이 아닙니다. 어디에 기대를 걸 것인지를 옮기라는 말입니다. 경계가 분명한 과제를 여러 개 쌓아 올리는 쪽이, 하나의 시스템이 알아서 다 해 주기를 기다리는 쪽보다 지금은 훨씬 멀리 갑니다.

주장 검증

바깥의 주장을 읽을 때도 같은 잣대를 씁니다. "AGI를 향해", "인간 수준", "자율 에이전트" 같은 문구를 만나면 세 가지를 물으면 됩니다.

첫째, 어떤 정의를 쓰는가. 성능 축인가 범용성 축인가, 자율성·전이·표본 효율 중 무엇을 말하는가.

둘째, 무엇으로 쟀는가. 벤치마크 이름과 조건 — 연산량, 시도 횟수, 도구 사용 여부 — 이 함께 적혀 있는가.

셋째, 그 평가 세트가 공개된 것인가. 공개된 것이라면 오염과 과적합을 어떻게 배제했는지 설명이 있는가.

셋 다 답이 없으면 그것은 기술 주장이 아니라 마케팅 문구로 읽는 편이 안전합니다. 반대로 셋에 답이 있으면, 결론에 동의하지 않더라도 어디가 다른지를 짚어 이야기할 수 있습니다. 분류의 쓸모는 결국 그 지점에 있습니다. 대화를 낱말 싸움에서 확인 가능한 주장으로 옮겨 놓는 것입니다.

정리

  • 좁은 AI는 사람이 미리 그어 준 경계 안에서만 작동합니다. 오늘 쓰는 모델은 사실상 전부 여기에 있고, 넓이가 아니라 경계의 존재가 기준입니다.
  • AGI는 하나의 선이 아니라 성능과 범용성의 격자로 보는 편이 정확합니다. 자율성·전이·표본 효율을 따로 재면 논쟁이 검증 가능한 형태가 됩니다.
  • ASI는 재귀적 자기 개선이라는 논증 위에 서 있고, 그 논증은 네 가지 전제에 기대고 있습니다. 전제를 검토하는 것이 이 논의를 다루는 방법입니다.
  • 벤치마크 점수는 능력의 대리 지표일 뿐이며, 오염과 과적합 때문에 시간이 갈수록 무뎌집니다. 잣대는 계속 새로 만들어야 합니다.
  • 시점 예측은 70년 동안 반복해서 빗나갔습니다. 그것은 시점을 의심할 근거이지 가능성을 부정할 근거가 아닙니다.

다음 글에서는 AI가 지식을 얻는 방식의 두 갈래, 기호주의와 통계주의를 살펴봅니다. 규칙을 사람이 적어 넣던 방식에서 데이터로부터 뽑아내는 방식으로 무게가 옮겨 간 70년의 이야기이고, 이번 글에서 본 "능력이 어디서 왔는가"라는 질문의 뿌리이기도 합니다.


읽어주셔서 감사합니다. 😊

LATEST

AI 기초의 최신 글

AI 기초2026.08.19

가드레일을 테스트한다는 것

가드레일 테스트는 단위 테스트와 성질이 다릅니다. 세트를 두 벌로 나누는 이유, 통과 기준을 절대값 대신 기준선으로 잡는 법, 세트가 오염되는 경로, 표본 크기가 결정에 미치는 영향을 정리합니다.

43 MIN
AI 기초2026.08.19

거절도 설계한다: 안 된다고 말하는 법

거절은 안전 장치의 마지막 동작이면서 사용자가 제품을 평가하는 순간입니다. 켜고 끄는 스위치 대신 다섯 칸 사다리를 쓰는 법, 좋은 거절 문구의 조건, 과잉 거절을 재는 방법을 정리합니다.

41 MIN
AI 기초2026.08.19

콘텐츠 조정: 정책을 판정 가능한 것으로 만들기

정책 문서가 있어도 판정은 안 됩니다. 두 사람이 같은 라벨을 붙일 수 있게 정책을 쪼개는 법, 임계값을 둘로 두는 이유, 검토 큐가 터지지 않게 설계하는 법, 라벨마다 따로 봐야 하는 지표를 정리합니다.

50 MIN