지난 글에서 사람이 규칙을 적던 기호주의 AI가 데이터가 규칙을 만드는 통계적 AI에 자리를 내주기까지의 70년을 따라가며, 그 전환이 경쟁의 자리를 데이터의 양·품질·독점으로 옮겨 놓았다는 것을 살펴봤다. 그렇다면 지금 이 순간 AI 세계에서는 어떤 주체들이 어떤 방식으로 경쟁하고 있을까?
이 글은 회사 이름을 늘어놓는 대신 층으로 지도를 그린다. 이름은 반년이면 바뀌지만 층은 잘 안 바뀌고, 층을 알면 새로 나온 회사가 어디에 들어가는지 스스로 짚을 수 있기 때문이다. 아래에서 위로 칩, 클라우드, 모델, 응용 네 층을 세우고 층마다 누가 무엇으로 돈을 버는지, 어디가 좁아서 위층 전체를 붙잡고 있는지, 무엇이 바뀌면 이 그림을 다시 그려야 하는지를 본다. 앞으로 깊이 다룰 기술들이 이 지도의 어디에 놓이는지 먼저 조감해 두면 이후 글들이 훨씬 잘 붙는다.
스택의 네 층
지도에 축이 없으면 목록이 된다. AI 생태계를 볼 때 가장 쓸모 있는 축은 아래층의 산출물이 위층의 원가가 된다는 것이다. 칩을 파는 회사의 매출은 클라우드의 비용이고, 클라우드의 매출은 모델 회사의 비용이며, 모델 회사가 받는 토큰 값은 응용 회사의 매출원가다. 이 한 줄만 쥐고 있으면 어떤 발표가 나와도 그것이 누구의 원가를 올리고 누구의 마진을 깎는지 바로 셈이 선다.
층의 경계
맨 아래는 칩 층이다. 학습과 추론을 실제로 굴리는 가속기를 설계하고 만드는 자리로, NVIDIA의 H100·H200 같은 GPU가 가장 널리 쓰이고 구글의 TPU나 아마존의 자체 칩처럼 클라우드 사업자가 직접 설계한 것도 있다. 이 층에는 칩만 있는 게 아니다. 칩에 붙는 고대역폭 메모리, 그 칩을 수만 장 꽂아 둘 데이터센터, 그리고 그 건물이 끌어 쓰는 전력과 냉각이 전부 같은 층이다. 계산 능력을 물리적으로 만들어 내는 모든 것이 여기 있다.
그 위가 클라우드 층이다. 칩을 사서 시간 단위로 빌려주는 자리다. AWS, Google Cloud, Azure 같은 종합 사업자와 GPU 임대만 전문으로 하는 회사들이 함께 있다. 스타트업은 이 층 없이는 대형 모델을 학습할 수 없다 — 수천 장짜리 클러스터를 직접 사서 세우는 것은 자본이 아니라 조달 기간의 문제이기도 하다. 모델을 만들고 돌리는 소프트웨어 도구도 이 층에 붙어 있다. PyTorch가 사실상 표준이 됐고 고성능 연구에는 JAX가 함께 쓰이며, 실험 추적에는 Weights & Biases와 MLflow, LLM 운영의 관찰성에는 LangSmith와 Langfuse 같은 도구가 자리를 잡았다.
그 위가 모델 층이다. 여기 있는 것이 파운데이션 모델이다. 파운데이션 모델은 방대한 데이터로 한 번 크게 학습해 두고 요약이든 번역이든 코딩이든 여러 과제에 그대로 갖다 쓰는 범용 모델을 말한다. 과제마다 모델을 따로 만들던 시절과 갈리는 지점이 여기다. 클로즈드 진영에는 OpenAI(GPT-4o, o3), Anthropic(Claude 시리즈), Google DeepMind(Gemini 시리즈)가 있고, 가중치를 공개하는 진영에는 Meta의 Llama 계열, 프랑스 Mistral AI의 Mixtral 계열, 중국의 DeepSeek과 Qwen 계열이 있다.
맨 위가 응용 층이다. 모델을 특정 업무에 붙여 파는 제품들이다. 코드 편집기, 고객 응대 시스템, 계약서 검토 도구, 사내 검색이 전부 여기 있다. 이 층은 아래 세 층을 다 지나온 값을 원가로 치르고, 그 대신 최종 고객과 직접 만난다.
층별 수익원
층마다 돈을 버는 방식이 다르고, 그 차이가 각 층의 성격을 만든다. 칩 층은 대당 판매 마진으로 번다. 공급이 수요보다 적은 동안에는 가격 결정권이 파는 쪽에 있고, 그래서 이 층의 이익률이 가장 두껍다. 클라우드 층은 시간당 임대료로 번다. 여기서 중요한 숫자는 가격이 아니라 사용률이다 — 사 놓은 GPU가 놀고 있는 시간이 그대로 손실이라, 클라우드는 장기 선계약으로 그 시간을 미리 메우려 한다.
모델 층은 토큰 단위 종량제와 구독으로 번다. 학습비는 모델을 내놓기 전에 한꺼번에 나가고 회수는 그 뒤로 몇 년에 걸쳐 토큰으로 들어오므로, 이 층의 손익은 「얼마나 오래 그 모델이 팔리는가」에 달려 있다. 새 모델이 반년 만에 앞 모델을 밀어내면 회수 기간이 그만큼 짧아진다. 응용 층은 좌석당 구독이나 처리 건당 요금으로 번다.
응용 층의 계산을 한 번 따라가 보면 이 구조가 손에 잡힌다. 문서 한 건을 처리하는 데 입력 8,000토큰, 출력 800토큰이 들고 입력이 100만 토큰에 3달러, 출력이 15달러라고 하자. 입력 값은 0.024달러, 출력 값은 0.012달러니 건당 원가는 0.036달러다. 좌석당 월 30달러를 받는데 한 사람이 하루 20건씩 20일을 쓰면 월 400건, 원가는 14.4달러다. 매출의 절반이 모델 층으로 넘어간다. 응용 회사가 프롬프트를 줄이고 캐시를 붙이고 작은 모델로 갈아타려 애쓰는 이유가 이 한 줄에 다 들어 있다.
병목
층 하나가 좁으면 위층 전체가 그 폭에 맞춰진다. 2025~2026년의 좁은 자리는 아래 두 층이다. 최신 가속기 자체가 부족하고, 확보했다 해도 그것을 꽂아 둘 전력과 냉각을 갖춘 건물이 부족하다. 데이터센터는 짓는 데 몇 년이 걸리고 전력 계통 연결은 그보다 더 걸리므로, 이 병목은 돈으로 한 분기에 풀리는 종류가 아니다.
칩 안쪽에도 좁은 자리가 있다. 고대역폭 메모리는 가속기 바로 옆에 층층이 쌓아 붙이는 메모리로, 계산 유닛에 데이터를 얼마나 빨리 넣어 주느냐를 정한다. 큰 모델의 추론은 계산보다 이 메모리 대역폭에서 먼저 막히는 경우가 많아, 가속기를 몇 장 확보했느냐만큼이나 그 장에 붙은 메모리가 얼마나 되느냐가 실제 처리량을 정한다.
병목은 가격표에만 나타나는 게 아니다. 모델 회사가 신규 가입을 잠그거나 무료 한도를 줄이는 것, 클라우드가 장기 선계약이 있는 고객에게만 최신 인스턴스를 주는 것, 특정 모델의 응답 속도가 시간대에 따라 눈에 띄게 흔들리는 것이 전부 아래층이 좁다는 신호다.
여기에 소프트웨어 병목이 하나 더 겹친다. CUDA는 NVIDIA GPU 위에서 계산을 짜 넣는 소프트웨어 층인데, 지난 십수 년간 쌓인 커널과 라이브러리가 전부 그 위에 있다. 다른 회사가 성능 좋은 칩을 내놓아도 그 코드를 옮기는 비용 때문에 곧바로 갈아타지 못한다. 칩 층의 잠금장치는 실리콘이 아니라 이쪽에 가깝다.
수직 통합
지도를 볼 때 가장 자주 하는 실수가 회사를 한 칸에 넣는 것이다. 큰 회사일수록 여러 층에 걸쳐 있다. 구글은 TPU로 칩 층, Google Cloud로 클라우드 층, Gemini로 모델 층, 검색과 워크스페이스로 응용 층에 동시에 서 있다. 마이크로소프트와 아마존은 클라우드 층을 쥐고 모델 회사와의 지분·제휴로 모델 층에 발을 걸치면서 자체 칩도 만든다.
왜 걸치는지는 위의 원가 사슬이 설명한다. 아래층의 가격 결정권에서 벗어나려는 것이다. 클라우드가 자체 칩을 만드는 이유, 모델 회사가 칩 설계와 데이터센터에 손을 대는 이유, 칩 회사가 클라우드와 모델 회사에 투자하는 이유가 전부 같다 — 자기 원가를 남이 정하는 상태를 오래 두지 않으려는 것이다.
그래서 한 회사를 볼 때는 층마다 어떤 얼굴인지를 따로 봐야 한다. 어떤 클라우드는 모델 회사의 주주이면서 동시에 그 회사의 최대 고객이고 또 최대 공급자다. 같은 두 회사가 한 층에서는 경쟁하고 다른 층에서는 거래한다. 「이 회사는 누구 편인가」라는 질문이 자꾸 답이 없는 이유가 여기 있다.
프런티어 모델
프런티어 모델은 그 시점에 가장 앞선 능력을 내놓는 최상위 모델을 가리킨다. 층으로 보면 모델 층의 맨 앞줄이고, 이 자리에 설 수 있는 회사가 몇인지가 생태계 전체의 모양을 정한다.
진입 조건
프런티어에 서려면 네 가지가 동시에 있어야 한다. 첫째는 자본이다. 여기서 세는 것은 성공한 학습 한 번의 비용이 아니라 그 앞에서 엎어진 학습들까지 포함한 예산이다. 큰 학습은 도중에 발산하거나 데이터 구성이 잘못돼 버려지는 일이 흔하고, 그 실패를 몇 번 감당할 수 있느냐가 실제 진입 장벽이다.
둘째는 칩이다. 돈이 있어도 수천 장짜리 클러스터를 원하는 시점에 확보하는 것은 별개의 문제다. 셋째는 데이터다. 웹에서 긁은 것에 더해 출판사·언론사와 맺은 라이선스 계약, 사람이 붙어 만든 지시·선호 데이터, 그리고 모델로 만들어 낸 합성 데이터가 함께 들어간다. 저작권 분쟁이 여러 나라에서 진행 중이라 이 항목은 법무 비용까지 포함한 원가로 봐야 한다.
넷째는 인력이다. 사전학습을 실제로 돌려 본 사람은 세계적으로 많지 않고, 이 사람들이 몇 개 회사에 몰려 있다. 네 조건이 곱셈으로 걸리기 때문에 프런티어 자리는 자연스럽게 소수로 좁혀진다.
폐쇄와 공개
모델 층은 가중치를 주느냐로 크게 갈린다. 가중치는 학습이 끝난 모델이 들고 있는 숫자 뭉치로, 이것만 있으면 같은 모델을 누구의 서버에서든 그대로 돌릴 수 있다. 가중치를 주지 않고 API로만 파는 쪽이 클로즈드 진영이고, 받아 가도록 공개하는 쪽이 오픈 웨이트 진영이다.
이 선택은 취향이 아니라 수익 구조와 통제의 문제다. 가중치를 내주면 그 모델로 얼마가 벌리는지를 더 이상 세지 못하고, 안전장치를 걷어낸 변형이 도는 것도 막지 못한다. 대신 아무나 가져다 쓰는 만큼 표준이 되기 쉽고 생태계가 빨리 붙는다.
회수 경로
클로즈드 진영은 API 종량제, 구독, 기업 계약으로 회수한다. 능력의 우위가 곧 가격의 근거라 새 모델이 나올 때마다 값을 다시 매길 수 있다. 오픈 웨이트 진영은 가중치를 공짜로 주고 다른 자리에서 회수한다 — 자기 클라우드에서 돌게 만들거나, 자기 플랫폼과 하드웨어를 더 팔거나, 호스팅과 지원을 유료로 붙이거나, 표준의 자리를 먼저 차지한다.
여기 깔린 셈이 보완재 논리다. 내 제품이 잘 팔리려면 함께 쓰이는 물건이 싸야 하므로, 그 물건을 아예 공짜로 만들어 시장을 넓히는 쪽이 이득일 때가 있다. 모델 층이 통째로 싸지면 손해를 보는 쪽은 모델을 파는 회사지 그 위나 아래에서 다른 것을 파는 회사가 아니다.
이 구조가 쓰는 쪽에 남긴 결과는 갈아 끼우기가 쉬워졌다는 것이다. 여러 진영의 모델을 같은 인터페이스로 부를 수 있어 한 줄만 바꾸면 다른 회사의 모델로 넘어간다.
# 다양한 모델 API를 통합적으로 사용하는 예시 (LiteLLM)
import litellm
# OpenAI
response_gpt = litellm.completion(
model="gpt-4o",
messages=[{"role": "user", "content": "안녕하세요"}]
)
# Anthropic Claude
response_claude = litellm.completion(
model="claude-opus-4-7",
messages=[{"role": "user", "content": "안녕하세요"}]
)
# 오픈소스 Llama (Ollama를 통해 로컬 실행)
response_llama = litellm.completion(
model="ollama/llama3.1",
messages=[{"role": "user", "content": "안녕하세요"}]
)
바꾸는 데 드는 것이 한 줄이라는 사실이 모델 층의 가격 협상력을 깎는다. 실제로는 프롬프트를 다시 손봐야 하고 평가를 다시 돌려야 하므로 한 줄로 끝나지는 않지만, 계약을 새로 쓸 때 「다른 데로 갈 수 있다」가 빈말이 아닌 상태인 것은 분명하다.
오픈 웨이트
오픈소스와의 차이
소프트웨어에서 오픈소스라고 하면 소스코드를 준다는 뜻이다. 읽을 수 있고, 고칠 수 있고, 마음만 먹으면 처음부터 다시 빌드할 수 있다. 모델은 가중치를 받아도 그렇게 되지 않는다. 학습에 쓴 데이터도, 데이터를 거른 기준도, 학습을 돌린 레시피도 대개 함께 오지 않기 때문이다. 결과물은 쓸 수 있지만 다시 만들 수는 없다. 그래서 이 부류를 오픈소스라 부르지 않고 오픈 웨이트라는 다른 이름으로 부른다.
이 구분은 말장난이 아니다. 재현할 수 없으면 감사도 제한된다 — 모델이 특정 편향을 보일 때 그것이 어느 데이터에서 왔는지 밖에서는 확인할 길이 없다. 오픈소스 이니셔티브가 2024년에 내놓은 AI용 정의가 학습 데이터에 대한 정보까지 요구한 것도 같은 이유였고, 그 기준으로 보면 가중치만 공개된 모델 대부분은 오픈소스가 아니다.
라이선스 범위
받아 온 가중치로 무엇을 할 수 있는지는 라이선스가 정하고, 이것이 세 갈래로 갈린다. 하나는 Apache 2.0이나 MIT처럼 소프트웨어에서 쓰던 표준 라이선스를 그대로 붙인 것으로, 상업적 사용과 재배포에 사실상 제약이 없다. 둘은 회사가 직접 쓴 커뮤니티 라이선스다. 상업적 사용은 열어 두되 사용자 규모가 아주 큰 회사는 따로 허가를 받게 하거나, 용도를 제한하거나, 그 모델의 출력으로 다른 모델을 학습시키는 것을 금지하는 조항이 붙는다. 셋은 연구 전용이다.
실무에서 확인할 것은 네 가지로 정리된다. 상업적 사용이 되는가, 파인튜닝한 파생 모델을 다시 배포할 수 있는가, 그 모델의 출력으로 우리 모델을 학습시킬 수 있는가, 우리 서비스 규모가 조항에 걸리는가. 「오픈」이라는 낱말만 보고 시작했다가 배포 직전에 걸리는 일이 실제로 있으므로, 이 네 줄은 기술 검토가 아니라 법무 검토로 넘길 자리다.
온프레미스와 파인튜닝
가중치가 손에 있으면 배치의 선택지가 늘어난다. 온프레미스는 모델을 남의 API가 아니라 우리가 통제하는 서버 안에서 돌리는 배치를 말한다. 데이터가 회사 밖으로 나가지 않고, 네트워크를 한 번 덜 타니 지연이 줄며, 사용량이 튀어도 요금이 아니라 처리량이 흔들린다. 금융·의료·공공처럼 데이터 반출 자체가 규제 대상인 곳에서 오픈 웨이트 수요가 큰 이유다.
파인튜닝은 이미 학습된 모델의 가중치를 우리 데이터로 조금 더 조정하는 일이다. API로도 제한된 형태의 파인튜닝을 제공하는 곳이 있지만, 어느 층을 얼마나 건드릴지까지 정하려면 가중치가 있어야 한다.
다만 온프레미스가 공짜라는 오해는 피해야 한다. GPU 구입비의 상각, 놀고 있는 시간, 운영 인력, 새 모델이 나올 때마다의 이전 비용이 전부 원가에 들어간다. 계산은 단순하다 — 한 달에 처리할 토큰 수에 API 단가를 곱한 값과, 그 물량을 감당할 GPU를 한 달 빌리거나 사서 굴리는 값을 나란히 놓아 보면 된다. 물량이 적으면 API가 싸고, 꾸준히 많으면 어느 지점부터 자기 서버가 싸진다. 그 교차점이 어디인지 모르고 결정하면 어느 쪽을 골라도 근거가 없다.
추론 비용
추론은 학습이 끝난 모델을 실제로 돌려 답을 만드는 단계다. 학습비는 몇 번 나가고 마는 돈이지만 추론비는 서비스가 살아 있는 내내 나가는 돈이라, 응용 층에서 무엇이 사업이 되는지를 실제로 정하는 것은 이쪽이다.
가격 하락 폭
숫자로 보면 방향이 분명하다. 2023년에 GPT-4가 나왔을 때 입력은 100만 토큰에 30달러, 출력은 60달러였다. 이듬해 GPT-4o는 입력 5달러, 출력 15달러로 내려왔고, 같은 해에 나온 소형 모델들은 입력이 0.2달러 아래였다. 두 해 사이에 자릿수가 바뀐 것이다.
이 하락이 응용 층에서 일어난 일의 절반을 설명한다. 2023년에 원가 때문에 접었던 기획 — 모든 문서를 전부 읽히기, 모든 대화를 요약해 두기, 모든 커밋에 리뷰 붙이기 — 이 값이 100분의 1이 되면 그냥 성립한다. 새 기능이 생겨서가 아니라 같은 기능의 값이 내려와서 제품이 된 경우가 훨씬 많다.
단가 절감 기법
값을 내린 것은 한 가지가 아니라 네 갈래다. 양자화는 가중치를 16비트 대신 8비트나 4비트로 줄여 저장하는 방법이다. 메모리도 대역폭도 함께 줄어 같은 카드에 더 큰 모델이 들어가고 더 빨리 돈다. 증류는 큰 모델의 출력을 교재 삼아 작은 모델을 가르치는 방법으로, 작은 모델이 제 크기로는 못 낼 품질을 내게 만든다.
전문가 혼합은 모델 안에 작은 전문가 여럿을 두고 토큰마다 그중 일부만 켜는 구조다. 전체 파라미터는 크게 두면서 한 번에 계산하는 양은 작게 유지해 품질과 단가를 동시에 챙긴다. 마지막은 서빙 쪽이다. 여러 요청을 묶어 한 번에 처리하는 배칭, 앞서 계산한 것을 다시 쓰는 캐싱, 작은 모델이 먼저 초안을 내고 큰 모델이 확인만 하는 투기적 디코딩 같은 기법들이다. GPU 한 장이 동시에 몇 건을 처리하느냐가 그대로 단가이므로, 이 층의 개선은 곧바로 가격표에 반영된다.
버티는 비용
그런데 단가가 내려가도 건당 비용이 따라 내려가지 않는 자리가 셋 있다. 첫째는 긴 문맥이다. 어텐션의 계산량은 길이의 제곱으로 늘고, 이미 읽은 토큰의 중간 결과를 들고 있는 KV 캐시는 길이에 비례해 메모리를 먹는다. 층 80개, 은닉 차원 8,192, 16비트 저장을 가정하면 토큰 하나가 차지하는 KV 캐시는 대략 2.5MB다. 10만 토큰 문맥이면 한 사용자당 250GB — 캐시 공유 기법으로 8분의 1로 줄여도 30GB가 넘는다. 문맥 창을 늘리는 것이 왜 카탈로그의 숫자만큼 간단하지 않은지가 여기 있다.
둘째는 추론 모델이다. 답을 내기 전에 생각을 토큰으로 풀어 쓰는 방식이라 출력 토큰이 몇 배로 늘어난다. 단가가 같아도 한 건에 드는 값이 오른다. 셋째는 에이전트다. 사용자의 한 번 요청이 도구 호출과 재시도를 거치며 모델 호출 수십 번으로 늘어난다.
그래서 원가를 볼 때는 토큰 단가가 아니라 완료된 작업 하나를 세야 한다. 「100만 토큰에 얼마」는 계약서의 숫자이고, 사업의 숫자는 「고객이 만족한 결과 하나에 얼마」다. 이 둘이 서로 반대 방향으로 움직이는 시기가 지금이다.
응용 층
코딩·응대·문서
응용 층에서 실제로 돈이 도는 곳은 넓게 퍼져 있지 않고 세 자리에 몰려 있다. 코딩, 고객 응대, 문서 처리다. 우연이 아니라 세 자리가 공통점을 갖는다 — 입력이 이미 텍스트로 쌓여 있고, 결과가 맞았는지 비교적 싸게 확인할 수 있으며, 틀렸을 때 되돌리는 비용이 낮다.
코딩이 가장 앞선 이유가 이 셋을 다 갖췄기 때문이다. 코드는 컴파일되고 테스트가 돌아가므로 모델의 답이 틀렸는지를 사람이 읽기 전에 기계가 먼저 걸러 준다. GitHub Copilot은 편집기 안에서 다음 줄을 제안하는 방식으로 널리 퍼졌고, Cursor는 코드베이스 전체를 읽어 두고 고치는 편집기로 주목받았으며, Anthropic의 Claude Code는 터미널에서 파일을 직접 읽고 고치고 실행한다.
고객 응대는 지난 십수 년의 상담 로그가 이미 쌓여 있고 성공 기준이 해결률과 이관율로 명확하다는 점에서 붙기 좋았다. 문서 처리는 계약서·청구서·보고서처럼 입력 자체가 문서인 업무다. 반대로 더딘 곳도 같은 기준으로 설명된다 — 틀리면 되돌릴 수 없고, 확인하는 데 사람 시간이 더 드는 업무는 값이 아무리 내려가도 잘 넘어오지 않는다.
얇은 껍데기
응용 층에서 가장 자주 나오는 말이 얇은 껍데기다. 모델 API 위에 프롬프트 한 겹과 화면 하나를 얹은 제품을 가리킨다. 이런 제품이 안 남는 이유는 둘이다. 하나는 모델 회사가 다음 버전에서 그 기능을 기본으로 흡수해 버리는 것이고, 다른 하나는 경쟁자가 같은 것을 한 주 만에 복제하는 것이다. 원가는 아래층이 정하고 기능은 아래층이 흡수하니 남는 자리가 없다.
남는 제품에는 셋 중 하나가 있다. 모델이 접근할 수 없는 데이터를 쥐고 있거나, 고객의 업무 흐름 안에 박혀 있어 빼내는 비용이 크거나, 실패를 다루는 장치를 갖추고 있다. 세 번째가 특히 과소평가된다 — 평가 세트, 가드레일, 감사 기록, 사람이 개입하는 지점 같은 것들은 데모에서는 안 보이지만 실제 도입을 결정하는 자리에서는 거의 항상 물어보는 항목이다.
데이터와 워크플로
해자가 서는 자리는 결국 모델 바깥이다. 고객사의 지난 3년치 상담 이력, 결재와 승인의 순서, 사내 시스템과의 연결 같은 것들이다. 이 자산은 모델이 좋아진다고 해서 남에게 넘어가지 않는다. 오히려 모델이 좋아질수록 그 위에서 이 자산을 쥔 쪽의 값이 오른다.
에이전트가 뜬 것도 같은 흐름에서 읽힌다. 에이전트는 한 번 답하고 끝내는 대신 도구를 부르고 결과를 보고 다시 판단하기를 반복하는 프로그램이다. 도구가 곧 그 회사의 시스템이므로 에이전트를 붙이는 일 자체가 업무 흐름 안으로 들어가는 일이 된다.
# 간단한 AI 에이전트 패턴
from anthropic import Anthropic
client = Anthropic()
def run_agent(user_goal: str):
"""목표를 받아 도구를 사용해 자율적으로 수행하는 에이전트"""
messages = [{"role": "user", "content": user_goal}]
tools = [
{"name": "search_web", "description": "웹 검색 수행"},
{"name": "write_file", "description": "파일 작성"},
{"name": "run_code", "description": "코드 실행"}
]
while True:
response = client.messages.create(
model="claude-opus-4-7",
max_tokens=4096,
tools=tools,
messages=messages
)
if response.stop_reason == "end_turn":
break
# 도구 호출 처리 후 계속 반복
messages = handle_tool_calls(response, messages)
return response
이 고리에서 두 가지가 함께 늘어난다. 원가와 위험이다. 반복이 늘면 호출 수가 늘고, 도구가 늘면 모델이 잘못 부를 수 있는 문이 늘어난다. 그래서 에이전트를 쓰는 제품은 반복 횟수 상한, 도구별 권한, 되돌리기 같은 장치를 함께 짜야 한다. 도구를 붙이는 방식과 그 표준화는 에이전트가 바깥과 연결되는 법에서 따로 다룬다.
한국 생태계
한국어 모델
한국은 네이버(HyperCLOVA X), 카카오, LG(EXAONE), Upstage(SOLAR) 등이 독자 한국어 LLM을 개발해 왔다. 프런티어 자리를 정면으로 노리기보다 한국어 특화, 특정 산업 도메인, 기업 맞춤형 모델로 갈라 서는 전략이 주를 이룬다.
독자 모델이 필요한 실무적 이유 하나가 토크나이저다. 토크나이저는 문장을 모델이 다루는 조각으로 자르는 부품인데, 영어 위주로 만든 토크나이저는 같은 뜻의 한국어 문장을 훨씬 잘게 자른다. 토큰 수가 곧 값이고 곧 문맥 창의 소모량이므로, 한국어를 덜 잘게 자르는 것만으로도 원가와 처리 가능한 문서 길이가 달라진다.
층별 위치
층으로 보면 한국의 무게중심은 모델 층이 아니라 칩 층 쪽에 있다. 가속기 옆에 붙는 고대역폭 메모리를 만드는 회사들이 여기 있고, 이 자리는 세계 지도에서 훨씬 큰 칸이다. 클라우드 층과 응용 층에도 국내 사업자가 자리를 잡고 있다.
이 배치가 시사하는 것은 「한국의 AI 경쟁력」을 모델 층 하나로만 재면 그림이 틀어진다는 점이다. 층마다 따로 물어야 한다 — 어느 층에서 값을 매길 수 있고, 어느 층에서 남의 값을 받아들이고만 있는가.
규제 산업 수요
국내에서 오픈 웨이트와 온프레미스 수요가 큰 것은 규제 때문이다. 금융·의료·공공은 데이터를 밖으로 내보내는 것 자체가 심사 대상이라, 성능이 조금 낮아도 안에서 도는 모델을 고르는 결정이 합리적일 때가 많다. 클라우드 API를 쓰더라도 국내 리전과 데이터 처리 위탁 계약이 먼저 확인된다.
그래서 국내 시장에서는 「가장 똑똑한 모델」이 아니라 「반출 없이 쓸 수 있는 모델 중 가장 나은 것」이 실제 선택지가 되는 경우가 많다. 이 조건이 한국어 특화 모델과 오픈 웨이트 기반 구축 사업에 자리를 만들어 준다.
지도의 유효기간
여섯 흐름
아래 그림에 지금 지도 위에서 움직이는 흐름 여섯을 담아 뒀다. 그중 층 구조 자체를 건드리는 셋만 짚는다.
추론 모델의 부상은 답하기 전에 생각할 시간을 주는 방향이다. 파라미터를 늘리지 않고도 수학·과학·코딩에서 성능이 오른다는 것이 확인되면서, 성능을 사는 방법이 학습비 한 갈래에서 학습비와 추론비 두 갈래로 늘었다. 칩 수요의 모양도 학습 쪽에서 추론 쪽으로 옮겨 간다.
AI 에이전트의 확산은 한 번의 요청이 여러 번의 호출로 바뀌는 변화다. 응용 층이 모델을 쓰는 양이 통째로 늘어나므로 아래층 수요가 함께 커진다. 오픈 웨이트의 추격은 모델 층의 값을 아래에서 밀어 올린다. 공개 모델이 특정 용도에서 충분해지는 순간 그 용도의 API 값에 상한이 생긴다.
층을 흔드는 변수
이 지도를 다시 그려야 하는 신호는 네 가지다. 학습 비용이 자릿수로 내려가면 프런티어 자리가 소수로 좁혀져 있던 이유가 사라진다. 작은 모델이 큰 모델의 일을 대신하게 되면 칩과 클라우드 수요의 모양이 바뀐다. CUDA 밖의 가속기가 실제로 쓸 만해지면 칩 층의 병목과 잠금이 함께 풀린다. 그리고 모델 회사가 응용 층 제품을 직접 파는 폭이 넓어지면 자기 고객과 경쟁하는 구도가 되어 층 사이 경계가 다시 그려진다.
무엇을 봐야 하는지도 정해 둘 수 있다. 가격표의 방향, 신규 가입과 한도 같은 대기열의 신호, 라이선스 조항의 변화, 그리고 큰 계약의 구조다. 발표 자료의 벤치마크 점수보다 이 넷이 층의 움직임을 먼저 보여 준다.
층별 규제
규제도 층마다 다른 자리에 걸린다. 칩 층에는 수출 통제가, 모델 층에는 학습 데이터의 출처와 평가·투명성 의무가, 응용 층에는 개인정보 처리와 설명 의무가 걸린다. 같은 「AI 규제」라는 말이 어느 층에 서 있느냐에 따라 전혀 다른 일을 뜻한다.
지금 여러 나라가 공통으로 쓰는 틀은 용도의 위험도에 따라 의무를 달리 주는 방식이다. 나라별 법안의 얼개는 AI 규제에서, 개인정보 쪽은 AI와 프라이버시에서 따로 다룬다.
다음 좌표
이 글의 이름과 숫자는 2026년 상반기의 것이다. 모델 이름과 가격표는 반년이면 낡고, 어느 회사가 앞서 있는지는 그보다 더 자주 바뀐다. 대신 잘 안 바뀌는 것이 층 구조와, 층들이 서로에게 값을 매기는 방식이다. 새 발표를 만나면 이름을 외우기 전에 「이건 어느 층의 일이고 누구의 원가를 움직이나」를 먼저 물어 두면 된다.
앞으로 다룰 기술들이 이 지도의 어디에 놓이는지는 이렇게 정리된다.
- 수학 기초(선형대수, 확률, 미적분): 모든 층의 밑에 깔린 이론적 토대
- ML 알고리즘: 응용 층의 많은 시스템에서 여전히 핵심
- 딥러닝, CNN, Transformer: 모델 층의 아키텍처
- RAG, 파인튜닝: 모델 층을 응용 층에 붙이는 기법
- 에이전트, MLOps: 응용 층과 클라우드 층이 만나는 실무 영역
지금부터 다음 글들에서 이 기술들을 하나씩 깊이 파고들 것이다. 먼저 짚을 것은 이 생태계가 잘못 작동할 때 무슨 일이 벌어지는가 — AI 안전성이다. 모든 모델의 토대가 되는 수학은 수학 트랙에서 초급부터 따로 쌓는다.
읽어주셔서 감사합니다. 😊

