Azure AI Fundamentals

Azure AI Fundamentals 시험 노트개념 정리19 MIN

생성형 AI의 작동 방식과 워크로드 여섯 갈래

AI-901 첫 도메인의 출발점입니다. 토큰과 임베딩부터 어텐션·다음 토큰 예측까지 모델이 글을 만드는 절차를 따라가고, 시나리오를 여섯 워크로드 갈래로 옮기는 판별 기준을 정리합니다.

AI-901의 첫 도메인 「AI 개념과 기능 식별」은 시험 안내에 40~45%로 적힌 자리입니다. 뒤 도메인이 Foundry로 실제 구현하는 쪽이라면 이 도메인은 무엇이 어떤 갈래의 일인가를 가르는 쪽이고, 그래서 문항이 「어떤 회사가 이러이러한 것을 하려고 한다. 이것은 무슨 AI 워크로드인가」 꼴로 나옵니다. 보기 넷이 전부 실제로 존재하는 갈래라 이름만 아는 것으로는 안 갈리고, 갈래마다 입력이 무엇이고 출력이 무엇인지를 알아야 갈립니다. 이 노트는 모델이 글을 만드는 절차를 한 번 따라간 다음, 그 지도를 그립니다.

모델은 글자가 아니라 토큰을 본다

언어 모델은 문장을 통째로 읽지 않습니다. 먼저 토큰화(tokenization)를 거치는데, 이는 글을 모델이 다루는 최소 단위인 토큰으로 쪼개는 절차입니다. 토큰은 단어와 같지 않습니다. 영어에서는 흔한 단어 하나가 토큰 하나지만 드문 단어는 여럿으로 쪼개지고, 한국어는 조사와 어미가 붙는 만큼 같은 뜻의 문장이라도 영어보다 토큰이 더 나오는 편입니다. 이 사실이 시험에 나오는 이유는 하나입니다 — 요금과 한도가 글자 수가 아니라 토큰 수로 매겨지기 때문입니다.

쪼갠 토큰은 그대로 계산에 못 들어가므로 숫자로 바뀝니다. 임베딩(embedding)은 토큰이나 문장을 정해진 길이의 숫자 벡터로 옮긴 것이고, 뜻이 가까운 것끼리 벡터도 가깝게 놓이도록 학습됩니다. 「강아지」와 「개」의 벡터 사이 거리가 「강아지」와 「환율」 사이보다 가깝다는 성질이 여기서 나오고, 의미로 찾는 검색이 가능해지는 것도 이 성질 덕분입니다.

tokens = ["오늘", "날씨", "가", "좋", "네요"]        # 토큰화한 결과
vectors = [embed(t) for t in tokens]                 # 각 토큰 → 숫자 벡터
len(vectors[0])                                      # 예: 1536 (모델이 정한 차원 수)

개념을 보여 주는 조각이라 실제 토큰 경계는 모델마다 다릅니다.

어텐션과 다음 토큰 예측

오늘날의 언어 모델은 거의 전부 트랜스포머(transformer) 구조를 씁니다. 이 구조의 핵심 장치가 어텐션(attention)인데, 지금 다룰 토큰이 앞뒤의 어느 토큰을 얼마나 참고할지 가중치로 정하는 방법입니다. 「그 남자가 은행에 갔다」에서 「은행」의 뜻을 정할 때 「돈」이 함께 있으면 그쪽에, 「강물」이 함께 있으면 다른 쪽에 무게를 싣는 일을 어텐션이 합니다.

모델이 실제로 하는 일은 한 가지뿐입니다 — 다음 토큰 예측입니다. 지금까지의 토큰을 보고 다음에 올 토큰의 확률 분포를 내고, 거기서 하나를 골라 뒤에 붙이고, 그것까지 포함해 다시 다음을 예측합니다. 문장이 한 번에 완성되는 것이 아니라 토큰 하나씩 이어 붙어 나오는 것이라서, 화면에 글자가 흘러나오듯 보이는 것도 이 절차 그대로입니다.

그런데 참고할 수 있는 토큰의 수에는 한계가 있습니다. 컨텍스트 윈도우(context window)는 한 번의 요청에서 모델이 볼 수 있는 토큰의 최대 개수이고, 입력과 출력을 합해서 셉니다. 긴 문서를 통째로 붙였다가 답이 잘려 나오는 일이 흔한데, 원인은 대개 출력 자리를 남겨 두지 않은 것입니다. 컨텍스트 윈도우가 128,000 토큰이고 문서가 120,000 토큰이면 답에 쓸 수 있는 것은 8,000 토큰뿐입니다.

사전 학습, 파인튜닝, 그리고 그 앞의 두 가지

모델이 지식을 얻는 자리는 사전 학습(pre-training)입니다. 대규모 텍스트로 다음 토큰 예측을 반복해 언어와 세상에 대한 일반 지식을 담는 단계이고, 비용이 크고 만드는 쪽이 하는 일이라 응시자가 직접 할 일은 아닙니다. 우리가 하는 것은 파인튜닝(fine-tuning) — 이미 학습된 모델에 우리 데이터를 더 학습시켜 특정 말투나 형식, 도메인에 맞추는 단계입니다.

시험이 갈라 보게 하는 자리는 파인튜닝을 언제 고르느냐입니다. 문항은 넷 중 하나를 고르게 해 놓고 요구사항 문장에 답을 심어 둡니다.

요구사항 고를 것
답의 형식·말투를 정하고 싶다 프롬프트(시스템 메시지)
사내 문서의 최신 내용에 근거를 대야 한다 검색으로 근거를 붙이는 그라운딩
예시 몇 개로 패턴을 보여 주면 된다 퓨샷 예시
예시 수백~수천 건이 있고 형식이 매번 같아야 한다 파인튜닝

「최신 정보」·「우리 데이터에 있는 사실」이 나오면 파인튜닝이 아닙니다. 파인튜닝은 사실을 넣는 방법이 아니라 행동을 맞추는 방법이고, 사실은 요청할 때 함께 넣어 주는 편이 싸고 정확합니다.

생성형 AI와 에이전트형 AI

생성형 AI(generative AI)는 프롬프트를 받아 텍스트·이미지·코드 같은 새 콘텐츠를 만들어 내는 갈래입니다. 요청 한 번에 응답 한 번이고, 무엇을 할지는 사람이 정합니다.

에이전트형 AI(agentic AI)는 목표를 받아 어떤 도구를 몇 번 부를지 모델이 스스로 정하며 여러 단계를 밟는 갈래입니다. 검색을 부르고, 결과를 보고, 부족하면 다시 부르고, 계산 함수를 호출한 뒤 답을 냅니다. 사람이 단계를 미리 적어 두지 않는다는 점이 생성형과 갈리는 지점입니다.

가르는 질문은 하나입니다 — 단계 수를 누가 정하는가. 「요약해 준다」·「초안을 써 준다」는 생성형이고, 「일정을 확인하고 빈 시간을 찾아 회의를 잡고 메일까지 보낸다」는 에이전트형입니다. 도구를 쓴다는 말이 있어도 사람이 순서를 못 박아 두었으면 그것은 그냥 워크플로입니다.

워크로드 여섯 갈래

도메인 1이 식별하라고 요구하는 갈래는 여섯입니다. 표의 가운데 열이 판별의 열쇠입니다.

갈래 입력 → 출력 대표 시나리오
생성형 AI 프롬프트 → 새 콘텐츠 상품 설명 초안, 코드 조각 생성
에이전트형 AI 목표 → 도구를 부르며 밟은 여러 단계의 결과 문의를 받아 조회·처리까지 마치는 상담
텍스트 분석 있는 글 → 그 글에 대한 판정값 감정, 엔터티, 키 프레이즈, 언어
음성 소리 ↔ 글 회의 전사, 안내 음성 합성
컴퓨터 비전 이미지·영상 → 그 안에 무엇이 있는지 불량품 검사, 사람 수 세기
정보 추출 문서·이미지·미디어 → 구조화된 필드 영수증에서 금액·날짜, 계약서에서 기간

여섯을 한 줄로 줄이면 이렇습니다. 없던 것을 만들면 생성, 스스로 여러 걸음을 밟으면 에이전트, 있는 것을 두고 판정하면 분석, 결과가 이름 붙은 칸으로 나오면 추출입니다.

여섯이 서로 배타적이지 않다는 점도 함께 알아 둡니다. 실제 서비스는 갈래를 이어 붙여 만듭니다 — 상담 녹음을 음성으로 전사하고, 전사한 글을 텍스트 분석으로 분류하고, 분류 결과를 생성형 AI가 요약해 보고서로 내는 식입니다. 그래서 문항이 「이 솔루션은 무슨 워크로드인가」라고 물을 때는 서술된 여러 단계 중 밑줄 그어 물은 그 단계만 보고 답해야 하고, 「어느 기능을 추가로 써야 하는가」라고 물으면 아직 없는 단계를 찾아야 합니다.

시나리오를 갈래로 옮기는 판별 기준

문항은 갈래 이름을 묻지 않고 상황을 서술합니다. 순서대로 물으면 대부분 한 번에 걸립니다.

  1. 결과물이 원문에 없던 문장·그림인가 → 생성형
  2. 모델이 도구를 몇 번 부를지 스스로 정하는가 → 에이전트형
  3. 입력이 소리이거나 출력이 소리인가 → 음성
  4. 입력이 이미지·영상인가 → 컴퓨터 비전 (단, 그 결과가 이름 붙은 필드면 정보 추출)
  5. 결과가 정해진 칸을 채운 표인가 → 정보 추출
  6. 나머지, 즉 있는 글에 대한 판정값이면 → 텍스트 분석

가장 자주 헷갈리는 짝이 4번과 5번, 그리고 3번과 6번입니다. 송장 이미지를 다룬다는 말만으로는 비전인지 추출인지 안 갈리고, 「공급자명·금액·발행일을 뽑아 회계 시스템에 넣는다」처럼 필드 이름이 등장하면 정보 추출입니다. 마찬가지로 통화 녹음을 다뤄도 「글로 옮긴다」까지면 음성이고, 옮긴 글에서 「불만인지 아닌지 가른다」까지 가면 그 부분은 텍스트 분석입니다. 실제 시스템은 두 갈래를 이어 붙여 만들기 때문에, 문항이 묻는 것이 어느 단계인지를 먼저 짚어야 합니다.

연습 문제

  1. 컨텍스트 윈도우가 8,000 토큰인 모델에 시스템 메시지 300 토큰과 문서 6,900 토큰을 넣었습니다. 답변으로 쓸 수 있는 토큰은 최대 몇 개입니까?
    ① 800
    ② 1,100
    ③ 7,200
    ④ 8,000
    ①. 컨텍스트 윈도우는 입력과 출력을 합해서 셉니다. 8,000−(300+6,900)=8008{,}000 - (300 + 6{,}900) = 800 입니다.
  2. 콜센터가 지난달 녹음 파일을 글로 옮긴 뒤, 옮긴 글에서 고객이 화가 났는지를 가려 보고서를 만들려 합니다. 두 단계는 각각 어느 워크로드입니까?
    ① 음성 → 컴퓨터 비전
    ② 음성 → 텍스트 분석
    ③ 텍스트 분석 → 정보 추출
    ④ 생성형 AI → 음성
    ②. 소리를 글로 옮기는 것이 음성 워크로드이고, 옮긴 글에 대한 판정값(감정)을 내는 것이 텍스트 분석입니다.
  3. 다음 중 파인튜닝이 맞는 답이 되기 어려운 요구사항은?
    ① 답변을 회사 규정 문서의 최신 개정 내용에 맞춰야 한다
    ② 모든 답을 정해진 JSON 스키마로만 내야 하고 예시가 3,000건 있다
    ③ 사내에서만 쓰는 축약어 표기를 모델이 일관되게 따라야 한다
    ④ 답변 문체를 회사 안내문 말투로 고정해야 한다
    ①. 최신 사실을 반영하는 일은 요청할 때 근거 문서를 함께 넣는 그라운딩의 자리입니다. 파인튜닝은 사실을 갱신하는 수단이 아니라 행동과 형식을 맞추는 수단입니다.
  4. 어텐션에 대한 설명으로 옳은 것은?
    ① 토큰을 정해진 길이의 벡터로 바꾸는 절차다
    ② 지금 다룰 토큰이 다른 토큰을 얼마나 참고할지 가중치로 정한다
    ③ 컨텍스트 윈도우의 크기를 늘려 준다
    ④ 모델의 출력에서 유해 표현을 걸러 낸다
    ②. ①은 임베딩, ③은 모델 구조와 배포가 정하는 값, ④는 콘텐츠 필터의 일입니다.
  5. 물류 회사가 「배송 지연 문의가 들어오면 주문 조회 API를 부르고, 지연이 확인되면 보상 정책을 조회해 안내문을 보내라」는 목표만 주고 나머지 순서는 모델이 정하게 하려 합니다. 어느 갈래입니까?
    ① 생성형 AI
    ② 에이전트형 AI
    ③ 정보 추출
    ④ 텍스트 분석
    ②. 도구를 언제 몇 번 부를지 모델이 정하며 여러 단계를 밟습니다. 사람이 순서를 못 박아 두었다면 그냥 워크플로였을 자리입니다.
  6. 보험사가 스캔한 사고 접수서 이미지에서 접수번호·사고일자·차량번호를 뽑아 데이터베이스에 넣으려 합니다. 가장 알맞은 갈래는?
    ① 컴퓨터 비전 — 입력이 이미지이므로
    ② 정보 추출 — 결과가 이름 붙은 필드이므로
    ③ 생성형 AI — 새 텍스트를 만들어야 하므로
    ④ 음성 — 문서를 읽어 주어야 하므로
    ②. 입력이 이미지라는 사실만으로는 비전과 추출이 안 갈립니다. 뽑을 필드의 이름이 정해져 있고 결과가 구조화된 값으로 나오면 정보 추출입니다.
  7. 같은 뜻의 문장을 영어와 한국어로 각각 보냈을 때 토큰 수가 다를 수 있는 이유로 가장 알맞은 것은?
    ① 모델이 언어마다 다른 컨텍스트 윈도우를 쓰기 때문
    ② 토큰 경계가 글자나 단어가 아니라 학습된 조각 단위로 정해지기 때문
    ③ 한국어는 임베딩 차원 수가 더 크기 때문
    ④ 언어 감지가 먼저 돌아 토큰을 하나 더 쓰기 때문
    ②. 토큰은 단어와 일대일이 아니고, 흔한 조각일수록 하나로 묶입니다. 요금과 한도가 토큰으로 매겨지므로 같은 내용이라도 언어에 따라 비용이 달라질 수 있습니다.

일곱 문항이 모두 같은 습관을 요구합니다. 갈래를 묻는 문항에서는 서비스 이름이나 기술 이름을 먼저 떠올리지 말고, 입력이 무엇이고 출력이 어떤 모양으로 나오는지부터 문장에서 찾아 읽는 것입니다. 그 둘이 정해지면 여섯 갈래 중 남는 후보는 대개 하나뿐입니다.

Azure AI Fundamentals 시험 노트 전체 보기