AWS AI Practitioner 시험 노트개념 정리22 MIN
AI·ML·딥러닝 용어와 학습·추론 방식
AWS AI Practitioner 도메인 1의 출발점입니다. AI부터 에이전틱 AI까지의 포함 관계, 학습과 추론이 갈리는 자리, 실시간·서버리스·비동기·배치 추론을 고르는 기준을 정리합니다.
AWS Certified AI Practitioner의 첫 도메인 「Fundamentals of AI and ML」은 채점되는 50문항의 20%를 차지합니다. 이 도메인이 묻는 것은 만드는 법이 아니라 말이 가리키는 범위입니다. 문항은 「다음 중 딥러닝의 예로 가장 알맞은 것은」·「이 회사에 맞는 추론 방식은」처럼 나오고, 보기 넷이 전부 실제로 있는 말이라 이름만 들어 본 것으로는 안 갈립니다. 이 노트는 용어의 포함 관계를 먼저 세우고, 그다음 학습과 추론이 갈리는 자리와 추론 방식 네 갈래를 정리합니다.
AI 안에 ML, ML 안에 딥러닝
시험이 가장 자주 확인하는 것이 이 포함 관계입니다. 넓은 것부터 좁은 것으로 갑니다.
인공지능(AI)은 사람이 하던 인식·판단·생성을 기계가 하게 만드는 분야 전체입니다. 규칙을 사람이 손으로 다 적어 넣은 시스템도 AI에 들어갑니다.
머신러닝(ML)은 그 규칙을 사람이 적는 대신 데이터에서 찾아내게 하는 방법입니다. 스팸 판정 규칙을 조건문으로 적는 대신, 스팸으로 표시된 메일 수만 통을 보여 주고 규칙을 스스로 뽑게 하는 쪽입니다.
딥러닝(deep learning)은 층을 여러 겹 쌓은 신경망을 쓰는 ML의 한 갈래입니다. 신경망(neural network)은 입력에 가중치를 곱해 더하고 비선형 함수를 통과시키는 계산 단위를 층으로 이어 붙인 구조이고, 그 층이 깊어서 딥러닝입니다. 이미지·소리·자유로운 글처럼 사람이 특징을 손으로 뽑기 어려운 데이터에서 특히 강합니다.
생성형 AI(generative AI)는 딥러닝 안에서 없던 콘텐츠를 만들어 내는 쪽입니다. 그 대표가 LLM(large language model), 즉 대규모 텍스트로 학습해 다음에 올 말을 예측하는 큰 신경망입니다.
에이전틱 AI(agentic AI)는 목표를 받아 어떤 도구를 몇 번 부를지 모델이 스스로 정하며 여러 단계를 밟는 방식입니다. 앞의 넷이 겹겹의 포함 관계라면 이것은 층이 아니라 쓰는 방식이라는 점이 다릅니다. 같은 LLM을 한 번 불러 요약을 받으면 생성형이고, 목표만 주고 조회·계산·전송을 스스로 이어 가게 하면 에이전틱입니다.
한 줄로 줄이면 AI ⊃ ML ⊃ 딥러닝 ⊃ 생성형 AI이고, 에이전틱 AI는 그 위에 얹는 운용 방식입니다. 「가장 넓은 개념은」·「생성형 AI가 속하지 않는 것은」 같은 문항이 이 사슬 하나로 풀립니다.
컴퓨터 비전(computer vision)과 자연어 처리(NLP)는 이 사슬의 층이 아니라 다루는 대상으로 나눈 분야 이름입니다. 비전은 이미지·영상을, NLP는 사람이 쓰는 말을 다룹니다. 둘 다 오늘날 대부분 딥러닝으로 구현되지만 딥러닝이 아닌 방법으로도 할 수 있으므로, 「NLP는 딥러닝의 하위 분야인가」라는 물음에는 아니라고 답합니다.
모델과 알고리즘, 그리고 적합
알고리즘(algorithm)은 데이터에서 규칙을 찾는 절차 그 자체입니다. 선형 회귀, 랜덤 포레스트, XGBoost 같은 이름이 알고리즘입니다. 모델(model)은 그 절차를 실제 데이터에 돌려 나온 결과물, 즉 학습으로 정해진 숫자(파라미터) 묶음입니다. 알고리즘은 학습 전에 고르는 것이고 모델은 학습 뒤에 남는 것입니다. 같은 알고리즘에 다른 데이터를 먹이면 다른 모델이 나옵니다.
적합(fit)은 모델이 데이터를 얼마나 잘 따라갔는가를 가리키는 말이고, 잘못된 방향이 둘이라 이름도 둘입니다.
| 증상 | 이름 | 흔한 처방 |
|---|---|---|
| 학습 데이터에서도 검증 데이터에서도 성능이 낮다 | 과소적합(underfitting) | 모델을 키우거나 특성을 더한다, 더 오래 학습한다 |
| 학습 데이터는 잘 맞히는데 새 데이터에서 뚝 떨어진다 | 과대적합(overfitting) | 데이터를 늘린다, 규제를 걸거나 일찍 멈춘다 |
| 전체 성능은 괜찮은데 특정 집단에서만 낮다 | 편향 문제 | 데이터 구성을 다시 보고 편향 지표를 잰다 |
편향(bias)은 시험에서 두 뜻으로 나오므로 문맥을 봐야 합니다. 통계적 뜻의 편향은 모델이 지나치게 단순해서 생기는 체계적 오차이고, 과소적합과 짝을 이룹니다. 책임 있는 AI 맥락의 편향은 특정 집단에 체계적으로 불리한 결과가 나오는 것을 말하고, 그 반대편에 있는 목표가 공정성(fairness)입니다. 도메인 4로 이어지는 말이지만 처음 만나는 자리가 여기입니다.
학습과 추론은 다른 일이다
학습(training)은 데이터를 반복해 보며 파라미터를 맞춰 가는 단계입니다. 대개 한 번(또는 주기적으로 다시) 돌리고, GPU를 많이 쓰며, 비용이 몰려서 나옵니다.
추론(inferencing)은 학습이 끝난 모델에 새 입력을 넣어 답을 얻는 단계입니다. 서비스가 살아 있는 내내 요청마다 일어나므로 비용이 길게 깔립니다.
문항이 비용을 물을 때 이 둘을 가르는 문장이 정해져 있습니다. 「모델을 한 번 만드는 데 드는 비용」이면 학습이고, 「사용자가 늘수록 함께 늘어나는 비용」이면 추론입니다. 파운데이션 모델을 그대로 불러 쓰는 구성에서는 학습 비용이 아예 없고 추론 비용만 남는다는 점도 함께 기억해 둡니다.
추론 네 갈래 고르기
Amazon SageMaker AI가 제공하는 추론 방식이 넷이고, 도메인 1에서 시나리오로 고르게 하는 자리입니다.
| 방식 | 어떻게 도는가 | 맞는 자리 |
|---|---|---|
| 실시간(real-time) | 늘 켜져 있는 엔드포인트가 요청을 받아 곧바로 응답 | 트래픽이 꾸준하고 밀리초 단위 응답이 필요한 곳 |
| 서버리스(serverless) | 엔드포인트지만 요청이 없으면 0으로 줄어듦 | 트래픽이 띄엄띄엄하고 첫 요청의 지연을 견딜 수 있는 곳 |
| 비동기(asynchronous) | 요청을 큐에 넣고 처리한 뒤 결과를 Amazon S3에 둠 | 입력이 크거나 한 건 처리가 오래 걸리고 즉답이 필요 없는 곳 |
| 배치 변환(batch transform) | 엔드포인트 없이 쌓인 데이터셋 전체를 한 번에 돌림 | 야간 정산처럼 정해진 시각에 묶어 처리하는 곳 |
실시간과 서버리스는 엔드포인트를 두는 쪽이고 비동기와 배치는 결과를 S3에 남기는 쪽입니다. 실시간은 안 쓰는 시간에도 인스턴스 값을 내지만 서버리스는 요청이 없으면 내지 않는 대신 잠들어 있던 뒤 첫 요청이 느려지는 콜드 스타트를 감수합니다. 비동기는 실시간 엔드포인트가 받기 어려운 큰 페이로드와 긴 처리 시간을 받아 주는 자리이고, 배치는 처리할 것이 이미 다 모여 있을 때 쓰는 자리입니다.
시나리오를 만나면 순서대로 물으면 대개 한 번에 걸립니다.
- 처리할 데이터가 이미 다 모여 있는가 → 배치 변환
- 건별로 들어오지만 결과를 나중에 받아도 되는가(큰 파일, 긴 처리) → 비동기
- 즉답이 필요한데 트래픽이 꾸준한가 → 실시간
- 즉답이 필요하지만 트래픽이 간헐적이고 첫 요청 지연을 견딜 수 있는가 → 서버리스
문항이 「비용을 최소화하면서」라고 적으면 대개 서버리스나 배치 쪽으로 기울고, 「일관되게 낮은 지연」이라고 적으면 실시간입니다.
학습 방식 셋과 데이터의 레이블
레이블(label)은 각 데이터에 붙은 정답 값입니다. 사진마다 「고양이」라고 적어 둔 것, 거래마다 「사기」·「정상」이라고 표시해 둔 것이 레이블이고, 사람 손이 들어가므로 비쌉니다. 학습 방식 셋은 이 레이블이 있느냐 없느냐로 갈립니다.
| 방식 | 데이터 | 대표 작업 |
|---|---|---|
| 지도학습(supervised) | 레이블이 있다 | 회귀(값 예측), 분류(갈래 예측) |
| 비지도학습(unsupervised) | 레이블이 없다 | 클러스터링, 차원 축소, 이상 탐지 |
| 강화학습(reinforcement) | 레이블 대신 보상이 있다 | 순차적 의사결정, 로봇 제어, 게임 |
강화학습은 앞의 둘과 결이 다릅니다. 미리 준비된 정답표를 보는 것이 아니라, 에이전트가 환경에서 행동을 하고 그 결과로 받은 보상을 신호 삼아 정책을 고쳐 갑니다. 「정답이 무엇인지는 모르지만 잘했는지 못했는지는 점수로 알 수 있다」가 강화학습이 놓이는 자리입니다.
파운데이션 모델의 사전학습은 이 표에서 어디에 들어갈까요. 사람이 레이블을 붙이지 않은 대규모 텍스트를 쓰되, 문장의 다음 말을 가리고 그것을 맞히게 하므로 정답이 데이터 자체에서 나옵니다. 이렇게 데이터가 스스로 정답을 내주는 방식을 자기지도학습(self-supervised)이라 부르고, 레이블링 비용 없이 방대한 데이터를 쓸 수 있다는 점이 파운데이션 모델을 가능하게 한 열쇠입니다.
데이터의 모양으로 나누기
문항이 「이 데이터에 맞는 서비스는」이라고 물으면 먼저 데이터의 모양부터 읽습니다.
정형 데이터(structured)는 행과 열이 정해진 틀 안에 값이 들어간 것입니다. 관계형 데이터베이스의 테이블과 CSV가 여기이고, 표 형식(tabular) 데이터라고도 부릅니다. 비정형 데이터(unstructured)는 그런 틀이 없는 것 — 이미지, 음성, 영상, 자유롭게 쓴 글입니다. 그 사이에 반정형 데이터(semi-structured)가 있습니다. JSON이나 XML처럼 이름표는 붙어 있지만 모든 항목이 같은 칸을 갖지는 않는 것입니다.
시계열 데이터(time series)는 따로 셉니다. 값에 시각이 붙어 있고 순서 자체가 뜻을 가지는 데이터라 행을 섞으면 정보가 사라집니다. 표 형식으로 저장되어 있어도 다루는 방법이 달라지므로 시험도 따로 부릅니다. 수요 예측, 센서 이상 탐지가 여기서 나옵니다.
정형이면 전통 ML 알고리즘이, 비정형이면 딥러닝이 유리하다는 것이 대략의 기본값입니다. 문항이 「수백만 건의 거래 기록」이라고 적으면 표 형식이고, 「고객이 남긴 리뷰 원문」이라고 적으면 텍스트, 즉 NLP 쪽입니다. 이 한 번의 판별이 뒤 도메인의 서비스 선택 문항까지 끌고 갑니다.
연습 문제
다음 중 포함 관계가 옳은 것은?
① 딥러닝 ⊃ 머신러닝 ⊃ 인공지능
② 인공지능 ⊃ 머신러닝 ⊃ 딥러닝
③ 머신러닝 ⊃ 인공지능 ⊃ 생성형 AI
④ 생성형 AI ⊃ 딥러닝 ⊃ 인공지능②. 가장 넓은 것이 인공지능이고, 데이터에서 규칙을 찾는 방법이 머신러닝, 깊은 신경망을 쓰는 갈래가 딥러닝입니다.어느 병원이 밤사이 쌓인 지난 하루치 검사 기록 40만 건을 아침 여섯 시에 한 번 돌려 위험도를 매기려 합니다. 결과는 파일로 받으면 되고 낮 동안에는 이 모델을 쓰지 않습니다. 가장 알맞은 추론 방식은?
① 실시간 엔드포인트
② 서버리스 추론
③ 비동기 추론
④ 배치 변환④. 처리할 데이터가 이미 다 모여 있고 정해진 시각에 한 번 돌리므로 엔드포인트를 둘 이유가 없습니다. 엔드포인트를 띄우는 ①②는 안 쓰는 시간의 비용이나 관리가 남고, ③은 건별로 들어오는 요청을 큐에 쌓는 방식이라 이 상황과 다릅니다.다음 중 비지도학습에 해당하는 작업을 둘 고르시오.
① 지난 3년치 매출로 다음 달 매출액을 예측한다
② 고객 구매 이력만 보고 비슷한 고객끼리 묶는다
③ 스팸으로 표시된 메일 5만 통으로 스팸 분류기를 만든다
④ 평소 패턴에서 크게 벗어난 접속을 정답 표시 없이 찾아낸다
⑤ 사진마다 붙은 품종 이름을 학습해 새 사진의 품종을 맞힌다②와 ④. 둘 다 정답 표시가 없는 데이터에서 구조를 찾습니다. ①은 회귀, ③과 ⑤는 분류로 모두 레이블이 있는 지도학습입니다.학습 데이터에서는 정확도가 98%인데 검증 데이터에서는 71%로 떨어졌습니다. 이 상태의 이름과 처방으로 알맞은 것은?
① 과소적합 — 모델을 더 크게 만든다
② 과소적합 — 학습을 일찍 멈춘다
③ 과대적합 — 데이터를 늘리거나 규제를 건다
④ 과대적합 — 특성을 더 많이 넣는다③. 학습 데이터만 잘 맞히고 새 데이터에서 떨어지는 것이 과대적합입니다. ④처럼 특성을 더 넣으면 대개 더 심해집니다.다음 데이터를 알맞은 갈래에 짝지으시오.
(가) 관계형 데이터베이스의 주문 테이블 (나) 고객센터 통화 녹음 파일 (다) 항목마다 칸이 달라지는 JSON 로그 (라) 1분 간격으로 기록한 공장 센서 값
① 정형 ② 비정형 ③ 반정형 ④ 시계열(가)–①, (나)–②, (다)–③, (라)–④. (라)는 숫자가 표에 담겨 있어도 순서 자체가 뜻을 가지므로 시계열로 따로 셉니다.추론 방식을 고르는 판단을 순서대로 배열하시오.
(가) 즉답이 필요한데 트래픽이 간헐적인지 본다
(나) 처리할 데이터가 이미 다 모여 있는지 본다
(다) 건별 요청이지만 결과를 나중에 받아도 되는지 본다
(라) 즉답이 필요하고 트래픽이 꾸준한지 본다(나) → (다) → (라) → (가). 모여 있으면 배치, 나중에 받아도 되면 비동기, 즉답이 필요하고 꾸준하면 실시간, 즉답이지만 띄엄띄엄하면 서버리스입니다.파운데이션 모델의 사전학습이 사람이 붙인 레이블 없이도 가능한 이유로 가장 알맞은 것은?
① 강화학습으로 보상만 보고 배우기 때문
② 가린 다음 말을 맞히게 해 정답이 데이터 자체에서 나오기 때문
③ 클러스터링으로 비슷한 문장을 묶기 때문
④ 학습이 아니라 추론만 하기 때문②. 이것이 자기지도학습이고, 레이블링 비용 없이 대규모 데이터를 쓸 수 있게 해 준 열쇠입니다.어떤 회사가 사내 위키 검색을 개선하려 합니다. 「목표만 주면 모델이 검색과 요약, 담당자 안내까지 스스로 순서를 정해 처리한다」는 요구가 붙었습니다. 이 요구가 가리키는 것은?
① 지도학습
② 컴퓨터 비전
③ 에이전틱 AI
④ 배치 추론③. 사람이 단계를 못 박지 않고 도구를 몇 번 부를지 모델이 정하는 구성입니다. 사람이 순서를 정해 두었다면 그냥 워크플로였을 자리입니다.
여덟 문항이 요구하는 습관은 하나입니다. 시나리오에서 데이터가 어떤 모양이고, 답이 언제 필요하고, 정답 표시가 있는지 세 가지를 먼저 찾아 읽는 것입니다. 그 셋이 정해지면 이 도메인의 문항은 대개 후보가 하나만 남습니다.

