Azure AI Fundamentals

Azure AI Fundamentals 시험 노트개념 정리19 MIN

텍스트·이미지·오디오·비디오 정보 추출

문서·이미지·오디오·비디오에서 무엇을 뽑아낼 수 있는지 갈래별로 정리하고, 텍스트 분석과 정보 추출의 경계와 결과가 구조화된 필드로 나오는 방식, 시나리오별 기법 고르기를 다룹니다.

첫 노트에서 워크로드 여섯 갈래 가운데 하나로 정보 추출을 세웠습니다. 앞의 두 노트가 글·소리·그림을 각각 판정하는 기능을 다뤘다면, 이 노트는 그 콘텐츠에서 정해 둔 항목을 꺼내 채우는 일을 다룹니다. 송장에서 공급자 이름과 합계를, 상담 녹음에서 고객 요청과 약속한 날짜를 뽑아 표의 칸에 넣는 일입니다. 입력이 문서든 사진이든 녹음이든 영상이든, 나가는 것이 미리 정한 칸들이라는 점이 같습니다.

구조화된 필드

스키마와 필드

정보 추출에서 먼저 정하는 것은 스키마(schema)입니다. 스키마는 뽑아낼 항목의 이름과 값의 형식을 적은 목록이고, 그 항목 하나하나를 필드(field)라 부릅니다. 「공급자 이름: 문자열, 송장 날짜: 날짜, 합계: 숫자, 품목: 표」처럼 적어 두면 결과가 그 모양 그대로 돌아옵니다.

{
  "VendorName": { "type": "string", "valueString": "한빛상사", "confidence": 0.97 },
  "InvoiceDate": { "type": "date", "valueDate": "2026-09-30", "confidence": 0.95 },
  "Total": { "type": "number", "valueNumber": 1320000, "confidence": 0.91 }
}

신뢰도와 근거 위치

필드마다 신뢰도(confidence)가 붙습니다. 모델이 그 값을 얼마나 확신하는지를 0과 1 사이로 나타낸 값이고, 실무에서는 문턱을 정해 그 아래만 사람이 검토하게 합니다. 문서에서는 값이 원문 어디에서 왔는지를 가리키는 근거 위치(페이지와 좌표)도 함께 나와, 검토자가 원본의 그 자리를 바로 열어 볼 수 있습니다.

결과가 필드로 나온다는 점이 이 갈래의 핵심입니다. 데이터베이스에 바로 넣거나 다음 시스템으로 넘길 수 있으므로, 시나리오에 「ERP에 자동 입력」·「표로 정리」·「항목별로 저장」이 있으면 정보 추출 쪽을 먼저 의심합니다.

칸을 채우는 세 방식

칸의 값이 어디서 오느냐에 따라 채우는 방식이 셋으로 갈립니다. 원문에 그대로 적힌 글자를 옮겨 오는 것이 추출(extract)이고, 송장 번호나 계약 시작일이 여기에 속합니다. 원문에 그대로는 없지만 내용을 읽고 만들어 내야 하는 것이 생성(generate)이며, 통화 요약이나 「고객이 원하는 것」 한 줄이 그렇습니다. 정해 둔 선택지 중 하나를 고르는 것이 분류(classify)이고, 「문의 유형: 배송·환불·기타」 같은 칸입니다. 같은 스키마 안에 세 방식의 칸이 섞여도 됩니다.

세 방식은 근거를 짚는 정도가 다릅니다. 추출한 값은 원문의 어느 글자에서 왔는지 가리킬 수 있지만, 생성한 요약은 원문 여러 곳을 읽고 만든 것이라 한 자리를 짚을 수 없습니다. 감사나 법적 근거가 필요한 칸이면 추출로 정의할 수 있는지를 먼저 봅니다.

문서와 이미지

문서·양식

문서에서 뽑는 것은 크게 넷입니다.

갈래 무엇인가 예
텍스트와 레이아웃 줄·문단·제목과 그 위치 계약서의 조항 제목
키-값 쌍 라벨과 그 옆에 적힌 값 「성명: 김하늘」
표 행과 열, 칸마다의 값 송장의 품목 표
선택 표시 체크박스가 체크됐는지 동의 여부 □ ☑

미리 만든 모델과 직접 정의

영수증·송장·신분증처럼 흔한 양식은 미리 만들어진 모델이 공급자·합계·날짜 같은 필드를 이미 알고 있어 스키마를 따로 적지 않아도 됩니다. 사내 고유 양식이라면 필드를 직접 정의합니다. 앞 노트의 OCR이 글자와 좌표까지만 돌려줬다면, 여기서는 그 글자가 「합계」라는 칸의 값이라는 뜻까지 붙여 줍니다.

둘 중 무엇을 고를지는 양식이 얼마나 흔한가로 정합니다. 영수증처럼 세상에 널린 양식에 필드를 하나하나 다시 정의하는 것은 수고만 늘리고, 사내 출장 신청서처럼 우리만 쓰는 양식에 미리 만든 송장 모델을 쓰면 칸이 맞지 않습니다. 미리 만든 모델이 주는 필드에 몇 칸만 더 필요하다면, 그 칸을 더한 스키마를 직접 정의하는 쪽이 됩니다.

이미지

이미지에서 뽑는 정보는 문서보다 갈래가 넓습니다. 그림 속 글자(간판·라벨), 무엇이 찍혔는지에 대한 설명, 정해 둔 갈래 중 어디에 속하는지, 그리고 그림을 보고 판단해야 하는 값이 있습니다. 예를 들어 보험 청구 사진에서 「손상 부위」, 「손상 정도(경미·중간·심각)」, 「차량 색상」을 필드로 정해 두면 사진 한 장이 행 하나가 됩니다.

이미지 쪽 필드는 문서처럼 「적혀 있는 글자를 옮기는」 것보다 「그림을 보고 판정하는」 것이 많습니다. 그래서 같은 필드라도 값의 근거를 원문의 특정 글자로 짚을 수 없는 경우가 많다는 점을 기억해 둡니다.

앞 노트의 비전 기능과 가르는 선도 여기 있습니다. 태그가 「자동차」, 「도로」, 「빨강」을 낱말 목록으로 돌려준다면, 추출은 「차량 색상: 빨강」처럼 그 낱말을 우리가 정한 칸에 넣어 돌려줍니다. 같은 사진에서 같은 사실을 읽더라도 결과를 받아 쓰는 쪽이 칸 이름으로 값을 찾을 수 있느냐가 다릅니다.

오디오와 비디오

오디오

녹음에서 뽑는 정보의 바탕은 전사(transcript), 곧 말을 글로 옮긴 것입니다. 여기에 누가 말했는지를 가르는 화자 분리(diarization)가 붙어 「화자 1」·「화자 2」 라벨이 달리고, 구간마다 시작·끝 시각이 붙습니다. 그 위에 요약, 통화 목적, 고객이 요구한 것, 상담원이 약속한 후속 조치 같은 필드를 정해 두면 통화 한 건이 레코드 한 줄이 됩니다.

비디오

비디오는 화면과 소리가 함께 있으므로 오디오의 전사에 화면 쪽 구조가 더해집니다. 장면이 바뀌는 자리(샷 경계), 장면을 대표하는 키프레임(key frame), 화면에 나온 글자와 물체가 그것입니다. 결과는 영상 전체를 시간 구간으로 나눈 세그먼트의 목록이고, 세그먼트마다 시작·끝 시각과 설명·요약 필드가 붙습니다. 「강의 영상을 주제별 구간으로 나눠 목차를 만든다」·「광고가 나온 구간을 찾는다」가 이 자리입니다.

오디오와 비디오의 결과는 모든 값에 시각이 붙는다는 점이 문서와 다릅니다. 문서의 근거가 페이지와 좌표였다면 여기서는 몇 분 몇 초부터 몇 초까지인가가 근거이고, 검토자는 그 구간을 바로 재생해 확인합니다. 그래서 「약속한 내용이 녹음의 어디에 있는지 바로 들어 볼 수 있어야 한다」 같은 요구는 구간 시각이 붙는 오디오 추출의 자리입니다.

입력 바탕이 되는 결과 그 위에 정하는 필드의 예
오디오 전사, 화자 라벨, 구간 시각 통화 목적, 요청 사항, 약속한 날짜
비디오 전사, 샷 경계, 키프레임, 세그먼트 구간 요약, 등장 제품, 장면 분류

오디오와 비디오는 처리 시간이 길어서 요청을 넣으면 바로 결과가 오지 않고, 작업 상태를 되물어 끝난 뒤에 받는 비동기 방식으로 동작합니다. 그 절차는 뒤의 구현 노트가 다룹니다.

텍스트 분석과의 경계

판정과 추출

넷째 노트의 텍스트 분석과 이 노트의 정보 추출은 둘 다 「있는 콘텐츠를 읽는」 일이라 자주 헷갈립니다. 가르는 질문은 결과의 칸을 누가 정하는가입니다.

묻는 것 텍스트 분석 정보 추출
결과의 모양 기법이 정한다(감정 점수, 엔터티 목록) 사용자가 스키마로 정한다
입력 주로 평문 텍스트 문서·이미지·오디오·비디오
대표 질문 이 글은 긍정인가, 어떤 이름이 나오나 이 송장의 합계는 얼마인가

엔터티 인식이 「금액」 갈래를 찾아 주더라도, 그것이 여러 금액 중 합계인지는 말해 주지 않습니다. 「합계」라는 칸을 정하고 그 칸을 채우는 것이 추출입니다.

같은 문장, 다른 일

상담 녹음 한 건을 두고도 두 일이 나란히 설 수 있습니다. 녹음을 전사한 뒤 고객이 화가 났는지 보는 것은 텍스트 분석(감정 분석)이고, 「환불 요청 여부」·「요청 금액」·「처리 기한」 칸을 채우는 것은 정보 추출입니다. 문항이 둘을 한 보기 안에 섞어 두면 나가는 결과가 판정 값인지 칸의 값인지로 가릅니다.

실무에서는 둘을 한 파이프라인에 잇는 일이 흔합니다. 녹음을 전사하고, 전사에서 칸을 채우고, 채운 「고객 불만 내용」 칸에 다시 감정 분석을 돌리는 식입니다. 시험이 「어느 단계가 무엇인가」를 차례로 짚게 할 때는 단계마다 나가는 것이 글인지, 칸인지, 판정인지를 적어 보면 됩니다.

추출 기법 고르기

고르는 순서

  1. 입력의 모달리티를 적는다 — 문서, 이미지, 오디오, 비디오.
  2. 나가야 할 것이 정해진 칸인가를 본다. 칸이 없고 판정만 필요하면 텍스트 분석이나 비전 쪽이다.
  3. 흔한 양식이면 미리 만들어진 모델, 고유 양식이면 필드를 직접 정의한다.
  4. 오디오·비디오라면 시각이 붙은 구간 결과와 비동기 처리를 전제로 한다.

자주 나오는 함정

가장 흔한 오답은 OCR만으로 송장 처리를 끝내려는 보기입니다. 글자는 다 나오지만 어느 글자가 합계인지는 나오지 않습니다. 반대로 「사진 속 간판의 글자를 그대로 읽어 저장」처럼 칸이 필요 없는 요구에 추출 스키마를 세우는 보기도 지나칩니다. 출제는 대개 시나리오 한 문단을 주고 「가장 알맞은 것」을 고르게 하므로, 요구 문장에서 칸 이름이 보이는지부터 찾는 것이 지름길입니다.

연습 문제

  1. 회계팀이 거래처마다 양식이 다른 송장 PDF에서 공급자 이름·송장 번호·합계 금액을 뽑아 ERP에 자동 입력하려 합니다. 알맞은 것은?
    ① 읽기(OCR)만 돌려 텍스트를 저장한다
    ② 필드를 정의한 문서 정보 추출
    ③ 감정 분석
    ④ 이미지 분류
    ②. 나가야 할 것이 정해진 칸이므로 정보 추출입니다. OCR은 글자를 주지만 어느 글자가 합계인지는 주지 않습니다.
  2. 고객센터 통화 녹음에서 「통화 목적」과 「상담원이 약속한 후속 조치」를 레코드로 저장하려 합니다. 이때 결과의 바탕이 되는 것은?
    ① 키프레임
    ② 경계 상자
    ③ 화자 라벨이 붙은 전사
    ④ 이미지 캡션
    ③. 오디오 추출의 바탕은 전사이고, 누가 말했는지를 알아야 상담원의 약속을 가를 수 있습니다.
  3. 다음 중 텍스트 분석이 아니라 정보 추출에 해당하는 것은?
    ① 리뷰가 긍정인지 부정인지 판정한다
    ② 글에 나온 사람 이름과 장소를 찾는다
    ③ 임대 계약서에서 「계약 시작일」과 「월 임대료」 칸을 채운다
    ④ 문의 글의 언어를 감지한다
    ③. 사용자가 정한 칸을 채우는 것이 추출입니다. 나머지 셋은 기법이 정한 모양의 판정 값을 냅니다.
  4. 한 시간짜리 사내 교육 영상을 주제가 바뀌는 구간으로 나누고 구간마다 한 줄 요약을 붙이려 합니다. 결과로 기대할 것은?
    ① 시작·끝 시각과 요약 필드가 붙은 세그먼트 목록
    ② 영상 전체에 대한 감정 점수 하나
    ③ 첫 프레임의 경계 상자 목록
    ④ 영상 파일의 언어 코드
    ①. 비디오 추출은 영상을 시간 구간으로 나눈 세그먼트를 돌려주고, 세그먼트마다 정해 둔 필드가 채워집니다.
  5. 추출 결과에서 필드마다 0.62, 0.98 같은 값이 함께 나왔습니다. 이 값을 가장 알맞게 쓰는 방법은?
    ① 값이 높은 필드만 사람이 다시 검토한다
    ② 문턱을 정해 그 아래 필드만 사람이 검토한다
    ③ 그 값을 합계 금액에 곱한다
    ④ 값이 낮으면 스키마를 지운다
    ②. 신뢰도는 모델의 확신 정도이므로 낮은 쪽을 사람에게 넘기는 문턱으로 씁니다.
  6. 통화 녹음에서 「문의 유형」 칸을 「배송·환불·기타」 셋 중 하나로 채우려 합니다. 이 칸을 채우는 방식은?
    ① 추출
    ② 생성
    ③ 분류
    ④ OCR
    ③. 정해 둔 선택지 중 하나를 고르는 칸이므로 분류입니다. 원문에 적힌 글자를 옮기는 것이 추출, 요약처럼 새로 만드는 것이 생성입니다.

여섯 문항 중 셋이 「칸이 정해져 있는가」로 갈렸고, 나머지는 칸을 정한 뒤 무엇이 바탕이 되고 어떻게 채우는가를 물었습니다. 요구 문장에 칸 이름(합계, 계약 시작일, 후속 조치)이 보이면 추출, 판정 낱말(긍정, 언어, 이름 목록)이 보이면 분석으로 먼저 놓고 보기를 지우면 됩니다.

Azure AI Fundamentals 시험 노트 전체 보기