데이터분석 준전문가 (ADsP)

데이터분석 준전문가 (ADsP) 시험 노트과목 총정리28 MIN

ADsP 2과목 분석 기획 총정리

ADsP 2과목 열 문항이 걸치는 범위를 한 번에 훑는 복습용 노트입니다. 분석 주제 네 유형, KDD와 CRISP-DM 대응, 빅데이터 방법론 5단계, 하향식·상향식 과제 발굴, 우선순위 사분면, 거버넌스와 성숙도를 표로 나란히 놓습니다.

2과목 「데이터분석 기획」도 필기 50문항 가운데 10문항, 20점입니다. 묻는 것은 「어떻게 분석하는가」가 아니라 「무엇을 분석할지 어떻게 정하는가」이고, 외울 것이 단계 이름과 순서에 몰려 있습니다. 이 글은 그 열 문항이 걸치는 범위를 한 번에 훑는 복습용이라 순서가 걸린 것들을 표로 나란히 놓는 데 집중합니다. 단계마다 파고드는 노트는 따로 옵니다.

분석 기획이 정하는 것

분석 기획은 어떤 목표를 위해 어떤 데이터로 어떤 분석을 언제 할지 미리 정하는 작업입니다. 분석을 수행하는 일이 아니라 방향을 잡는 일이라 기술보다 비즈니스 이해가 먼저입니다. 챙길 것은 셋입니다.

고려사항 무엇을 보는가
가용 데이터 정형·반정형·비정형 중 무엇인가에 따라 방법이 달라집니다
적절한 유스케이스 비슷한 시나리오와 기존 솔루션을 먼저 찾습니다
장애 요소 사전 계획 정확도를 올리면 비용이 늘고, 조직이 안 쓰면 소용없습니다

그래서 분석 기획자에게 필요한 역량은 한 갈래가 아닙니다. 도메인 지식(비즈니스), IT 기술 이해, 분석 기법 이해 셋을 고루 갖춘 사람이 기획을 맡습니다. 어느 하나에만 치우치면 못 만들 것을 약속하거나(기술 이해 부족) 아무도 안 쓸 것을 만듭니다(도메인 이해 부족). 여기에 일정과 위험을 관리하는 프로젝트 관리 역량이 붙습니다.

무엇을 아는가로 갈리는 네 칸

분석 대상(What)을 아는가와 분석 방법(How)을 아는가, 두 물음이 네 칸을 만듭니다.

방법을 안다 방법을 모른다
대상을 안다 최적화(Optimization) 솔루션(Solution)
대상을 모른다 통찰(Insight) 발견(Discovery)

최적화는 하던 일을 더 잘하는 자리, 솔루션은 문제는 알지만 푸는 법을 찾는 자리, 통찰은 방법은 있으나 무엇을 볼지 모르는 자리, 발견은 둘 다 모르는 자리입니다. 상황 한 줄에서 「무엇을 할지는 정해졌다」와 「어떻게 할지는 모른다」를 갈라 읽으면 답이 나옵니다.

목표 시점에 따른 두 접근

구분 과제 중심적 접근 장기적 마스터 플랜
1차 목표 Speed & Test Accuracy & Deploy
과제의 성격 Quick & Win Long Term View
접근 방식 Problem Solving Problem Definition

실제로는 마스터 플랜을 세우면서 눈에 보이는 과제 몇을 먼저 돌려 보는 혼합 방식을 씁니다.

방법론의 구성요소와 개발 모델

분석 방법론은 절차를 정리해 두어 누가 맡아도 비슷한 결과가 나오게 만든 체계입니다. 필요한 이유가 여기 있습니다 — 사람 머릿속의 암묵지를 형식지로 꺼내 형식화하고, 그것을 다시 남이 쓸 수 있게 체계화하고 내재화하는 것이 방법론입니다. 구성요소는 절차, 방법, 도구와 기법, 템플릿과 산출물 넷입니다.

절차를 어떤 모양으로 밟을지는 소프트웨어 개발 모델에서 빌려 옵니다.

모델 어떻게 도는가 어울리는 자리
폭포수(Waterfall) 앞 단계를 끝내야 다음으로 가고, 문제가 생기면 앞으로 되돌아갑니다 요구사항이 처음부터 분명한 일
프로토타입(Prototype) 일부를 먼저 만들어 보여 주고 요구사항을 다듬습니다 무엇을 원하는지 아직 흐린 일
나선형(Spiral) 계획 → 위험 분석 → 개발 → 고객 평가를 한 바퀴로 삼아 반복합니다 위험이 큰 대규모 시스템

나선형은 위험을 줄이는 대신 관리가 복잡하고 끝내는 시점을 정하기 어렵습니다.

KDD와 CRISP-DM

KDD(Knowledge Discovery in Databases)는 데이터에서 지식을 찾는 절차를 다섯 단계로 정리한 모델이고, CRISP-DM(Cross Industry Standard Process for Data Mining)은 같은 일을 여섯 단계로 정리하되 되돌아가는 흐름까지 그려 둔 산업 표준입니다.

KDD (5단계) CRISP-DM (6단계)
— 업무 이해(Business Understanding)
데이터셋 선택(Selection) 데이터 이해(Data Understanding)
데이터 전처리(Preprocessing) 데이터 이해
데이터 변환(Transformation) 데이터 준비(Data Preparation)
데이터 마이닝(Data Mining) 모델링(Modeling)
해석과 평가(Interpretation) 평가(Evaluation), 전개(Deployment)

차이는 양 끝에 몰려 있습니다. 업무 이해는 CRISP-DM의 첫 단계지만 KDD에는 없고, 전개는 CRISP-DM에서만 독립 단계입니다. 4레벨 구조(단계 – 일반화 태스크 – 세분화 태스크 – 프로세스 실행)도 CRISP-DM에만 있습니다.

계층적 프로세스 모델과 빅데이터 분석 방법론

빅데이터 분석 방법론은 계층적 프로세스 모델로 짜여 있습니다. 세 계층입니다.

계층 무엇인가 딸린 것
단계(Phase) 최상위 프로세스 그룹 단계별 산출물, 버전 관리 기준선
태스크(Task) 단계를 이루는 단위 활동 보고서 같은 산출물, 품질 검토 항목
스텝(Step) 더 못 쪼개는 워크 패키지 입력자료 – 처리 및 도구 – 출력자료

「입력자료 – 처리 및 도구 – 출력자료」가 붙는 곳은 스텝뿐입니다. 그 위에 다섯 단계가 얹히고, 단계마다 남기는 산출물이 정해져 있습니다.

단계 하는 일 대표 산출물
분석 기획(Planning) 비즈니스 이해와 범위 설정, 프로젝트 정의, 수행·위험 계획 범위 정의서, 프로젝트 수행계획서, 위험관리 계획서
데이터 준비(Preparing) 필요 데이터 정의, 저장 설계, 수집과 정합성 점검 데이터 정의서, 데이터 획득 계획서, 데이터 저장소
데이터 분석(Analyzing) 데이터셋 준비, 텍스트·탐색적 분석, 모델링, 평가와 검증 분석용 데이터셋, 탐색적 분석 보고서, 모델 평가 보고서
시스템 구현(Developing) 설계와 구현, 시스템 테스트와 운영 시스템 설계서, 구현 시스템, 운영계획서
평가 및 전개(Deploying) 모델 발전 계획, 프로젝트 평가와 보고 모델 발전계획서, 프로젝트 평가·종료 보고서

데이터 분석에서 데이터가 모자라면 데이터 준비로 되돌아갑니다.

하향식 접근법

문제가 이미 주어져 있을 때 씁니다. 네 단계가 순서대로 붙습니다.

단계 하는 일
문제 탐색(Problem Discovery) 풀 수 있는지는 안 따지고 빠짐없이 나열합니다
문제 정의(Problem Definition) 비즈니스 문제를 데이터 문제로 바꿔 적습니다
해결방안 탐색(Solution Search) 분석 역량과 기존 시스템 사용 여부로 네 갈래를 봅니다
타당성 평가(Feasibility Study) 경제적 타당성과 데이터·기술적 타당성을 봅니다

문제 탐색이 가장 넓고, 그 안에서 세 갈래로 훑습니다. 첫째는 비즈니스 모델 캔버스 기반입니다 — 업무·제품·고객(가치사슬 셋)과 규제와 감사·지원 인프라(지원 둘), 다섯 블록으로 회사를 줄여 놓고 블록마다 분석거리를 찾습니다. 둘째는 범위 확장으로, 거시적 관점(사회·기술·경제·환경·정치), 경쟁자 확대, 시장의 니즈, 역량의 재해석 네 관점을 씁니다. 셋째가 외부 참조 모델 기반으로, 동종·유사 업계가 이미 한 분석을 벤치마킹해 후보를 빠르게 얻는 방식입니다. 이렇게 건진 후보는 분석 유스케이스로 적습니다 — 그 분석을 어디에 어떻게 쓰고 무슨 효과를 기대하는지 적어 두어야 나중에 착수 근거가 됩니다.

상향식 접근법

문제가 무엇인지부터 모를 때 씁니다. 데이터를 먼저 보고 거기서 문제를 건져 올리므로 정답이 붙지 않은 데이터를 다루는 비지도 학습이 어울립니다. 디자인 사고는 아이디어를 펼치는 발산과 좁히는 수렴을 번갈아 밟는 방식이고 상향식은 발산 쪽에 기댑니다. 프로토타이핑은 일단 만들어 보여 주고 반응을 보며 요구사항을 다듬는 시행착오 방식으로, 문제 정의가 흐릴 때·데이터가 있는지 확신할 수 없을 때·데이터를 쓰는 목적이 도중에 바뀔 수 있을 때 이 방식이 맞습니다.

분석 과제 정의서와 프로젝트 관리

두 접근법으로 건진 과제는 분석 과제 정의서로 옮겨 적습니다. 필요한 소스 데이터, 분석 방법, 데이터 입수와 분석의 난이도, 분석 수행 주기, 분석 결과를 누가 검증하는가, 상세 분석 과정을 담습니다. 프로젝트 계획의 입력물이자 이해관계자가 같은 것을 보게 하는 기준이라 시험에서는 「무엇을 적는가」가 그대로 문제가 됩니다.

관리할 때는 일정·품질·범위 같은 일반 항목 위에 분석 프로젝트 5대 주요 특성이 얹힙니다.

특성 무엇을 관리하는가
Data Size 다루는 데이터 양
Data Complexity 정형·비정형이 섞이고 소스가 여럿인 정도
Speed 실시간인가 일괄인가, 처리·응답 속도
Analytic Complexity 정확도와 해석 용이성이 서로 반대로 가는 문제
Accuracy & Precision 정확도는 실제와 얼마나 가까운가(활용), 정밀도는 반복했을 때 얼마나 일정한가(안정성)

표의 마지막 두 행은 각각 서로 당기는 값을 안고 있습니다. 정확도를 좇으면 모형이 복잡해져 설명이 어려워지고(Analytic Complexity), 정밀도를 좇으면 값의 흔들림은 줄지만 실제와의 거리가 남을 수 있습니다(Accuracy & Precision).

분석 마스터 플랜과 과제 우선순위

분석 마스터 플랜은 도출한 과제를 언제 어떤 순서로 실행할지 그린 중장기 계획이고, 수립 절차는 네 걸음입니다 — 과제 도출 → 우선순위 평가 → 적용 범위와 방식 결정 → 이행 로드맵 수립. 우선순위는 전략적 중요도, 비즈니스 성과와 ROI, 실행 용이성으로 정하고, 적용 범위와 방식은 업무 내재화 적용 수준, 분석 데이터 적용 수준, 기술 적용 수준 셋으로 정합니다.

우선순위 평가의 기준은 시급성과 난이도 둘이고 둘 다 투자수익(ROI) 관점에서 나옵니다.

축 무엇으로 판단하는가 ROI에서 대응하는 것
시급성 전략적 중요도, 목표 가치(KPI) 비즈니스 효과 – Value
난이도 데이터 획득·가공·저장 비용, 조직의 분석 수준 투자 비용 – 3V

투자 비용 쪽 3V는 크기(Volume), 다양성(Variety), 속도(Velocity)이고 여기에 가치(Value)를 더한 것이 4V입니다. 3V가 난이도로, 네 번째 V가 시급성으로 간다는 대응이 그대로 문제가 됩니다. 두 축을 교차하면 사분면이 나옵니다.

시급성 난이도 언제 푸는가
현재 쉬움 가장 먼저 풉니다
현재 어려움 시급성이 기준이면 두 번째입니다
미래 쉬움 난이도가 기준이면 두 번째입니다
미래 어려움 가장 나중에 풉니다

가운데 두 칸의 순서만 시급성과 난이도 중 무엇을 앞세우는가가 정합니다. 교재 그림의 로마 숫자는 축을 그린 방향에 따라 달라지므로 「현재·쉬움이 먼저」라는 조합으로 외웁니다. 난이도는 고정값이 아니어서 과제 범위를 좁히면 어려운 과제도 앞당길 수 있습니다.

이행 로드맵은 그 결과를 시간 축에 얹은 것으로 세 단계를 밟습니다 — 데이터 분석 체계 도입 → 데이터 분석 유효성 검증 → 데이터 분석 확산과 고도화. 단계마다 추진 과제·데이터· 시스템 세 갈래로 세부 계획을 적고, 세부 이행 계획은 폭포수 대신 분석과 모델링을 반복하는 방식으로 짭니다.

분석 거버넌스와 조직 구조

분석 거버넌스는 분석을 한 번으로 끝내지 않고 지속하기 위한 관리 체계입니다. 구성요소는 조직(Organization), 프로세스(Process), 시스템(System), 데이터(Data), 인력과 교육(Human Resource) 다섯입니다. 조직 구조는 셋으로 갈립니다.

구조 어떻게 두는가 약한 곳
집중형 전사 분석 전담 조직을 따로 둡니다 현업과 업무가 이원화·중복될 수 있습니다
기능 중심(기능형) 별도 조직 없이 각 부서가 알아서 합니다 부서 최적화에 그쳐 전사 과제를 못 다룹니다
분산형 분석 인력을 현업 부서에 배치합니다 과제를 어떻게 나눠 줄지가 관건입니다

다섯 구성요소 가운데 사람 쪽이 분석 인력 양성과 분석 문화입니다. 교육의 목표는 도구 사용법이 아니라 분석 역량 — 데이터로 무엇을 물어야 하는지 알게 하는 것입니다. 전담 인력을 키우는 것과 별개로 전 임직원이 기본 소양을 갖춰야 하고, 결과를 실제 의사결정에 쓰는 습관이 붙어야 분석 문화가 됩니다. 그래서 문화 정착은 교육이 아니라 변화 관리로 다룹니다.

준비도와 성숙도

분석 준비도는 조직이 분석할 준비가 됐는지 재는 것으로 분석 업무 파악, 인력 및 조직, 분석 기법, 분석 데이터, 분석 문화, 분석 인프라(IT) 여섯 영역을 봅니다. 분석 성숙도는 얼마나 깊이 쓰는지 재는 것으로 도입 → 활용 → 확산 → 최적화 네 단계이고 비즈니스 부문, 조직·역량 부문, IT 부문 셋을 진단합니다.

성숙도 낮음 성숙도 높음
준비도 낮음 준비형 정착형
준비도 높음 도입형 확산형

갖춰만 놓은 것이 도입형, 갖춘 것은 모자라도 이미 쓰고 있는 것이 정착형입니다.

연습 문제

  1. 「이탈하려는 고객을 미리 잡겠다」는 목표는 세웠지만 어떤 기법으로 예측할지는 아직 정하지 못했습니다. 네 갈래 중 어디입니까?
    ① 최적화(Optimization)
    ② 솔루션(Solution)
    ③ 통찰(Insight)
    ④ 발견(Discovery)
    ②. 분석 대상은 「고객 이탈」로 정해졌으니 아는 쪽이고 분석 방법은 모르는 쪽입니다. 대상을 알고 방법을 모르면 솔루션입니다.
  2. 요구사항이 아직 분명하지 않아 일부 기능을 먼저 만들어 보여 주고 반응을 보며 다듬으려 합니다. 어느 개발 모델입니까?
    ① 폭포수 모델
    ② 프로토타입 모델
    ③ 나선형 모델
    ④ 계층적 프로세스 모델
    ②. 요구사항이 흐릴 때 시제품으로 확인하며 가는 것이 프로토타입 모델입니다. ①은 앞 단계가 확정돼야 다음으로 가고, ③은 위험 분석을 넣어 반복하는 모델이며, ④는 개발 모델이 아니라 방법론을 단계·태스크·스텝으로 쪼갠 구조입니다.
  3. KDD에는 대응 단계가 없고 CRISP-DM에만 독립 단계로 있는 것은?
    ① 데이터 변환
    ② 데이터 마이닝
    ③ 업무 이해
    ④ 데이터 전처리
    ③. CRISP-DM은 업무 이해로 시작해 목적을 먼저 정의하고, KDD는 데이터셋 선택부터 시작합니다. 전개도 KDD에서는 해석과 평가에 섞여 있습니다.
  4. 빅데이터 분석 방법론에서 「입력자료 – 처리 및 도구 – 출력자료」로 구성되는 계층과, 데이터 정의서·데이터 획득 계획서를 산출물로 내는 단계를 바르게 짝지은 것은?
    ① 태스크 – 데이터 준비
    ② 스텝 – 데이터 준비
    ③ 스텝 – 데이터 분석
    ④ 단계 – 시스템 구현
    ②. 세 자료로 구성되는 워크 패키지가 스텝이고, 데이터를 정의하고 모으는 산출물은 데이터 준비 단계에서 나옵니다. 데이터 분석 단계의 산출물은 분석용 데이터셋과 평가 보고서 쪽입니다.
  5. 「무엇을 분석할지부터 불분명하고 필요한 데이터가 있는지도 확신할 수 없다.」 이 상황에 알맞은 접근법과 이유로 옳은 것은?
    ① 하향식 — 문제가 주어져 있으므로
    ② 하향식 — 타당성부터 따져야 하므로
    ③ 상향식 — 프로토타이핑으로 시행착오를 거쳐 문제를 다듬어야 하므로
    ④ 상향식 — 경제적 타당성 평가가 먼저이므로
    ③. 문제 정의가 흐리고 데이터의 존재도 불확실하면 상향식이고, 그 상황을 위한 방식이 프로토타이핑입니다. ①은 문제가 주어져 있다는 전제부터 틀렸고, 타당성 평가는 하향식의 마지막 단계라 ② ④는 이유가 어긋납니다.
  6. 분석 프로젝트 5대 주요 특성에 대한 설명으로 옳지 않은 것은?
    ① Data Complexity는 정형과 비정형이 섞이고 소스가 여럿인 정도를 본다
    ② Speed는 실시간 처리인지 일괄 처리인지를 본다
    ③ Analytic Complexity가 커지면 해석하기도 함께 쉬워진다
    ④ 정확도와 정밀도는 한쪽을 좇으면 다른 쪽을 잃을 수 있다
    ③. 모형이 복잡해질수록 정확도는 오를 수 있어도 왜 그런 답이 나왔는지 설명하기는 어려워집니다. 정확도는 실제와 얼마나 가까운가, 정밀도는 반복했을 때 얼마나 일정한가라 ④는 옳은 설명입니다.
  7. 시급성과 난이도로 우선순위를 평가할 때 옳은 것은?
    ① 3V는 시급성에, Value는 난이도에 대응한다
    ② 시급성이 미래이고 난이도가 어려운 과제를 가장 먼저 푼다
    ③ 난이도는 한번 정해지면 바꿀 수 없다
    ④ 시급성이 현재이고 난이도가 쉬운 과제를 가장 먼저 푼다
    ④. 지금 필요하면서 쉬운 과제가 첫 자리, 나중에 필요하면서 어려운 과제가 마지막 자리입니다. ①은 대응이 뒤집혔고, ②는 그 마지막 자리를 첫 자리로 바꿔 놓았으며, ③은 범위를 좁히면 난이도가 내려가므로 틀렸습니다.
  8. 별도의 분석 전담 조직을 두지 않고 각 부서가 필요할 때 스스로 분석해, 전사 차원의 핵심 과제를 다루기 어려운 조직 구조는?
    ① 집중형
    ② 기능 중심
    ③ 분산형
    ④ 확산형
    ②. 기능 중심은 부서 최적화에 그칩니다. ①은 전담 조직을 따로 두는 구조, ③은 분석 인력을 현업에 배치하는 구조이고, ④는 조직 구조가 아니라 준비도와 성숙도가 모두 높은 조직 유형의 이름입니다.
  9. 분석 마스터 플랜 수립에서 적용 범위와 방식을 정할 때 보는 세 수준이 아닌 것은?
    ① 업무 내재화 적용 수준
    ② 분석 데이터 적용 수준
    ③ 기술 적용 수준
    ④ 투자 비용 적용 수준
    ④. 세 수준은 업무·데이터·기술입니다. 투자 비용은 적용 범위를 정하는 값이 아니라 앞 단계인 우선순위 평가에서 난이도 쪽으로 들어가는 값입니다.
  10. 분석 준비도는 낮지만 분석 성숙도는 높은 조직은 어느 유형입니까?
    ① 준비형
    ② 도입형
    ③ 정착형
    ④ 확산형
    ③ 정착형. 둘 다 낮으면 준비형, 준비도만 높으면 도입형, 성숙도만 높으면 정착형, 둘 다 높으면 확산형입니다.
데이터분석 준전문가 (ADsP) 시험 노트 전체 보기