데이터분석 전문가(ADP) 시험 노트개념 정리21 MIN
분석 기획 방향성과 분석 방법론
ADP 3과목의 첫 자리입니다. 분석 대상과 방법으로 가르는 네 유형, 목표 시점별 접근 방식, 단계-태스크-스텝 계층과 생성 과정 모델 셋, KDD 5단계와 CRISP-DM 6단계, 빅데이터 분석 방법론 5단계를 표로 맞춰 정리합니다.
3과목 「데이터분석 기획」은 분석을 하기 전에 무엇을 정해 두는가를 다룹니다. 앞의 두 과목이 데이터와 기술의 이름을 묻는다면 여기서는 절차의 이름을 묻습니다. 네 유형·세 모델·5단계·6단계처럼 개수가 붙은 항목이 몰려 있어 외울 것이 많아 보이지만, 실제로는 어느 축으로 가른 것인가를 잡으면 개수는 따라옵니다. 이 노트는 방향을 정하는 방법과 절차를 적어 둔 방법론까지를 한자리에 놓습니다.
분석 대상과 방법
네 유형
분석 기획의 첫 갈림은 무엇을 분석할지 아는가와 어떻게 분석할지 아는가 두 축입니다. 각각을 아는 경우와 모르는 경우로 가르면 네 칸이 나옵니다.
| 방법을 안다 | 방법을 모른다 | |
|---|---|---|
| 대상을 안다 | 최적화(Optimization) | 솔루션(Solution) |
| 대상을 모른다 | 통찰(Insight) | 발견(Discovery) |
- 최적화는 풀 문제도 푸는 방법도 정해진 자리입니다. 재고 수준이나 가격처럼 이미 쓰는 모형의 값을 더 좋게 다듬습니다.
- 솔루션은 무엇을 풀지는 알지만 방법을 아직 모르는 자리입니다. 「설비 고장을 미리 알고 싶다」까지는 정해졌고 어떤 방식으로 알아낼지를 찾습니다.
- 통찰은 방법은 손에 있는데 그것으로 무엇을 볼지가 열린 자리입니다. 가진 기법을 데이터에 대 보며 의미 있는 주제를 찾아냅니다.
- 발견은 둘 다 열린 자리로, 새로운 가치를 탐색하는 성격이 가장 강합니다.
지문은 대개 상황을 서술하고 어느 유형인지를 묻습니다. 「대상은 정해졌는데 방법을 모색 중」이면 솔루션, 「방법은 있는데 적용할 곳을 찾는 중」이면 통찰로 읽으면 됩니다.
목표 시점
두 번째 갈림은 언제까지를 보는가입니다. 당면한 과제를 푸는 쪽과 분석을 조직에 심는 쪽으로 성격이 갈립니다.
| 견줄 것 | 과제 중심 | 마스터 플랜 중심 |
|---|---|---|
| 1차 목표 | Speed & Test | Accuracy & Deploy |
| 과제의 유형 | Quick & Win | Long Term View |
| 접근 방식 | Problem Solving | Problem Definition |
| 보는 기간 | 당면한 이슈 | 지속적 내재화 |
과제 중심은 빨리 해 보고 되는지 확인하는 쪽이라 문제를 푸는 데서 출발하고, 마스터 플랜 중심은 무엇이 문제인지부터 정의합니다. 실무에서는 둘을 함께 굴립니다 — 단기 과제로 성과를 보이면서 중장기 로드맵을 따로 세우는 식이고, 그 로드맵을 짜는 일은 다음다음 노트의 마스터 플랜에서 다룹니다.
방법론의 계층
단계·태스크·스텝
방법론은 일을 하는 절차와 산출물을 미리 적어 둔 틀입니다. 사람이 바뀌어도 같은 수준의 결과가 나오게 하려는 장치이고, 세 층으로 되어 있습니다.
| 층 | 무엇인가 | 끝나면 나오는 것 |
|---|---|---|
| 단계(Phase) | 최상위 구분. 목표가 하나씩 걸린다 | 단계별 산출물. 버전 관리 대상이 된다 |
| 태스크(Task) | 단계를 이루는 작업 묶음 | 보고서 형태의 중간 결과 |
| 스텝(Step) | 가장 작은 단위. 입력-처리-출력으로 적힌다 | 처리한 결과물 |
단계가 프로젝트 관리의 기준이 된다는 점이 자주 나옵니다. 일정과 인력을 붙이는 작업 분해 구조가 이 단계를 뼈대로 그려지고, 단계가 끝날 때마다 산출물을 확정해 다음으로 넘깁니다.
생성 과정 모델
방법론은 소프트웨어 개발 모델에서 절차의 모양을 빌려 왔습니다. 셋이 나옵니다.
- 폭포수 모델은 단계를 순서대로 밟고 앞 단계가 끝나야 다음으로 갑니다. 문제가 생기면 앞 단계로 돌아가는 피드백이 있지만 되돌리는 비용이 큽니다. 요구사항이 처음부터 뚜렷할 때 어울립니다.
- 나선형 모델은 계획·분석·개발·평가를 한 바퀴로 보고 그 바퀴를 반복해 점점 키워 갑니다. 위험을 회차마다 걷어낼 수 있어 대규모 사업에 맞지만, 회차가 늘어지면 관리가 어려워집니다.
- 프로토타이핑 모델은 일단 시제품을 만들어 보여 주고 반응을 받아 고쳐 갑니다. 요구사항이 불명확할 때 쓰며, 아래에서 위로 쌓아 올리는 상향식 성격입니다.
폭포수가 하향식이고 프로토타이핑이 상향식이라는 짝, 나선형의 강점이 위험 관리라는 짝을 함께 기억해 둡니다.
KDD
다섯 단계
KDD(Knowledge Discovery in Databases)는 데이터에서 지식을 찾아내는 절차를 다섯 단계로 정리한 방법론입니다. 데이터 마이닝을 절차의 한 단계로 못 박아 둔 것이 특징입니다.
- 데이터셋 선택 — 분석에 쓸 데이터를 고르고 목표를 세운다
- 데이터 전처리 — 잡음과 결측, 이상값을 처리한다
- 데이터 변환 — 분석에 맞게 변수를 만들고 차원을 줄이며 학습용과 검증용으로 나눈다
- 데이터 마이닝 — 기법을 골라 패턴을 찾는다
- 결과 평가 — 찾은 패턴을 해석하고 활용 방안을 마련한다
전처리와 변환이 나뉘어 있는 점을 눈여겨봅니다. 전처리는 잘못된 값을 바로잡는 일이고 변환은 쓰기 좋은 모양으로 바꾸는 일이라 목적이 다릅니다. 파생변수를 만드는 것은 변환 쪽이고, 결측을 채우는 것은 전처리 쪽입니다.
앞에 붙는 것
다섯 단계 앞에는 분석 대상 업무를 이해하고 목표를 세우는 일이 놓입니다. KDD가 이것을 단계로 세지 않고 준비 작업으로 둔 탓에, 업무 이해를 절차 안에 넣은 CRISP-DM과 대비되는 지점이 됩니다.
CRISP-DM
여섯 단계
CRISP-DM(Cross-Industry Standard Process for Data Mining)은 업계 표준을 내걸고 만들어진 방법론으로 여섯 단계입니다.
- 업무 이해 — 업무 목적을 파악하고 그것을 분석 문제로 바꾼다
- 데이터 이해 — 데이터를 모아 살펴보고 품질을 확인한다
- 데이터 준비 — 분석용 데이터셋을 만든다. 시간이 가장 많이 드는 단계다
- 모델링 — 기법을 고르고 모델을 만들어 학습시킨다
- 평가 — 모델이 업무 목적에 맞는지 검증한다
- 전개 — 실제 업무에 적용하고 모니터링·유지보수 계획을 세운다
단계 사이가 한 방향이 아니라는 점이 이 방법론의 핵심입니다. 업무 이해와 데이터 이해는 서로 오가고, 평가에서 목적에 못 미치면 업무 이해로 돌아갑니다. 실무의 반복을 절차에 그대로 그려 둔 셈입니다.
네 수준
CRISP-DM의 계층은 넷입니다. 단계(Phases) 아래에 일반화된 작업인 제네릭 태스크, 그 아래 상황에 맞춰 구체화한 스페셜라이즈드 태스크, 맨 아래에 실제로 수행한 결과인 프로세스 인스턴스가 놓입니다. 앞에서 본 단계-태스크-스텝 세 층과 개수가 달라 헷갈리기 쉬운 자리입니다.
빅데이터 분석 방법론
다섯 단계
KDD와 CRISP-DM이 데이터 마이닝을 겨냥한 틀이라면, 빅데이터 분석 방법론은 그것을 시스템으로 만들어 운영하는 데까지 넓힌 다섯 단계입니다.
| 단계 | 하는 일 |
|---|---|
| 분석 기획 | 범위를 정하고 과제를 정의하며 위험을 식별한다 |
| 데이터 준비 | 필요한 데이터를 정의하고 저장 설계를 한 뒤 수집·정합성 점검을 한다 |
| 데이터 분석 | 탐색적 분석과 모델링, 모델 평가·검증을 한다 |
| 시스템 구현 | 설계·구축·테스트를 거쳐 운영 환경에 올린다 |
| 평가 및 전개 | 모델 발전 계획을 세우고 프로젝트 성과를 평가해 마무리한다 |
계층은 단계-태스크-스텝 셋을 그대로 씁니다. 다른 둘에 없던 시스템 구현이 따로 서 있다는 것이 이 방법론의 표지이고, 분석 결과를 한 번 보고 끝내지 않고 돌아가는 시스템으로 남긴다는 뜻입니다.
세 방법론의 대응
셋의 단계를 나란히 놓으면 이름만 다르고 겹치는 자리가 보입니다.
| KDD | CRISP-DM | 빅데이터 분석 방법론 |
|---|---|---|
| (준비 작업) | 업무 이해 | 분석 기획 |
| 데이터셋 선택 | 데이터 이해 | 데이터 준비 |
| 전처리·변환 | 데이터 준비 | 데이터 준비 |
| 데이터 마이닝 | 모델링 | 데이터 분석 |
| 결과 평가 | 평가 | 데이터 분석 |
| — | 전개 | 시스템 구현·평가 및 전개 |
가장 자주 나오는 것이 「전처리와 변환이 CRISP-DM의 어느 단계에 해당하는가」입니다. 둘 다 데이터 준비로 묶입니다. 반대로 CRISP-DM의 업무 이해에 대응하는 KDD 단계는 없다는 것도 함께 묻습니다. 단계 개수를 외우는 것보다 이 표의 세로줄을 한 번 맞춰 보는 편이 시험장에서 오래 갑니다.
연습 문제
다음 상황에 해당하는 분석 유형은?
「이탈 고객을 미리 알아내고 싶다는 목표는 정해졌으나, 어떤 기법으로 알아낼지는 아직 정하지 못했다.」
① 최적화
② 솔루션
③ 통찰
④ 발견②. 분석 대상은 정해졌고 방법을 모르는 경우입니다. ①은 대상과 방법이 모두 정해진 자리, ③은 방법은 있는데 적용할 대상을 찾는 자리, ④는 둘 다 열린 자리입니다.방법론이 5단계로 되어 있고 단계마다 태스크가 3개씩, 태스크마다 스텝이 4개씩 있다. 전체 스텝의 개수와, 작업 분해 구조에서 산출물을 확정하는 지점의 수는?
① 스텝 12개, 확정 지점 5회
② 스텝 60개, 확정 지점 3회
③ 스텝 60개, 확정 지점 5회
④ 스텝 12개, 확정 지점 15회③. 스텝은 개입니다. 산출물을 확정해 다음으로 넘기는 것은 단계가 끝날 때이므로 5회입니다. 태스크는 보고서 형태의 중간 결과를, 스텝은 처리 결과물을 내지만 버전 관리 대상이 되는 단계별 산출물과는 층이 다릅니다.CRISP-DM의 단계 순서로 옳은 것은?
① 업무 이해 → 데이터 준비 → 데이터 이해 → 모델링 → 평가 → 전개
② 데이터 이해 → 업무 이해 → 데이터 준비 → 모델링 → 전개 → 평가
③ 업무 이해 → 데이터 이해 → 데이터 준비 → 모델링 → 평가 → 전개
④ 업무 이해 → 데이터 이해 → 모델링 → 데이터 준비 → 평가 → 전개③. 업무 목적을 분석 문제로 바꾸는 것이 먼저이고, 데이터를 살펴본 뒤 분석용 데이터셋을 만들고, 모델을 만들어 평가한 다음 업무에 적용합니다. 다만 순서가 한 방향으로만 흐르지는 않아 평가에서 업무 이해로 되돌아갈 수 있습니다.KDD와 CRISP-DM을 견준 설명으로 옳지 않은 것은?
① KDD의 데이터 전처리와 데이터 변환은 CRISP-DM의 데이터 준비에 대응한다
② KDD의 데이터 마이닝은 CRISP-DM의 모델링에 대응한다
③ CRISP-DM의 업무 이해에 정확히 대응하는 KDD 단계가 있다
④ CRISP-DM에는 전개 단계가 있지만 KDD의 다섯 단계에는 없다③. KDD는 업무 이해와 목표 설정을 다섯 단계에 넣지 않고 앞에 붙는 준비 작업으로 둡니다. 절차 안에 업무 이해를 명시한 것이 CRISP-DM과 갈리는 지점이고, ④처럼 전개가 없다는 점도 같은 성격의 차이입니다.생성 과정 모델에 대한 설명으로 옳은 것은?
① 폭포수 모델은 앞 단계로 되돌아가는 피드백이 전혀 없다
② 나선형 모델은 반복 회차가 늘어져도 관리 부담이 늘지 않는다
③ 프로토타이핑 모델은 요구사항이 명확할 때만 쓸 수 있다
④ 나선형 모델은 회차마다 위험을 걷어낼 수 있어 대규모 사업에 어울린다④. ①은 폭포수에도 피드백이 있으나 되돌리는 비용이 클 뿐이므로 틀립니다. ②는 거꾸로입니다 — 회차가 늘어지면 관리가 어려워지는 것이 나선형의 약점입니다. ③도 거꾸로입니다 — 프로토타이핑은 요구사항이 불명확할 때 시제품으로 반응을 받아 가며 좁히는 상향식 방법입니다.서술형 연습입니다. 설비 고장을 미리 알아내는 분석 과제를 맡았습니다. 현업은 「고장을 줄이고 싶다」고만 말했고 어떤 데이터가 있는지도 아직 모릅니다. 분석 유형과 접근 방식을 정하고, 어느 방법론을 어떤 이유로 고르겠는지 단계를 들어 5줄 이내로 쓰시오.
채점 기준은 셋입니다. (1) 유형을 정확히 짚었는가 — 분석 대상은 설비 고장으로 정해졌고 방법은 아직 모르므로 솔루션 유형입니다. 목표 시점으로는 먼저 작은 범위에서 빨리 확인해 보는 과제 중심이 맞고, 1차 목표는 정확도보다 속도와 검증(Speed & Test)입니다. (2) 방법론을 고르고 근거를 댔는가 — CRISP-DM이 표준 답입니다. 「고장을 줄이고 싶다」는 업무 목적을 분석 문제로 바꾸는 업무 이해 단계가 절차 안에 있고, 데이터가 무엇이 있는지 모르는 상태라 데이터 이해 단계에서 수집과 품질 확인을 거쳐 업무 이해로 되돌아가는 반복이 필요하기 때문입니다. KDD를 고른다면 업무 이해가 단계 밖 준비 작업이라 이 반복을 절차로 담지 못한다는 점을 함께 적어야 합니다. 결과를 상시 운영 시스템으로 남겨야 한다면 시스템 구현 단계가 따로 선 빅데이터 분석 방법론을 고르는 답도 인정합니다. (3) 단계를 실제로 들어 설명했는가 — 업무 이해에서 고장의 정의와 예측 시점을 못 박고, 데이터 이해에서 센서·정비 이력의 존재와 품질을 확인하며, 데이터 준비에서 학습용 데이터셋을 만들고, 모델링과 평가를 거쳐 전개로 넘어가는 흐름을 적으면 됩니다. 방법론 이름만 대고 단계를 들지 않으면 배점의 3분의 1만 붙습니다.

