데이터분석 준전문가 (ADsP)

데이터분석 준전문가 (ADsP) 시험 노트개념 정리17 MIN

KDD와 CRISP-DM 단계 비교

분석 방법론이 왜 필요하고 무엇으로 이뤄지는지에서 출발해 폭포수·프로토타입·나선형 모델, KDD 5단계와 CRISP-DM 6단계, CRISP-DM의 4레벨 구조, 두 방법론의 단계 대응까지 표로 갈라 둡니다.

앞 노트에서 무엇을 분석할지 정하는 기획을 봤습니다. 이번에는 그 분석을 어떤 순서로 밟는가, 곧 분석 방법론입니다. 이 범위는 2과목에서 순서와 대응을 가장 많이 묻는 자리입니다. 단계 이름이 영어와 한글로 섞여 나오고, KDD와 CRISP-DM이 비슷한 일을 다른 이름과 다른 칸 수로 나눠 놓아 짝이 한 칸씩 밀린 선택지를 자주 만납니다. 두 방법론을 따로 외우기보다 한 표에 나란히 놓고 어긋나는 양 끝을 붙잡는 것이 이 노트의 목표입니다.

분석 방법론

방법론의 필요성

분석을 잘하는 사람의 노하우는 대개 그 사람 머릿속에만 있습니다. 말로 꺼내기 어려운 이런 지식을 암묵지라 하고, 문서나 절차로 적혀 남이 읽을 수 있는 지식을 형식지라 합니다. 암묵지를 형식지로 꺼내는 형식화, 형식지를 정리해 방법론으로 묶는 체계화, 그 방법론을 사람들이 몸에 익혀 다시 암묵지로 만드는 내재화가 돌고 도는 과정이 곧 분석 방법론을 만드는 과정입니다. 방법론이 있으면 누가 맡아도 비슷한 품질의 결과가 나오고, 한 사람이 떠나도 노하우가 조직에 남습니다.

방법론이 필요한 또 하나의 이유는 사람의 판단이 흔들린다는 데 있습니다. 데이터에 근거한 의사결정을 막는 것으로 고정관념, 편향된 생각, 그리고 같은 내용도 어떻게 제시되느냐에 따라 판단이 달라지는 프레이밍 효과가 꼽힙니다. 정해진 절차를 따르면 이런 흔들림이 끼어들 자리가 줄어듭니다.

방법론의 구성요소

방법론은 네 가지로 이뤄집니다.

  • 상세한 절차(Procedures)
  • 방법(Methods)
  • 도구와 기법(Tools & Techniques)
  • 템플릿과 산출물(Templates & Outputs)

문항에서 네 가지 가운데 하나를 「분석 인력」이나 「예산」처럼 사람·돈으로 바꿔 놓으면 그 보기가 답입니다. 방법론은 일하는 방식을 적은 것이지 자원 목록이 아니기 때문입니다.

개발 모델

방법론이 절차를 어떤 모양으로 밟을지는 소프트웨어 개발에서 쓰던 모델을 빌려 옵니다.

폭포수와 프로토타입

폭포수 모델은 단계를 순서대로 밟아 앞 단계가 끝나야 다음 단계로 넘어가는 방식입니다. 물이 위에서 아래로만 흐르듯 진행하고, 문제가 발견되면 앞 단계로 되돌아가는 피드백을 거칩니다. 요구사항이 처음부터 분명한 일에 맞습니다. 프로토타입 모델은 일부를 먼저 빠르게 만들어 사용자에게 보여 주고, 그 반응으로 요구사항을 다듬으며 개선해 가는 방식입니다. 사용자가 무엇을 원하는지 아직 흐린 일, 곧 앞 노트의 발견·통찰처럼 대상이 분명하지 않은 분석에 어울립니다.

나선형

나선형 모델은 계획, 위험 분석, 개발, 고객 평가를 한 바퀴로 삼아 그 바퀴를 거듭 돌며 점점 완성해 가는 방식입니다. 바퀴마다 위험을 먼저 따지므로 위험이 큰 대규모 시스템에 맞습니다. 대신 반복이 많아 관리가 복잡해지고, 언제 끝낼지 정하기 어렵다는 단점이 따라옵니다.

모델 진행 모양 어울리는 일 약점
폭포수 순차, 되돌아가는 피드백 요구사항이 분명한 일 뒤늦은 변경에 약하다
프로토타입 일부를 먼저 만들어 개선 요구사항이 흐린 일 전체 설계가 흐트러지기 쉽다
나선형 반복, 매 바퀴 위험 분석 위험이 큰 대규모 일 관리가 복잡하다

실제 분석 프로젝트는 한 모델만 고르지 않습니다. 단계를 나누고 산출물을 남기는 뼈대는 폭포수를 따르되, 결과를 보고 데이터를 다시 만져야 하는 구간은 프로토타입이나 나선형처럼 반복합니다. 아래 두 방법론이 모두 「순서를 밟되 필요한 곳에서 되돌아가는」 모양인 것도 그래서입니다.

KDD

KDD 5단계

KDD(Knowledge Discovery in Databases)는 1996년 파야드(Fayyad)가 정리한, 데이터베이스에서 지식을 찾아내는 절차입니다. 다섯 단계입니다.

  1. 데이터셋 선택(Selection) — 분석에 쓸 데이터를 고르고 목표 데이터를 만듭니다. 그 앞에 비즈니스 도메인을 이해하고 목표를 세우는 일이 전제로 깔립니다.
  2. 데이터 전처리(Preprocessing) — 잡음, 이상치, 결측치를 찾아 지우거나 채웁니다. 모자라면 선택으로 돌아가 데이터를 더 고릅니다.
  3. 데이터 변환(Transformation) — 분석 목적에 맞게 변수를 고르고 차원을 줄이며, 학습용과 검증용 데이터로 나눕니다.
  4. 데이터 마이닝(Data Mining) — 목적에 맞는 기법과 알고리즘을 골라 패턴을 찾습니다.
  5. 해석과 평가(Interpretation/Evaluation) — 찾은 패턴을 해석하고 목적에 맞는지 평가해 지식으로 삼습니다.

헷갈리는 두 단계

전처리와 변환이 가장 자주 섞입니다. 전처리는 데이터를 깨끗하게 만드는 일이고, 변환은 깨끗한 데이터를 분석하기 좋은 모양으로 바꾸는 일입니다. 결측치 처리는 전처리, 차원 축소와 학습·검증 분리는 변환입니다. 「학습용과 검증용 데이터 분리는 어느 단계인가」가 단골 문항이고, 모델을 만드는 단계라고 착각해 데이터 마이닝을 고르기 쉽습니다. 데이터 마이닝은 이미 나눠 놓은 학습용 데이터로 모델을 만드는 단계이고, 나누는 일 자체는 그 앞에서 끝납니다.

CRISP-DM

CRISP-DM 6단계

CRISP-DM(Cross Industry Standard Process for Data Mining)은 1996년 유럽연합의 지원으로 여러 기업이 함께 만든 산업 표준 방법론입니다. 여섯 단계이고 단계마다 하는 일이 정해져 있습니다.

단계 하는 일
업무 이해(Business Understanding) 업무 목적 파악, 상황 파악, 데이터 마이닝 목표 설정, 프로젝트 계획 수립
데이터 이해(Data Understanding) 초기 데이터 수집, 데이터 기술 분석, 탐색, 품질 확인
데이터 준비(Data Preparation) 분석용 데이터셋 선택, 정제, 통합, 포매팅
모델링(Modeling) 기법 선택, 테스트 계획 설계, 모델 작성, 모델 평가
평가(Evaluation) 분석 결과 평가, 모델링 과정 평가, 모델 적용성 평가
전개(Deployment) 전개 계획 수립, 모니터링과 유지보수 계획, 종료 보고서, 프로젝트 리뷰

모델링 단계에도 「모델 평가」가 있고 그다음에 평가 단계가 따로 있다는 점이 함정입니다. 모델링 안의 평가는 테스트 데이터로 모델의 성능과 과적합을 확인하는 기술적 평가이고, 평가 단계는 그 모델이 처음 세운 업무 목적을 달성했는지를 따지는 평가입니다.

되돌아가는 흐름

CRISP-DM은 단계가 한 방향으로만 흐르지 않습니다. 업무 이해와 데이터 이해 사이, 데이터 준비와 모델링 사이는 서로 오가며, 평가 단계에서 목적을 못 이뤘으면 업무 이해로 돌아가 처음부터 다시 돕니다. 폭포수처럼 순서를 밟되 필요한 곳에서는 되돌아가는 구조입니다.

4레벨 구조

CRISP-DM은 단계만 적어 둔 것이 아니라 네 층으로 내려가는 4레벨 구조를 갖습니다.

레벨 무엇인가
단계(Phases) 최상위 여섯 단계
일반화 태스크(Generic Tasks) 데이터 마이닝의 한 과정을 빠짐없이 수행하는 단위
세분화 태스크(Specialized Tasks) 일반화 태스크를 구체적인 상황에 맞춰 나눈 것
프로세스 실행(Process Instances) 실제로 수행한 구체적인 실행

「데이터 정제」가 일반화 태스크라면 「범주형 데이터 정제」와 「연속형 데이터 정제」가 세분화 태스크입니다. 일반화 → 세분화의 순서를 뒤집은 보기가 자주 나옵니다.

두 방법론의 대응

KDD CRISP-DM
(선택에 앞선 도메인 이해와 목표 설정) 업무 이해
데이터셋 선택, 데이터 전처리 데이터 이해
데이터 변환 데이터 준비
데이터 마이닝 모델링
해석과 평가 평가
(결과 활용) 전개

가운데는 같다

가운데 네 줄은 거의 한 칸씩 짝지어집니다. KDD의 선택과 전처리가 CRISP-DM에서는 데이터 이해 한 단계로 묶이고, 변환이 데이터 준비, 마이닝이 모델링, 해석과 평가가 평가입니다. 앞의 흐름을 떠올리면 자연스럽습니다 — 데이터를 고르고 살펴서, 분석할 모양으로 바꾸고, 모델을 만들고, 결과를 따집니다.

양 끝이 다르다

차이는 양 끝에 몰려 있습니다. CRISP-DM은 업무 이해로 시작하고 전개로 끝나 두 단계가 독립해 서 있지만, KDD에서 도메인 이해는 선택 단계의 전제로 녹아 있고 결과 활용도 따로 단계를 두지 않습니다. 그래서 KDD는 다섯, CRISP-DM은 여섯입니다. 「KDD의 데이터 변환에 대응하는 CRISP-DM 단계는?」처럼 한 칸을 짚어 묻거나, 「CRISP-DM에만 있는 단계」를 고르게 합니다. 후자의 답은 전개입니다.

연습 문제

  1. 분석 방법론의 구성요소가 아닌 것은?
    ① 상세한 절차
    ② 도구와 기법
    ③ 템플릿과 산출물
    ④ 분석 전담 인력
    ④. 나머지 하나는 방법(Methods)입니다. 방법론은 일하는 방식을 적은 것이라 인력은 구성요소에 들지 않습니다.
  2. 반복마다 위험 분석을 거치며 점점 완성해 가는 개발 모델은?
    ① 폭포수 모델
    ② 프로토타입 모델
    ③ 나선형 모델
    ④ 계층적 프로세스 모델
    ③. 계획, 위험 분석, 개발, 고객 평가를 한 바퀴로 삼아 반복합니다. ④는 다음 노트의 빅데이터 분석 방법론이 쓰는 구조입니다.
  3. KDD에서 학습용과 검증용 데이터를 나누는 단계는?
    ① 데이터셋 선택
    ② 데이터 전처리
    ③ 데이터 변환
    ④ 데이터 마이닝
    ③. 변수 선택, 차원 축소와 함께 변환 단계에서 합니다. 결측치와 이상치 처리가 전처리입니다.
  4. CRISP-DM의 단계를 순서대로 놓은 것은?
    ① 데이터 이해 → 업무 이해 → 데이터 준비 → 모델링 → 평가 → 전개
    ② 업무 이해 → 데이터 이해 → 데이터 준비 → 모델링 → 평가 → 전개
    ③ 업무 이해 → 데이터 준비 → 데이터 이해 → 모델링 → 전개 → 평가
    ④ 업무 이해 → 데이터 이해 → 모델링 → 데이터 준비 → 평가 → 전개
    ②. 업무를 이해하고, 데이터를 살피고, 분석할 모양으로 준비한 뒤 모델을 만들고 평가해 전개합니다.
  5. CRISP-DM의 4레벨 구조를 위에서부터 놓은 것은?
    ① 단계 → 세분화 태스크 → 일반화 태스크 → 프로세스 실행
    ② 단계 → 일반화 태스크 → 세분화 태스크 → 프로세스 실행
    ③ 일반화 태스크 → 단계 → 세분화 태스크 → 프로세스 실행
    ④ 단계 → 태스크 → 스텝 → 프로세스 실행
    ②. 일반화 태스크를 상황에 맞춰 나눈 것이 세분화 태스크입니다. ④의 단계 · 태스크 · 스텝은 빅데이터 분석 방법론의 계층입니다.
  6. KDD의 데이터 마이닝 단계에 대응하는 CRISP-DM 단계는?
    ① 데이터 준비
    ② 모델링
    ③ 평가
    ④ 전개
    ②. 데이터 변환이 데이터 준비, 해석과 평가가 평가에 대응합니다. 전개는 CRISP-DM에만 독립 단계로 있습니다.
  7. CRISP-DM에 대한 설명으로 옳지 않은 것은?
    ① 업무 이해와 데이터 이해 사이를 오갈 수 있다
    ② 모델링 단계 안에도 모델 평가 태스크가 있다
    ③ 단계는 한 방향으로만 흐르고 되돌아가지 않는다
    ④ 평가 단계는 업무 목적의 달성 여부를 따진다
    ③. 업무 이해 ↔ 데이터 이해, 데이터 준비 ↔ 모델링이 서로 오가고, 평가에서 목적을 못 이루면 업무 이해로 돌아갑니다.
데이터분석 준전문가 (ADsP) 시험 노트 전체 보기