데이터분석 준전문가 (ADsP)

데이터분석 준전문가 (ADsP) 시험 노트개념 정리19 MIN

빅데이터 분석 방법론 5단계

단계·태스크·스텝으로 내려가는 계층적 프로세스 모델 위에 분석 기획, 데이터 준비, 데이터 분석, 시스템 구현, 평가 및 전개 다섯 단계를 얹고, 단계마다 하는 일과 남기는 산출물을 짝지어 둡니다.

앞 노트에서 KDD와 CRISP-DM을 나란히 놓았습니다. 둘 다 데이터 마이닝을 위한 절차라 모델을 만들고 평가하는 데서 대체로 멈춥니다. 이번에 다룰 빅데이터 분석 방법론은 그 앞뒤를 넓혀, 분석 기획에서 시작해 분석 결과를 시스템으로 구현하고 프로젝트를 평가해 닫는 데까지를 다섯 단계로 정리한 것입니다. 문항은 「이 산출물은 어느 단계에서 나오는가」와 「이 태스크는 어느 단계에 속하는가」 두 모양으로 몰려 나옵니다. 단계마다 무슨 일을 하는지를 먼저 잡고, 산출물을 그 일의 결과로 붙이면 따로 외울 것이 크게 줄어듭니다.

계층적 프로세스 모델

세 계층

빅데이터 분석 방법론은 계층적 프로세스 모델로 짜여 있습니다. 위에서부터 단계, 태스크, 스텝 세 층으로 내려가는 구조입니다.

계층 무엇인가 딸린 것
단계(Phase) 최상위 프로세스 그룹 단계별 산출물, 기준선(baseline)과 버전 관리
태스크(Task) 단계를 이루는 단위 활동 물리적·논리적 단위의 산출물, 품질 검토 항목
스텝(Step) 더 쪼개지 않는 작업 단위 입력자료, 처리 및 도구, 출력자료

단계가 끝날 때마다 그 산출물을 기준선으로 정해 둡니다. 기준선은 이후 변경을 따지는 기준으로 삼는 확정된 상태이고, 그래서 단계에는 버전 관리가 따라붙습니다.

스텝과 워크 패키지

스텝은 프로젝트의 일을 잘게 쪼개 나열한 WBS(Work Breakdown Structure)에서 가장 아래 칸인 워크 패키지에 해당합니다. 스텝 하나는 무엇을 받아(입력자료), 무엇으로 처리해(처리 및 도구), 무엇을 내놓는가(출력자료)로 적힙니다. 「입력자료 – 처리 및 도구 – 출력자료」가 붙는 곳은 세 계층 가운데 스텝뿐이라, 이 셋을 태스크나 단계에 붙여 놓은 선택지가 오답으로 자주 나옵니다. 앞 노트의 CRISP-DM이 네 층(단계 · 일반화 태스크 · 세분화 태스크 · 프로세스 실행)이었던 것과 층 수부터 다르다는 점도 함께 붙잡아 둡니다.

다섯 단계의 흐름

세 계층 위에 다섯 단계가 얹힙니다. 단계는 차례로 밟지만 두 곳에서 되돌아갑니다. 분석 기획과 데이터 준비 사이는 서로 오가며 범위를 고치고, 데이터 분석에서 데이터가 모자라면 데이터 준비로 돌아갑니다. 앞 노트의 CRISP-DM과 견주면, CRISP-DM의 업무 이해가 분석 기획에, 데이터 이해와 데이터 준비가 데이터 준비 단계와 데이터 분석 단계의 앞머리에, 모델링과 평가가 데이터 분석 단계에 들어가고, 전개가 시스템 구현과 평가 및 전개 두 단계로 넓어진 모양입니다. 빅데이터 분석 방법론이 가장 크게 더한 것이 바로 이 뒤쪽, 모델을 시스템으로 올리고 프로젝트를 닫는 부분입니다.

분석 기획

비즈니스 이해와 범위 설정

첫 단계인 분석 기획(Planning)은 풀 문제와 범위를 정하는 단계입니다. 먼저 업무 매뉴얼과 관련 자료로 비즈니스를 이해하고, 무엇까지 분석할지 범위를 정합니다. 결과물이 프로젝트 범위 정의서(SOW, Statement of Work)입니다. 이어서 프로젝트를 정의하고 수행 계획을 세웁니다. 모델이 운영될 모습과 모델을 평가할 기준을 이때 정해 두고, 일정과 인력을 담은 프로젝트 수행 계획서와 WBS를 만듭니다.

위험 계획

기획 단계의 마지막 태스크는 프로젝트 위험 계획 수립입니다. 데이터를 못 구하거나 품질이 나쁜 것처럼 분석을 막을 위험을 미리 찾아내고, 위험마다 대응 방법을 정해 위험관리 계획서에 담습니다. 대응 방법은 넷입니다.

대응 무엇을 하나
회피(Avoid) 위험이 생기는 원인 자체를 없앤다
전이(Transfer) 위험을 보험이나 외부 계약으로 넘긴다
완화(Mitigate) 위험이 생길 가능성이나 피해를 줄인다
수용(Accept) 위험을 받아들이고 생기면 대처한다

외부 데이터 구매가 늦어질 위험이라면, 사내 데이터만으로 분석하도록 범위를 바꾸는 것이 회피이고, 공급 업체와 지연 배상 조건을 계약하는 것이 전이이며, 미리 주문해 여유를 두는 것이 완화입니다. 넷의 이름과 예를 뒤섞어 놓고 고르게 하는 문항이 나옵니다.

데이터 준비

필요 데이터 정의

데이터 준비(Preparing) 단계는 분석에 쓸 데이터를 정하고 모으는 단계입니다. 정형·비정형 데이터 가운데 무엇이 필요한지, 사내 데이터인지 외부 데이터인지를 정의해 데이터 정의서를 만들고, 그 데이터를 어떻게 얻을지 담은 데이터 획득 계획서를 만듭니다.

데이터 스토어 설계

모은 데이터를 어디에 어떻게 담을지 정합니다. 정형 데이터는 관계형 데이터베이스 같은 저장소로, 비정형 데이터는 분산 파일 시스템이나 NoSQL 같은 저장소로 따로 설계하고, 결과가 정형·비정형 데이터 스토어 설계서입니다.

수집과 정합성 점검

설계한 저장소에 데이터를 실제로 수집해 넣고, 그 데이터가 서로 맞는지 점검합니다. 정합성은 데이터 사이에 모순이 없고 값이 서로 들어맞는 성질이고, 이 점검 결과를 데이터 정합성 점검 리스트로 남깁니다. 분석 기획과 데이터 준비는 서로 오갑니다 — 데이터를 모아 보니 기획한 분석이 안 되면 기획으로 돌아가 범위를 고칩니다.

데이터 분석

분석용 데이터와 탐색

데이터 분석(Analyzing) 단계는 가장 태스크가 많은 단계입니다. 먼저 비즈니스 규칙을 확인하고 분석용 데이터셋을 준비합니다. 텍스트 데이터가 있으면 텍스트 분석을 하고 텍스트 분석 보고서를 남깁니다. 탐색적 분석(EDA)은 모델을 만들기 전에 데이터의 분포와 변수 사이의 관계를 통계량과 그림으로 살펴보는 일이고, 결과가 데이터 탐색 보고서와 시각화 보고서입니다.

모델링과 평가

모델링은 데이터를 학습용과 테스트용으로 나누는 데이터 분할에서 시작해, 모델을 만들고 운영 방안을 정하는 데까지입니다. 모델링 결과 보고서, 알고리즘 설명서, 모니터링 방안이 나옵니다. 그다음 모델 평가 및 검증에서 모델의 성능을 평가하고, 검증용 데이터로 한 번 더 검증해 모델 평가 보고서와 모델 검증 보고서를 만듭니다. 이 단계에서 데이터가 모자라거나 품질이 나쁘다는 것이 드러나면 데이터 준비 단계로 되돌아갑니다. KDD에서는 학습·검증 분리가 변환 단계였지만 여기서는 데이터 분석 단계 안의 모델링 태스크라는 점을 갈라 둡니다.

시스템 구현과 평가 및 전개

시스템 구현

시스템 구현(Developing) 단계는 분석에서 만든 모델을 실제 업무 시스템에 올리는 단계입니다. 시스템을 분석·설계하고 구현한 뒤, 테스트해 시스템 테스트 결과 보고서를 남기고, 운영할 수 있도록 운영자 매뉴얼, 사용자 매뉴얼, 시스템 운영 계획서를 만듭니다. 이 단계는 모든 프로젝트에 필요하지 않습니다 — 분석 보고서만으로 끝나는 프로젝트라면 건너뛰고 바로 평가 및 전개로 갑니다. 반대로 추천 모형처럼 매일 돌아가야 하는 분석이라면 이 단계가 프로젝트에서 가장 긴 구간이 되기도 합니다. 모델을 만든 사람과 시스템을 운영할 사람이 다르므로, 운영자가 모델을 이해하고 문제가 생겼을 때 대처할 수 있도록 매뉴얼을 두 벌(운영자용과 사용자용)로 나눠 남깁니다.

평가 및 전개

마지막 평가 및 전개(Deploying) 단계는 두 태스크입니다. 모델이 시간이 지나도 쓸모를 유지하도록 모니터링과 재학습 계획을 담은 모델 발전 계획서를 만들고, 프로젝트 성과를 정량·정성으로 평가해 프로젝트 성과 평가서와 최종 보고서를 남기며 프로젝트를 닫습니다. 지식 자산으로 남기는 것까지가 이 단계의 몫입니다.

단계별 산출물

한눈에

단계 대표 산출물
분석 기획 프로젝트 범위 정의서(SOW), 프로젝트 수행 계획서, WBS, 위험관리 계획서
데이터 준비 데이터 정의서, 데이터 획득 계획서, 데이터 스토어 설계서, 정합성 점검 리스트
데이터 분석 탐색 보고서, 모델링 결과 보고서, 알고리즘 설명서, 모델 평가·검증 보고서
시스템 구현 시스템 설계서, 구현 시스템, 테스트 결과 보고서, 운영자·사용자 매뉴얼
평가 및 전개 모델 발전 계획서, 프로젝트 성과 평가서, 최종 보고서

헷갈리는 짝

이름이 비슷한 산출물이 다른 단계에 흩어져 있습니다. 「계획서」가 붙은 것만 모아도 수행 계획서(기획), 획득 계획서(준비), 운영 계획서(구현), 발전 계획서(전개)로 네 단계에 걸칩니다. 「평가」도 모델 평가 보고서는 데이터 분석, 성과 평가서는 평가 및 전개입니다. 모델을 따지는 평가인가, 프로젝트를 따지는 평가인가로 가르면 됩니다. WBS를 데이터 준비나 시스템 구현에 붙여 놓은 선택지도 오답입니다 — 일을 쪼개는 표는 일을 시작하기 전, 기획 단계에서 나옵니다.

연습 문제

  1. 계층적 프로세스 모델에서 입력자료, 처리 및 도구, 출력자료로 이루어지는 계층은?
    ① 단계
    ② 태스크
    ③ 스텝
    ④ 프로세스 실행
    ③. 스텝은 WBS의 워크 패키지에 해당하는 단위 프로세스입니다. ④는 CRISP-DM의 4레벨 가운데 하나입니다.
  2. 빅데이터 분석 방법론의 다섯 단계를 순서대로 놓은 것은?
    ① 분석 기획 → 데이터 분석 → 데이터 준비 → 시스템 구현 → 평가 및 전개
    ② 데이터 준비 → 분석 기획 → 데이터 분석 → 시스템 구현 → 평가 및 전개
    ③ 분석 기획 → 데이터 준비 → 데이터 분석 → 시스템 구현 → 평가 및 전개
    ④ 분석 기획 → 데이터 준비 → 시스템 구현 → 데이터 분석 → 평가 및 전개
    ③. 문제와 범위를 정하고, 데이터를 모으고, 분석해 모델을 만들고, 시스템에 올리고, 평가해 닫습니다.
  3. 프로젝트 범위 정의서(SOW)가 나오는 단계는?
    ① 분석 기획
    ② 데이터 준비
    ③ 데이터 분석
    ④ 평가 및 전개
    ①. 비즈니스 이해 및 범위 설정 태스크의 산출물입니다.
  4. 위험을 보험이나 외부 계약으로 넘기는 대응 방법은?
    ① 회피
    ② 전이
    ③ 완화
    ④ 수용
    ②. 회피는 원인을 없애고, 완화는 가능성이나 피해를 줄이고, 수용은 받아들이고 생기면 대처합니다.
  5. 데이터 준비 단계의 산출물이 아닌 것은?
    ① 데이터 정의서
    ② 데이터 스토어 설계서
    ③ 데이터 정합성 점검 리스트
    ④ 모델 검증 보고서
    ④. 모델 평가와 검증은 데이터 분석 단계의 마지막 태스크입니다.
  6. 빅데이터 분석 방법론에서 데이터를 학습용과 테스트용으로 나누는 태스크가 속한 단계는?
    ① 분석 기획
    ② 데이터 준비
    ③ 데이터 분석
    ④ 시스템 구현
    ③. 데이터 분석 단계의 모델링 태스크가 데이터 분할로 시작합니다. KDD에서는 같은 일을 데이터 변환 단계에서 한다는 점과 구별합니다.
  7. 산출물과 단계의 짝으로 옳지 않은 것은?
    ① 모델 발전 계획서 — 평가 및 전개
    ② 운영자 매뉴얼 — 시스템 구현
    ③ 탐색 보고서 — 데이터 분석
    ④ 프로젝트 성과 평가서 — 데이터 분석
    ④. 프로젝트를 따지는 성과 평가서는 평가 및 전개 단계입니다. 데이터 분석 단계에서 나오는 평가는 모델 평가 보고서입니다.
  8. 빅데이터 분석 방법론에 대한 설명으로 옳지 않은 것은?
    ① 데이터 분석 중 데이터가 모자라면 데이터 준비 단계로 돌아간다
    ② 분석 기획과 데이터 준비는 서로 오가며 범위를 고친다
    ③ 시스템 구현 단계는 어떤 프로젝트에서도 건너뛸 수 없다
    ④ 단계가 끝날 때마다 산출물을 기준선으로 정해 버전을 관리한다
    ③. 분석 보고서만으로 끝나는 프로젝트라면 시스템 구현을 건너뛰고 평가 및 전개로 갑니다.
데이터분석 준전문가 (ADsP) 시험 노트 전체 보기