빅데이터분석기사

빅데이터분석기사 시험 노트개념 정리19 MIN

분석 방법론과 과제 발굴 접근법

단계·태스크·스텝 세 층에서 출발해 KDD·CRISP-DM·SEMMA를 한 표에 맞추고 빅데이터 분석 방법론 5단계를 본 뒤, 과제를 찾아내는 하향식 네 단계와 상향식의 디자인 씽킹·프로토타이핑까지 정리합니다.

여기서부터 1과목의 성격이 바뀝니다. 앞의 여섯 노트가 데이터와 기술과 법의 이름을 다뤘다면 이제는 절차의 이름을 다룹니다. 방법론은 개수가 붙은 항목이 몰려 있어 외울 것이 많아 보이지만, 실제로는 셋만 잡으면 나머지가 따라옵니다 — 절차를 어떤 층으로 쪼갰는가, 데이터 마이닝을 절차의 어디에 놓았는가, 그리고 분석할 과제를 위에서 내려오며 찾는가 아래에서 올라오며 찾는가입니다.

계층적 프로세스 모델

단계·태스크·스텝

방법론은 일을 하는 절차와 산출물을 미리 적어 둔 틀입니다. 사람이 바뀌어도 비슷한 수준의 결과가 나오게 하려는 장치이고, 절차를 세 층으로 쪼개 적습니다.

층 무엇인가 끝나면 나오는 것
단계(Phase) 최상위 구분. 목표가 하나씩 걸린다 단계별 산출물. 버전 관리 대상이 된다
태스크(Task) 단계를 이루는 작업 묶음 보고서 형태의 중간 결과
스텝(Step) 가장 작은 단위. 입력·처리·출력으로 적힌다 처리한 결과물

세 층의 이름과 순서를 바꿔 놓은 보기가 자주 나옵니다. 「스텝이 태스크를 묶는다」처럼 방향이 뒤집힌 것을 고르면 됩니다.

단계와 산출물

단계가 프로젝트 관리의 기준이 된다는 점이 함께 나옵니다. 일정과 인력을 붙이는 작업 분해 구조가 이 단계를 뼈대로 그려지고, 단계가 끝날 때마다 산출물을 확정해 다음으로 넘깁니다. 그래서 단계 사이에는 승인이라는 관문이 서고, 태스크와 스텝 사이에는 그런 관문이 없습니다.

KDD와 CRISP-DM

KDD 다섯 단계

KDD는 데이터베이스에서 지식을 찾아내는 절차를 다섯 단계로 정리한 방법론입니다. 데이터 마이닝을 절차의 한 단계로 못 박아 둔 것이 특징입니다.

  1. 데이터셋 선택 — 분석에 쓸 데이터를 고르고 목표를 세운다
  2. 데이터 전처리 — 잡음과 결측, 이상값을 처리한다
  3. 데이터 변환 — 변수를 만들고 차원을 줄이며 학습용과 검증용으로 나눈다
  4. 데이터 마이닝 — 기법을 골라 패턴을 찾는다
  5. 결과 평가 — 찾은 패턴을 해석하고 활용 방안을 마련한다

전처리와 변환이 따로 서 있는 점을 눈여겨봅니다. 전처리는 잘못된 값을 바로잡는 일이고 변환은 쓰기 좋은 모양으로 바꾸는 일이라 목적이 다릅니다. 결측을 채우는 것은 전처리 쪽이고 파생변수를 만드는 것은 변환 쪽입니다.

CRISP-DM 여섯 단계

CRISP-DM은 업계 표준을 내걸고 만들어진 방법론으로 여섯 단계입니다.

  1. 업무 이해 — 업무 목적을 파악하고 그것을 분석 문제로 바꾼다
  2. 데이터 이해 — 데이터를 모아 살펴보고 품질을 확인한다
  3. 데이터 준비 — 분석용 데이터셋을 만든다. 시간이 가장 많이 드는 단계다
  4. 모델링 — 기법을 고르고 모델을 만들어 학습시킨다
  5. 평가 — 모델이 업무 목적에 맞는지 검증한다
  6. 전개 — 실제 업무에 적용하고 모니터링·유지보수 계획을 세운다

단계 사이가 한 방향이 아니라는 점이 이 방법론의 핵심입니다. 업무 이해와 데이터 이해는 서로 오가고, 평가에서 목적에 못 미치면 업무 이해로 돌아갑니다. KDD가 업무 이해를 단계로 세지 않고 준비 작업으로 둔 것과 대비되는 자리이기도 합니다.

SEMMA

다섯 단계

SEMMA는 분석 도구를 만든 쪽에서 내놓은 방법론으로, 도구를 쓰는 순서에 가깝게 다섯 단계로 짜여 있습니다.

단계 하는 일
Sampling 분석에 쓸 표본을 추출한다
Exploration 탐색적 분석으로 데이터를 살펴본다
Modification 변수를 변환하고 만들어 분석에 맞게 고친다
Modeling 모델을 만들어 학습시킨다
Assessment 모델의 성능을 평가한다

셋 중 가장 좁습니다. 업무 이해로 시작하지도 않고 전개로 끝나지도 않아서, 기술적인 절차에만 초점을 둔 방법론이라는 설명이 그대로 문항이 됩니다.

세 방법론의 대응

셋을 나란히 놓으면 이름만 다르고 겹치는 자리가 보입니다.

KDD CRISP-DM SEMMA
(준비 작업) 업무 이해 —
데이터셋 선택 데이터 이해 Sampling
데이터 전처리 데이터 준비 Exploration
데이터 변환 데이터 준비 Modification
데이터 마이닝 모델링 Modeling
결과 평가 평가 Assessment
— 전개 —

가장 자주 나오는 것이 「KDD의 전처리와 변환은 CRISP-DM의 어느 단계인가」입니다. 둘 다 데이터 준비로 묶입니다. 그다음이 「업무 이해에 대응하는 KDD 단계는 무엇인가」인데, 대응하는 단계가 없다는 것이 답입니다. 표의 첫 줄과 마지막 줄에 빈칸이 어디 있는지만 봐 두면 이 계열은 거의 다 풀립니다.

빅데이터 분석 방법론

다섯 단계

셋이 데이터 마이닝을 겨냥한 틀이라면, 빅데이터 분석 방법론은 그것을 시스템으로 만들어 운영하는 데까지 넓힌 다섯 단계입니다.

단계 하는 일
분석 기획 범위를 정하고 과제를 정의하며 위험을 식별한다
데이터 준비 데이터를 정의하고 저장 설계를 한 뒤 수집·정합성 점검을 한다
데이터 분석 탐색적 분석과 모델링, 모델 평가·검증을 한다
시스템 구현 설계·구축·테스트를 거쳐 운영 환경에 올린다
평가 및 전개 모델 발전 계획을 세우고 성과를 평가해 마무리한다

계층은 앞에서 본 단계·태스크·스텝 셋을 그대로 씁니다.

시스템 구현

다른 셋에 없던 시스템 구현이 따로 서 있다는 것이 이 방법론의 표지입니다. 분석 결과를 보고서 한 번으로 끝내지 않고 돌아가는 시스템으로 남긴다는 뜻이고, 빅데이터가 일회성 분석이 아니라 운영 업무에 붙는다는 전제가 여기에 들어 있습니다. 마지막 단계에 모델 발전 계획이 들어간 것도 같은 이유로, 배포한 뒤에도 성능이 떨어지면 다시 학습시켜야 하기 때문입니다.

하향식 접근

네 단계

방법론이 「어떻게 할 것인가」라면 접근법은 「무엇을 할 것인가」를 찾는 방식입니다. 하향식 접근법은 문제가 이미 주어져 있다고 보고 위에서 아래로 내려오며 푸는 방식이고 네 단계입니다.

  1. 문제 탐색 — 어디에 문제가 있을 수 있는지 빠짐없이 훑는다
  2. 문제 정의 — 업무 문제를 데이터 분석 문제로 바꿔 적는다
  3. 해결방안 탐색 — 어떤 기법과 시스템으로 풀지 찾는다
  4. 타당성 검토 — 할 만한 일인지 판정한다

2단계가 번역하는 자리입니다. 「이탈 고객이 많다」는 업무의 말이고 「가입 후 90일 이내 이탈 여부를 예측한다」가 분석의 말입니다.

문제 탐색의 도구

1단계에서 빠뜨리는 영역이 없게 하려고 기준 모형을 놓고 훑습니다. 업무·제품·고객이라는 세 단위 영역에 지원 인프라와 규제·감사 영역을 더한 다섯 칸으로 나눠 보는 방식이 자주 쓰이고, 동종 업계의 참조 모델이나 이미 알려진 분석 사례를 대 보기도 합니다.

4단계의 타당성은 둘로 나눠 봅니다. 경제적 타당성은 비용 대비 편익을 따지는 것이고, 데이터 및 기술적 타당성은 필요한 데이터가 실제로 있는지와 그것을 다룰 역량이 있는지를 보는 것입니다. 데이터가 없으면 아무리 좋은 과제도 설 수 없어서, 이 검토가 우선순위 판단으로 그대로 이어집니다.

상향식 접근

디자인 씽킹

상향식 접근법은 문제가 무엇인지 모르는 상태에서 데이터를 먼저 보며 의미 있는 주제를 찾아 올라오는 방식입니다. 무엇을 찾을지 정하지 않고 데이터의 구조를 드러내는 비지도 학습이 이 성격에 가깝습니다.

디자인 씽킹은 그 과정을 설계로 옮긴 것으로, 가능성을 넓게 펼치는 발산과 후보를 좁히는 수렴을 번갈아 돌립니다. 발산이 상향식이고 수렴이 하향식이라, 디자인 씽킹은 둘 중 하나가 아니라 두 방향을 번갈아 쓰는 방식입니다. 「상향식의 다른 이름」이라고 적힌 보기가 오답인 근거가 이것입니다.

프로토타이핑

프로토타이핑은 일단 작게 만들어 보여 주고 반응을 받아 고쳐 가는 방식입니다. 상향식이 제대로 돌아가려면 이것이 필요한데, 쓰는 자리가 셋으로 정리됩니다.

  • 문제 정의가 명확하지 않을 때
  • 필요한 데이터가 있는지 미리 알 수 없을 때
  • 데이터를 어디에 쓸지가 바뀔 수 있을 때

셋 다 「미리 다 정하고 시작할 수 없다」는 상황입니다. 반대로 요구사항이 처음부터 뚜렷하면 순서대로 밟는 폭포수 쪽이 낫고, 그래서 하향식과 폭포수, 상향식과 프로토타이핑이 짝으로 묶여 나옵니다.

연습 문제

  1. 방법론의 계층 구조를 큰 단위부터 나열한 것은?
    ① 단계 → 태스크 → 스텝
    ② 태스크 → 단계 → 스텝
    ③ 스텝 → 태스크 → 단계
    ④ 단계 → 스텝 → 태스크
    ①. 단계가 최상위이고 그 아래 태스크, 가장 작은 단위가 스텝입니다. 단계마다 산출물이 확정되어 프로젝트 관리의 기준이 됩니다.
  2. KDD에서 파생변수를 만드는 작업이 속하는 단계는?
    ① 데이터셋 선택
    ② 데이터 전처리
    ③ 데이터 변환
    ④ 데이터 마이닝
    ③. 전처리는 잘못된 값을 바로잡는 일이고, 분석에 쓰기 좋은 모양으로 바꾸는 일은 변환입니다. 결측 처리가 전처리, 파생변수 생성과 차원 축소가 변환입니다.
  3. CRISP-DM의 여섯 단계에 해당하지 않는 것은?
    ① 업무 이해
    ② 데이터 준비
    ③ 시스템 구현
    ④ 전개
    ③. 시스템 구현은 빅데이터 분석 방법론에만 있는 단계입니다. CRISP-DM은 업무 이해·데이터 이해·데이터 준비·모델링·평가·전개 여섯입니다.
  4. SEMMA에 대한 설명으로 옳은 것은?
    ① 업무 이해로 시작해 전개로 끝난다
    ② Sampling·Exploration·Modification·Modeling·Assessment 다섯 단계다
    ③ 데이터 마이닝을 절차에서 빼고 통계 분석만 다룬다
    ④ 단계 사이를 오가는 반복을 명시한 것이 특징이다
    ②. SEMMA는 기술적 절차에 초점을 둔 다섯 단계라 업무 이해도 전개도 없습니다. ④의 반복을 명시한 것은 CRISP-DM입니다.
  5. 다음 중 KDD의 데이터 전처리와 데이터 변환이 CRISP-DM에서 대응하는 단계는?
    ① 데이터 이해
    ② 데이터 준비
    ③ 모델링
    ④ 평가
    ②. 둘 다 데이터 준비 하나로 묶입니다. 반대로 CRISP-DM의 업무 이해에 대응하는 KDD 단계는 없다는 것도 같은 표에서 나옵니다.
  6. 「최근 이탈 고객이 늘었다」는 현업의 말을 「가입 후 90일 이내 이탈 여부를 예측한다」로 바꿔 적었습니다. 하향식 접근법의 어느 단계입니까?
    ① 문제 탐색
    ② 문제 정의
    ③ 해결방안 탐색
    ④ 타당성 검토
    ②. 업무의 말을 데이터 분석의 말로 옮기는 것이 문제 정의입니다. 어떤 기법으로 예측할지 고르는 것은 그다음 단계입니다.
  7. 디자인 씽킹에 대한 설명으로 옳은 것은?
    ① 상향식 접근법의 다른 이름이다
    ② 발산과 수렴을 번갈아 돌린다
    ③ 요구사항이 뚜렷할 때만 쓸 수 있다
    ④ 문제 정의를 건너뛰는 것이 특징이다
    ②. 가능성을 넓히는 발산은 상향식이고 후보를 좁히는 수렴은 하향식이라, 디자인 씽킹은 두 방향을 번갈아 씁니다. 요구사항이 뚜렷하지 않을 때 쓰는 방식이므로 ③도 반대입니다.
  8. 프로토타이핑이 필요한 상황으로 보기 어려운 것은?
    ① 문제 정의가 명확하지 않다
    ② 필요한 데이터가 있는지 미리 알 수 없다
    ③ 데이터를 어디에 쓸지가 바뀔 수 있다
    ④ 요구사항과 산출물이 계약서에 확정되어 있다
    ④. 앞의 셋은 「미리 다 정하고 시작할 수 없다」는 상황이라 만들어 보며 고쳐 갑니다. ④처럼 확정된 경우는 순서대로 밟는 방식이 낫습니다.

이 단원을 정리할 때는 표 하나만 들고 가면 됩니다. 세로로 KDD·CRISP-DM·SEMMA·빅데이터 분석 방법론을 놓고 가로로 단계를 맞춰 보면, 어느 방법론이 업무 이해를 가졌는지, 전개를 가졌는지, 시스템 구현을 가졌는지가 한눈에 갈립니다. 접근법 쪽은 더 간단해서 「문제를 아는가」 하나로 하향식과 상향식이 갈리고, 그 아래에 붙는 디자인 씽킹과 프로토타이핑은 문제를 모를 때 쓰는 장치라는 점만 잡으면 됩니다.

빅데이터분석기사 시험 노트 전체 보기