빅데이터분석기사 시험 노트개념 정리19 MIN
분석 과제 우선순위와 로드맵 수립
찾아낸 과제를 어떤 순서로 할지 정하는 자리입니다. 과제를 정의할 때 짚는 다섯 영역, 시급성과 난이도로 짠 우선순위 매트릭스, ROI 관점의 4V, 마스터플랜 수립 기준과 로드맵 세 단계, WBS까지 봅니다.
앞 노트에서 과제를 찾아냈다면 이제는 그것을 「어떤 순서로 할 것인가」를 정할 차례입니다. 하향식으로 훑으면 과제 후보가 수십 개 나오는데 한꺼번에 할 수는 없고, 고르는 기준을 말로만 두면 목소리 큰 쪽이 이깁니다. 그래서 두 축으로 된 격자에 과제를 올려놓고 순서를 읽어 내는 방식이 표준으로 자리 잡았습니다. 이 단원의 문항은 거의 전부 그 격자에서 나오고, 나머지는 정해진 순서를 계획 문서로 옮기는 절차입니다.
분석 과제 정의
정의서에 담는 것
분석 과제 정의서는 과제 하나를 실행하기 전에 무엇을 어떻게 할지 적어 두는 문서입니다. 이후 단계의 기준이 되므로 다음이 들어갑니다.
- 필요한 소스 데이터와 그 입수 방법
- 분석 방법과 상세 수행 과정
- 데이터 입수와 분석의 난이도
- 분석 수행 주기
- 결과를 누가 어떻게 검증할 것인가
마지막 항목이 자주 빠집니다. 검증 책임자와 검증 방식을 미리 적어 두지 않으면 결과가 나온 뒤에 「이 수치를 믿을 수 있는가」를 두고 처음부터 다시 이야기하게 됩니다.
수행 주기도 가볍게 볼 항목이 아닙니다. 한 번 돌려 보고 끝내는 과제와 매일 새벽에 자동으로 도는 과제는 필요한 데이터 파이프라인부터 다릅니다. 정의서에서 주기를 「상시」로 적어 두면 그 순간부터 그 과제는 분석이 아니라 운영 시스템을 만드는 일이 되고, 아래에서 볼 난이도 평가가 한 칸 올라갑니다.
다섯 영역
과제를 정의할 때 짚는 관리 영역이 다섯으로 정리됩니다. 앞의 셋은 데이터가 정하고 뒤의 둘은 분석이 정합니다.
| 영역 | 무엇을 보는가 |
|---|---|
| Data Size | 다룰 데이터의 양 |
| Data Complexity | 정형·비정형이 섞였는지, 통합할 원천이 몇인지 |
| Speed | 결과를 얼마나 빨리 내야 하는지 |
| Analytic Complexity | 모델의 복잡도. 해석력과 정확도의 맞바꿈이 걸린다 |
| Accuracy & Precision | 결과가 얼마나 맞고 얼마나 일정한지 |
Speed는 분석에 걸리는 시간이 아니라 결과를 요구받는 시점이라는 점을 봐 둡니다. 밤새 돌려도 되는 월간 리포트와 카드 승인 순간에 답해야 하는 이상거래 탐지는 같은 모델이라도 설계가 달라집니다.
정확도와 정밀도
다섯 번째 영역의 두 낱말은 자주 뒤바뀌어 출제됩니다.
| 정확도(Accuracy) | 정밀도(Precision) | |
|---|---|---|
| 무엇을 재나 | 모델의 결과가 실제 값에 얼마나 가까운가 | 같은 조건에서 반복했을 때 결과가 얼마나 일정한가 |
| 어느 관점 | 활용 | 안정성 |
| 나쁜 예 | 늘 비슷하게 나오지만 실제와 어긋난다 | 평균은 맞지만 돌릴 때마다 들쭉날쭉하다 |
둘은 함께 높이기 어려워 한쪽을 올리면 다른 쪽이 내려가는 관계입니다. 어느 쪽을 택할지는 용도가 정합니다 — 예측값 자체를 업무에 쓰면 정확도 쪽이고, 여러 대안을 견주는 데 쓰면 결과가 흔들리지 않는 정밀도 쪽이 중요합니다.
우선순위 매트릭스
두 축
과제를 올려놓는 격자의 두 축은 시급성과 난이도입니다.
- 시급성은 그 과제가 지금 필요한가를 봅니다. 전략적 중요도와 목표 가치를 따지고 값은 현재와 미래로 갈립니다.
- 난이도는 지금 가진 것으로 할 수 있는가를 봅니다. 데이터를 얻고 가공하고 저장하는 비용, 분석에 드는 비용, 필요한 분석 수준을 따지고 값은 쉬움과 어려움으로 갈립니다.
시급성이 「할 가치가 있는가」이고 난이도가 「할 수 있는가」입니다. 둘을 섞어 하나의 점수로 만들지 않고 축을 둘로 둔 이유가 여기 있습니다 — 가치가 큰데 지금은 못 하는 과제를 버리지 않고 뒤로 미루기 위해서입니다.
사분면과 순서
두 축을 교차하면 네 칸이 나옵니다.
| 사분면 | 시급성 | 난이도 |
|---|---|---|
| I | 미래 | 어려움 |
| II | 미래 | 쉬움 |
| III | 현재 | 쉬움 |
| IV | 현재 | 어려움 |
가장 먼저 하는 것은 III이고 가장 나중이 I이라는 점은 어느 기준을 쓰든 같습니다. 갈리는 것은 가운데 둘의 순서입니다.
| 우선순위 기준 | 순서 |
|---|---|
| 시급성 | III → IV → II |
| 난이도 | III → II → IV |
지금 급한 것부터 하겠다면 어려워도 현재 과제인 IV가 먼저이고, 할 수 있는 것부터 해서 성과를 보이겠다면 쉬운 II가 먼저입니다. 문항은 대개 「시급성을 기준으로 할 때의 순서」처럼 기준을 지정해 주므로, 지정된 축의 값이 좋은 칸을 앞에 놓으면 됩니다.
사분면은 고정된 것이 아닙니다. 기술이 좋아지거나 데이터가 확보되면 난이도가 내려가 I이 IV로, II가 III으로 옮겨 갑니다. 그래서 미래 과제를 버리지 않고 목록에 남겨 두는 것이 매트릭스를 쓰는 이유의 절반입니다.
ROI 관점의 4V
투자와 효과
앞의 두 축을 투자 대비 효과로 다시 읽으면 빅데이터의 4V와 그대로 맞물립니다.
| 4V | ROI에서의 자리 |
|---|---|
| Volume | 투자비용 |
| Variety | 투자비용 |
| Velocity | 투자비용 |
| Value | 비즈니스 효과 |
앞의 3V는 데이터를 모으고 저장하고 처리하는 데 드는 돈이라 투자이고, Value는 그렇게 해서 얻는 것이라 효과입니다. 4V를 「빅데이터의 특성 넷」으로만 외우면 이 문항에서 막히므로, 셋과 하나로 갈린다는 점을 함께 잡아 둡니다.
두 축과의 연결
이 갈라짐이 앞의 매트릭스로 이어집니다.
- 투자비용 요소인 3V가 크면 난이도가 올라갑니다.
- 비즈니스 효과인 Value가 크면 시급성이 올라갑니다.
그래서 「ROI 관점에서 시급성에 해당하는 요소는 무엇인가」라는 물음의 답은 Value이고, 난이도 쪽을 물으면 3V입니다. 두 물음이 번갈아 나오므로 한 번에 짝을 지어 두는 편이 낫습니다.
마스터플랜
수립 기준
분석 마스터플랜은 과제 하나가 아니라 조직 전체의 분석을 어떤 순서와 범위로 펼칠지 적은 중장기 계획입니다. 정할 것이 두 묶음입니다.
| 묶음 | 고려 요소 |
|---|---|
| 적용 우선순위 | 전략적 중요도, 비즈니스 성과와 ROI, 실행 용이성 |
| 적용 범위와 방식 | 업무 내재화 적용 수준, 분석 데이터 적용 수준, 기술 적용 수준 |
앞 묶음이 「무엇을 먼저 할까」이고 뒤 묶음이 「어디까지 할까」입니다. 둘을 같은 목록으로 섞어 놓은 보기가 오답으로 나오므로 셋씩 갈라 기억합니다.
로드맵 세 단계
마스터플랜을 시간 위에 펼친 것이 로드맵이고 세 단계로 이행합니다.
- 데이터 분석 체계 도입 — 분석 기회를 발굴하고 과제를 정의해 이행 계획을 세운다
- 데이터 분석 유효성 검증 — 파일럿으로 돌려 보고 효과가 있는지 확인한다
- 데이터 분석 확산 및 고도화 — 검증된 것을 업무에 통합하고 대상을 넓힌다
가운데 단계가 있다는 점이 핵심입니다. 곧바로 전사 확산으로 가지 않고 작게 검증하는 관문을 두는 것이고, 여기서 효과가 안 나오면 과제를 접거나 다시 정의합니다.
작업 계획
WBS 네 단계
WBS는 프로젝트를 실제 작업 단위로 쪼개 일정과 담당을 붙이는 구조입니다. 분석 프로젝트의 WBS는 네 단계로 짭니다.
- 데이터 분석 과제 정의 — 정의서를 확정하고 일정을 수립한다
- 데이터 준비 및 탐색 — 데이터를 모아 전처리하고 살펴본다
- 데이터 분석 모델링 및 검증 — 모델을 만들고 성능을 검증한다
- 산출물 정리 — 결과와 코드, 문서를 정리해 넘긴다
앞 노트의 방법론 다섯 단계와 헷갈리기 쉬운데, 방법론은 절차의 틀이고 WBS는 그 틀에 일정과 사람을 붙인 것입니다. 그래서 WBS에는 시스템 구현 같은 단계가 없고 대신 산출물 정리가 마지막에 옵니다.
일정 관리
WBS의 각 작업에 시작일과 종료일을 붙이면 막대 그래프로 일정을 보이는 간트 차트가 됩니다. 분석 프로젝트에서 일정을 짤 때 조심할 것이 둘입니다.
- 데이터 준비와 탐색에 드는 시간을 적게 잡는 일이 흔합니다. 방법론에서도 데이터 준비가 가장 오래 걸리는 단계로 못 박혀 있습니다.
- 모델링은 한 번에 끝나지 않고 검증에서 되돌아오므로, 왕복을 몇 번 할 것인지를 일정에 미리 넣어 둡니다.
분석 프로젝트가 일반 개발 프로젝트와 다른 점이 여기 있습니다. 개발은 요구사항이 정해지면 걸리는 시간을 어느 정도 어림할 수 있지만, 분석은 데이터를 열어 보기 전에는 원하는 성능이 나올지조차 알 수 없습니다. 그래서 일정에 왕복을 넣어 두고, 정해진 왕복을 다 쓰고도 목표에 못 미치면 과제를 다시 정의하거나 접는 지점을 미리 합의해 둡니다.
연습 문제
분석 과제를 정의할 때 짚는 다섯 영역에 해당하지 않는 것은?
① Data Size
② Analytic Complexity
③ Accuracy & Precision
④ Deployment Cost④. 다섯은 Data Size·Data Complexity·Speed·Analytic Complexity·Accuracy & Precision입니다. 배포 비용은 별도 항목으로 세지 않습니다.정확도와 정밀도에 대한 설명으로 옳은 것은?
① 정확도는 반복 수행했을 때의 편차를 뜻한다
② 정밀도는 실제 값과의 근접성을 뜻한다
③ 정확도는 활용 관점, 정밀도는 안정성 관점이다
④ 둘은 함께 높이는 데 아무 제약이 없다③. ①과 ②는 두 낱말의 뜻이 뒤바뀐 것이고, 둘은 한쪽을 올리면 다른 쪽이 내려가는 관계라 ④도 틀립니다.시급성이 「현재」이고 난이도가 「어려움」인 과제가 놓이는 사분면과, 시급성을 기준으로 할 때의 순위는?
① II 사분면, 두 번째
② IV 사분면, 두 번째
③ IV 사분면, 마지막
④ I 사분면, 세 번째②. 현재·어려움은 IV 사분면입니다. 시급성을 기준으로 하면 III → IV → II 순서이므로 두 번째입니다. 난이도를 기준으로 하면 같은 과제가 세 번째가 됩니다.난이도를 우선순위 기준으로 삼을 때의 순서로 옳은 것은?
① III → IV → II
② III → II → IV
③ II → III → IV
④ IV → III → II②. 어느 기준이든 III이 먼저이고 I이 마지막입니다. 난이도 기준이면 쉬운 II가 어려운 IV보다 앞섭니다.데이터를 얻기 어려워 뒤로 미뤄 둔 과제가 있습니다. 이후 사내에 데이터 수집 체계가 갖춰졌다면 이 과제는 매트릭스에서 어떻게 움직입니까?
① 시급성 축을 따라 미래에서 현재로 옮겨 간다
② 난이도 축을 따라 어려움에서 쉬움으로 옮겨 간다
③ 두 축 모두 그대로이고 목록에서 빠진다
④ 사분면은 한 번 정해지면 바뀌지 않는다②. 달라진 것은 데이터 확보 여건이므로 난이도가 내려갑니다. 사분면이 고정되지 않는다는 점이 미래 과제를 목록에 남겨 두는 이유입니다.ROI 관점에서 4V를 나눌 때 비즈니스 효과에 해당하는 것은?
① Volume
② Variety
③ Velocity
④ Value④. 앞의 3V는 데이터를 모으고 처리하는 데 드는 투자비용이고 Value만 효과 쪽입니다. 그래서 3V는 난이도로, Value는 시급성으로 이어집니다.분석 마스터플랜에서 적용 우선순위를 정할 때 보는 요소가 아닌 것은?
① 전략적 중요도
② 비즈니스 성과와 ROI
③ 실행 용이성
④ 기술 적용 수준④. 기술 적용 수준은 적용 범위와 방식을 정할 때 보는 요소로, 업무 내재화 적용 수준·분석 데이터 적용 수준과 한 묶음입니다.분석 로드맵의 이행 단계를 순서대로 나열한 것은?
① 유효성 검증 → 체계 도입 → 확산 및 고도화
② 체계 도입 → 유효성 검증 → 확산 및 고도화
③ 체계 도입 → 확산 및 고도화 → 유효성 검증
④ 확산 및 고도화 → 체계 도입 → 유효성 검증②. 도입해서 과제를 정의하고, 파일럿으로 효과를 확인한 뒤, 검증된 것을 넓힙니다. 검증 없이 확산으로 건너뛰지 않는 것이 이 순서의 요점입니다.
이 단원에서 가장 값이 나가는 것은 사분면 표 한 장입니다. 시급성과 난이도로 네 칸을 그려 놓고 III이 처음, I이 마지막이라는 것을 못 박은 다음, 기준이 시급성이면 IV가 둘째이고 난이도면 II가 둘째라는 것만 더하면 이 계열 문항은 전부 같은 그림에서 풀립니다. ROI의 4V도 별개가 아니라 그 두 축에 이름을 붙인 것이고, 마스터플랜과 WBS는 그렇게 정한 순서를 문서로 옮기는 절차입니다.

