데이터분석 전문가(ADP) 시험 노트개념 정리19 MIN
빅데이터의 가치와 데이터 사이언스
ADP 1과목의 두 번째 자리입니다. 3V와 출현 배경, 가치 산정이 어려운 세 이유, 사후처리로의 전환, 비즈니스 모델과 위기 요인 셋, 데이터 사이언티스트의 역량과 전략 인사이트를 정리합니다.
앞 노트가 데이터라는 낱말과 그것을 담는 그릇을 다뤘다면, 이 노트는 그 그릇이 감당하지 못할 만큼 데이터가 불어났을 때 무엇이 달라지는가를 다룹니다. ADP 1과목 열 문항 중 나머지 절반이 여기서 나오고, 특히 위기 요인과 통제 방안은 짝을 어긋나게 놓는 형태로 거의 매번 출제됩니다.
데이터가 불어난 자리
빅데이터는 기존의 데이터베이스 관리 도구로는 수집·저장·관리·분석하기 어려운 규모의 데이터를 말합니다. 이 정의가 「몇 테라바이트 이상」처럼 절대적인 선을 긋지 않는다는 점이 중요합니다 — 기준이 도구의 능력이라 시대에 따라 움직입니다.
이런 데이터가 갑자기 쌓인 데는 세 갈래의 배경이 있습니다. 산업계에서는 고객 데이터를 오래 축적해 온 결과 데이터가 자산이 되었고, 학계에서는 게놈 프로젝트나 기상 관측처럼 거대 데이터를 다루는 연구가 늘면서 분석 방법이 함께 자랐습니다. 그리고 기술 쪽에서 저장 비용이 떨어지고 클라우드와 분산 처리가 자리 잡으면서, 버리던 데이터를 남겨 둘 수 있게 됐습니다. 여기에 소셜 미디어와 사물인터넷이 데이터를 만들어 내는 속도를 한 번 더 올렸습니다.
빅데이터를 정의하는 시선도 셋으로 갈립니다. 데이터 자체의 규모로 보는 협의의 정의, 그것을 다루는 기술과 아키텍처까지 포함하는 정의, 그리고 데이터를 다루는 인재와 조직의 변화까지 넣는 광의의 정의입니다. 「빅데이터는 인재와 조직의 문제이기도 하다」는 문장은 세 번째 시선에서 나온 것입니다.
세 개의 V, 그리고 덧붙은 것들
빅데이터의 성질은 흔히 세 낱말로 요약합니다.
| 축 | 무엇이 커졌나 | 예 |
|---|---|---|
| 규모(Volume) | 데이터의 양 | 테라바이트를 넘어 페타바이트 단위로 쌓이는 로그 |
| 다양성(Variety) | 데이터의 형태 | 정형 표에 더해 텍스트·이미지·센서 신호 |
| 속도(Velocity) | 생성과 처리의 빠르기 | 실시간으로 들어오는 스트리밍 데이터 |
여기에 뒤늦게 붙은 축이 둘 있습니다. 분석해서 얻는 가치를 뜻하는 가치(Value), 데이터의 신뢰성과 품질을 뜻하는 신뢰성(Veracity)입니다. 셋에 하나를 더하면 4V, 둘을 더하면 5V라고 부릅니다. 시험에서는 「3V에 해당하지 않는 것」을 고르게 하는데, 답은 대개 Value나 Veracity 쪽에 있습니다.
처리 방식이 뒤집힌 네 자리
데이터가 흔해지면서 분석의 상식 네 가지가 반대로 뒤집혔습니다. 이 네 쌍은 표로 외워 두는 편이 빠릅니다.
| 전에는 | 지금은 | 왜 바뀌었나 |
|---|---|---|
| 사전처리 | 사후처리 | 쓸 데이터를 미리 정해 걸러 담던 것을, 일단 모아 두고 필요할 때 골라 쓴다 |
| 표본조사 | 전수조사 | 비용 때문에 일부만 뽑던 것을, 전체를 다 다룰 수 있게 됐다 |
| 질(Quality) | 양(Quantity) | 데이터 하나하나의 정확도보다 규모가 주는 효과가 커졌다 |
| 인과관계 | 상관관계 | 왜 그런지 밝히기 전에 무엇과 무엇이 함께 움직이는지로 먼저 움직인다 |
네 번째 줄을 「인과관계는 이제 필요 없다」로 읽으면 안 됩니다. 상관관계만으로 충분한 자리(무엇을 추천할지 고르는 일)와 인과를 밝혀야 하는 자리(가격을 내리면 매출이 오르는지 판단하는 일)가 다르고, ADP 서술형은 그 경계를 묻는 쪽에 가깝습니다.
값을 매기기 어려운 이유
빅데이터의 가치를 돈으로 환산하기 어렵다는 말에는 세 가지 근거가 있습니다.
- 데이터의 재사용과 재조합 — 한 번 쓰고 사라지지 않고 다른 목적으로 다시 쓰이며, 다른 데이터와 합쳐질 때 새 가치가 생깁니다. 지금 값을 매겨도 그 값이 전부가 아닙니다.
- 새로운 가치 창출 — 데이터를 모을 당시에 예상하지 못한 용도가 나중에 생깁니다. 검색어 기록이 독감 유행 예측에 쓰인 것이 그런 경우입니다.
- 분석 기술의 발달 — 지금은 분석하지 못해 값이 없던 데이터가, 기술이 자라면 값을 갖게 됩니다. 비정형 데이터가 대표적입니다.
무엇으로 돈을 버는가
빅데이터를 실제로 굴리려면 세 가지가 함께 있어야 합니다. 데이터, 그것을 다루는 기술, 그리고 무엇을 물어야 할지 아는 인력입니다. 사업 모델은 이 셋 중 무엇을 쥐고 있느냐에 따라 갈립니다 — 데이터를 가진 쪽은 데이터 자체나 접근 권한을 팔고, 기술을 가진 쪽은 분석 플랫폼과 도구를 팔며, 인력을 가진 쪽은 분석 서비스와 컨설팅을 팝니다. 셋을 다 갖춘 회사는 드물기 때문에 서로 짝을 짓는 구조가 됩니다.
여기서 하나 갈라 둘 것이 있습니다. 데이터를 파는 일과 데이터로 파는 일은 다릅니다. 앞쪽은 보유한 데이터나 그 접근 권한 자체를 상품으로 내놓는 것이고, 뒤쪽은 데이터를 자기 서비스의 품질을 올리는 데 써서 원래 팔던 것을 더 잘 파는 것입니다. 추천이 정확해져 구매가 늘어나는 쇼핑몰이 뒤쪽입니다. 시험에서 사업 모델을 물을 때는 「무엇을 대가로 돈을 받는가」를 따라가면 갈립니다.
분석에 쓰는 기본 테크닉은 일곱 가지로 묶어 외웁니다.
| 테크닉 | 답하는 질문 |
|---|---|
| 연관규칙 분석 | 함께 일어나는 것은 무엇인가 |
| 유형 분석 | 이것은 어느 무리에 속하는가 |
| 유전 알고리즘 | 주어진 조건에서 최적의 답은 무엇인가 |
| 기계학습 | 과거를 보고 다음에 무엇이 올지 예측할 수 있는가 |
| 회귀분석 | 두 변수 사이에 어떤 관계가 있는가 |
| 감정분석 | 이 글을 쓴 사람은 어떻게 느끼는가 |
| 소셜네트워크 분석 | 이 사람은 누구와 얼마나 이어져 있는가 |
위기 요인 셋과 그 통제
빅데이터가 만들어 내는 위험은 셋으로 정리되고, 각각에 짝이 되는 통제 방안이 따로 붙습니다. 이 짝을 어긋나게 놓는 것이 이 절의 단골 문제입니다.
| 위기 요인 | 무엇이 문제인가 | 통제 방안 |
|---|---|---|
| 사생활 침해 | 익명화한 데이터도 다른 데이터와 합치면 개인이 드러난다 | 동의제에서 책임제로 — 쓰는 쪽이 결과에 책임진다 |
| 책임 원칙 훼손 | 아직 하지 않은 일을 예측만으로 처벌하게 된다 | 결과 기반 책임 원칙을 지킨다 |
| 데이터 오용 | 잘못된 데이터와 알고리즘이 잘못된 판단을 낳는다 | 알고리즘에 대한 접근권을 열고 알고리즈미스트를 둔다 |
첫 줄의 「동의제에서 책임제로」는 뜻을 오해하기 쉽습니다. 개인에게 일일이 동의를 받는 방식이 데이터의 2차·3차 활용 앞에서 무력해졌으니, 동의 여부 대신 데이터를 사용하는 자가 그 결과에 책임을 지도록 규율의 무게중심을 옮기자는 이야기입니다. 동의를 안 받아도 된다는 뜻이 아닙니다.
데이터 사이언티스트가 갖추는 것
데이터 사이언스는 데이터에서 의미를 끌어내 의사결정으로 잇는 학문이고, 세 영역이 겹치는 자리에 섭니다.
| 영역 | 무엇을 하나 |
|---|---|
| 분석(Analytics) | 수학·통계·모델링으로 데이터에서 패턴을 찾는다 |
| IT·데이터 관리 | 데이터를 모으고 저장하고 처리할 수 있게 만든다 |
| 비즈니스 분석 | 그 결과를 업무의 언어로 바꾸고 결정으로 잇는다 |
여기에 필요한 역량도 두 갈래로 나뉩니다. 이론과 도구를 다루는 힘인 하드 스킬 — 빅데이터 이론, 분석 기법, 프로그래밍 — 과, 결과를 설득으로 잇는 힘인 소프트 스킬 — 통찰력 있는 분석, 설득력 있는 전달, 다분야 협업 — 입니다. 시험에서 소프트 스킬로 묶이는 셋을 정확히 물으므로, 「스토리텔링·시각화·커뮤니케이션은 소프트 스킬」이라고 붙여 두면 됩니다.
일차원적 분석을 넘어서
산업마다 늘 하던 분석이 있습니다. 금융의 신용점수, 유통의 재고 회전율, 제조의 불량률 같은 것입니다. 이런 분석은 자기 부서 안에서만 쓰이고 이미 모두가 하고 있어 차이를 만들지 못합니다. 이것을 일차원적 분석이라 부릅니다.
경쟁 우위로 이어지는 분석은 세 조건을 채웁니다. 부서가 아니라 전사 차원의 목표에 걸려 있고, 과거를 설명하는 데 그치지 않고 앞으로 무엇을 할지를 정하며, 경영진이 그 결과로 실제 의사결정을 바꿉니다. 이렇게 얻은 것이 전략 인사이트입니다. 그래서 좋은 분석의 출발점은 기법이 아니라 질문입니다 — 「무엇을 분석할 수 있는가」가 아니라 「무엇을 알면 결정이 달라지는가」에서 시작합니다.
이 절은 서술형에서 「일차원적 분석과 전략적 분석의 차이를 설명하고 사례를 들어 논하라」는 꼴로 나옵니다. 정의를 옮겨 적는 데서 멈추면 배점의 절반을 못 채우므로, 산업 하나를 골라 두 분석이 각각 어떤 결정으로 이어지는지까지 준비해 두는 편이 좋습니다.
연습 문제
빅데이터의 3V에 해당하지 않는 것은?
① 규모(Volume)
② 다양성(Variety)
③ 신뢰성(Veracity)
④ 속도(Velocity)③. 신뢰성은 나중에 덧붙은 축입니다. 가치(Value)와 함께 4V·5V를 이룹니다.빅데이터 시대에 달라진 처리 방식의 짝으로 옳은 것은?
① 사후처리 → 사전처리
② 전수조사 → 표본조사
③ 질 → 양
④ 상관관계 → 인과관계③. 나머지 셋은 화살표가 거꾸로입니다. 미리 걸러 담던 것을 일단 모아 두는 쪽으로, 일부만 뽑던 것을 전체를 다루는 쪽으로, 왜 그런지를 밝히는 것에서 무엇이 함께 움직이는지를 보는 쪽으로 옮겨 갔습니다.빅데이터의 가치를 산정하기 어려운 이유로 보기 어려운 것은?
① 데이터가 다른 목적으로 다시 쓰이고 다른 데이터와 재조합된다
② 수집할 당시에 예상하지 못한 용도가 나중에 생긴다
③ 분석 기술이 발달하면서 값이 없던 데이터가 값을 갖는다
④ 저장 비용이 계속 떨어져 데이터를 오래 보관할 수 있다④. 저장 비용 하락은 빅데이터가 나온 배경이지 가치 산정을 어렵게 하는 이유가 아닙니다. 오히려 값을 매기는 것과 무관하게 보관을 쉽게 만든 쪽입니다.위기 요인과 통제 방안의 짝으로 옳지 않은 것은?
① 사생활 침해 — 동의제에서 책임제로
② 책임 원칙 훼손 — 결과 기반 책임 원칙 고수
③ 데이터 오용 — 알고리즘 접근권 허용
④ 사생활 침해 — 예측 결과만으로 처벌하지 않기④. 예측만으로 불이익을 주지 않는 것은 책임 원칙 훼손에 대한 통제입니다.데이터 사이언티스트의 역량을 하드 스킬과 소프트 스킬로 나눌 때, 소프트 스킬로만 묶인 것은?
① 분석 기법 숙련, 프로그래밍
② 통찰력 있는 분석, 설득력 있는 전달, 다분야 협업
③ 빅데이터 이론, 시각화 도구 사용
④ 모델 최적화, 분산 처리 이해②. 나머지는 이론과 도구를 다루는 힘이라 하드 스킬입니다.서술형 연습입니다. 어떤 유통 기업이 「지난달 재고 회전율」을 매달 보고받고 있습니다. 이 분석이 왜 일차원적 분석에 머무는지 밝히고, 같은 데이터로 전략 인사이트를 얻으려면 질문을 어떻게 바꿔야 하는지 5줄 이내로 쓰시오.
채점 기준은 셋입니다. (1) 일차원적 분석의 성격을 짚었는가 — 부서 안에서 과거를 설명하는 데 그치고, 경쟁사도 모두 같은 지표를 보고 있어 차이를 만들지 못한다는 점입니다. (2) 전략 인사이트의 조건을 적용했는가 — 전사 목표에 걸리고, 앞으로의 행동을 정하며, 그 결과로 의사결정이 실제로 바뀌어야 한다는 셋입니다. (3) 바꾼 질문을 구체적으로 썼는가 — 예를 들어 「회전율이 얼마였나」 대신 「어떤 상품군을 어느 점포에 얼마나 배치하면 다음 분기 재고 비용이 얼마나 줄어드나」처럼, 답이 곧 실행으로 이어지는 형태여야 합니다. 지표 이름만 바꿔 적고 실행으로 잇지 않으면 세 번째 항목의 배점이 붙지 않습니다.
이 노트의 표 넷 — 3V, 뒤집힌 네 자리, 위기 요인과 통제, 하드·소프트 스킬 — 이 그대로 객관식 네댓 문항의 재료입니다. 한쪽 열을 가리고 반대편을 불러 보는 식으로 훑으면 됩니다.

