빅데이터분석기사 시험 노트개념 정리18 MIN
빅데이터 가치 산정과 위기 요인
데이터의 값을 미리 매기기 어려운 이유 셋과 가치가 만들어지는 다섯 갈래를 정리하고, 사생활 침해·책임 원칙 훼손·데이터 오용이라는 위기 요인과 그 통제 방안을 짝으로 묶습니다.
앞 노트에서 빅데이터의 5V 중 마지막이 Value였습니다. 그런데 이 Value는 다른 넷과 성격이 다릅니다 — 규모·다양성·속도·신뢰성은 데이터를 보면 잴 수 있지만, 가치는 쓰기 전에는 얼마인지 알 수 없습니다. 1과목이 이 자리에 한 절을 따로 두는 이유이고, 문항도 「빅데이터의 가치 산정이 어려운 이유가 아닌 것은」처럼 부정형으로 나옵니다. 이 노트는 값을 못 매기는 이유 셋, 값이 만들어지는 방식 다섯, 그리고 그 대가로 생기는 위기 요인 셋을 차례로 정리합니다.
값을 미리 매기기 어려운 이유 셋
데이터의 가치를 산정하기 어려운 까닭은 셋으로 정리됩니다.
| 이유 | 무슨 뜻인가 |
|---|---|
| 데이터 활용 방식의 다양화 | 한 번 쓰고 사라지지 않고 재사용·재조합·다목적 개발이 일상이라, 누가 어디에 몇 번 쓸지 세어 둘 수가 없다 |
| 새로운 가치 창출 | 처음 모을 때 생각하지 못한 목적에 쓰여 값이 생긴다 |
| 분석 기술의 발전 | 지금은 못 다루는 데이터가 기술이 좋아지면 값을 갖는다. 비용이 내려가면 버려 두던 것이 자산이 된다 |
셋이 서로 다른 시점을 가리킵니다. 첫째는 쓰임의 수를, 둘째는 쓰임의 종류를, 셋째는 시간을 못 세는 것입니다.
두 번째 이유가 가장 자주 오해받습니다. 「새로운 가치 창출」은 데이터가 좋아서 값이 커진다는 말이 아니라, 당초 수집 목적과 무관한 곳에서 값이 나오는 일이 흔해 산정 시점에 그 값을 계산에 넣을 수 없다는 말입니다. 검색어 기록은 광고를 위해 쌓였지만 독감 유행 예측에 쓰였고, 그 값은 쌓을 당시의 장부 어디에도 없었습니다.
재조합으로 값이 생기는 모습은 코드 한 조각이면 눈에 들어옵니다. 따로 있을 때는 아무 뜻도 없던 두 표가 붙는 순간 새 사실이 나옵니다.
weather = {"2026-09-01": 31.4, "2026-09-02": 24.1} # 기상 데이터
sales = {"2026-09-01": 820, "2026-09-02": 310} # 아이스크림 매출
joined = [(d, weather[d], sales[d]) for d in weather]
print(joined) # [('2026-09-01', 31.4, 820), ('2026-09-02', 24.1, 310)]
기상청이 기온을 쌓을 때 아이스크림 매출은 안중에 없었습니다. 값은 데이터에 붙어 있던 것이 아니라 붙이는 순간 생긴 것입니다.
첫째 이유에 딸린 세 낱말은 따로 갈라 둘 만합니다. 재사용은 같은 데이터를 원래 목적에 또 쓰는 것, 재조합은 다른 데이터와 붙여 새 사실을 얻는 것, 다목적 개발은 처음부터 여러 쓰임을 염두에 두고 모으는 것입니다. 앞의 둘은 이미 있는 데이터를 나중에 어떻게 쓰느냐의 문제이고, 셋째만 수집 설계 단계의 이야기입니다. 물건과 달리 데이터는 한 사람이 써도 닳지 않고 그대로 남아 다음 사람이 또 쓸 수 있는데, 회계 장부는 그 특성을 셀 칸을 갖고 있지 않습니다.
가치가 만들어지는 다섯 갈래
빅데이터가 실제로 값을 만드는 방식은 흔히 다섯으로 나눕니다.
| 방식 | 하는 일 | 예 |
|---|---|---|
| 투명성 제고 | 흩어져 있던 정보를 모아 필요한 사람이 제때 보게 한다 | 부서별로 갇힌 데이터를 통합해 공정 지연 지점을 드러낸다 |
| 시뮬레이션 | 조건을 바꿔 가며 돌려 보고 성과를 높인다 | 가격을 여러 안으로 놓고 수요 변화를 미리 본다 |
| 고객 세분화 | 집단을 잘게 갈라 맞춤 서비스를 준다 | 구매 이력으로 묶어 다른 추천을 내보낸다 |
| 의사결정 지원과 대체 | 사람의 판단을 돕거나 알고리즘이 대신 정한다 | 신용 평가, 재고 자동 발주 |
| 신규 비즈니스 창출 | 데이터 자체로 새 상품·서비스·모델을 만든다 | 주행 데이터를 팔아 보험료를 매기는 사업 |
다섯을 한 줄로 꿰면 순서가 보입니다. 먼저 보이게 하고(투명성), 보이니 돌려 보고(시뮬레이션), 돌려 보니 대상을 잘게 가르고(세분화), 갈랐으니 판단을 맡기고(의사결정 지원과 대체), 그렇게 쌓인 것으로 없던 사업을 엽니다(신규 비즈니스). 앞의 넷은 하던 일을 더 잘하는 쪽이고 마지막 하나만 하는 일 자체가 바뀌는 쪽입니다.
시험은 사례를 주고 어느 갈래인지 고르게 합니다. 헷갈리는 짝이 둘 있습니다. 투명성과 의사결정 지원은 「보이게만 하고 판단은 사람이 하는가」로 갈리고, 고객 세분화와 신규 비즈니스는 「기존 사업의 효율을 올리는가, 없던 사업을 여는가」로 갈립니다. 추천을 잘해서 매출이 오르면 세분화이고, 그 추천 엔진을 다른 회사에 팔면 신규 비즈니스입니다.
위기 요인 셋과 통제 방안 셋
값이 생기는 방식 그대로가 위험의 통로이기도 합니다. 위기 요인은 셋이고, 각각에 짝이 되는 통제 방안이 있습니다. 짝으로 외워야 문항이 풀립니다 — 요인만 묻는 문항보다 「다음 위기 요인의 통제 방안으로 옳은 것은」이 더 자주 나옵니다.
| 위기 요인 | 무슨 일이 벌어지나 | 통제 방안 |
|---|---|---|
| 사생활 침해 | 익명이라 믿었던 데이터가 다른 데이터와 붙어 개인을 다시 짚어 낸다 | 동의제에서 책임제로 — 쓰는 쪽이 책임을 진다 |
| 책임 원칙 훼손 | 예측 결과만으로 아직 하지 않은 일을 근거 삼아 불이익을 준다 | 결과 기반 책임 원칙을 지킨다 |
| 데이터 오용 | 잘못된 데이터나 잘못된 알고리즘으로 틀린 판단이 내려진다 | 알고리즘 접근권을 보장한다 |
첫 줄의 사생활 침해가 앞 절과 곧바로 이어집니다. 이름과 주민등록번호를 지웠으니 안전하다고 여긴 데이터라도, 생년월일·성별·우편번호처럼 남겨 둔 칸이 다른 데이터의 같은 칸과 붙으면 사람 하나가 다시 짚입니다. 값을 만든 재조합이 그대로 위험의 통로인 셈이고, 그래서 뒤에 나올 비식별 조치는 「지웠는가」가 아니라 「붙였을 때도 안 짚이는가」를 봅니다.
개인정보를 모을 때마다 동의를 받는 방식은 빅데이터에서 잘 작동하지 않습니다 — 쓰임이 사후에 정해지니 「무엇에 쓰는지」를 동의 시점에 적을 수가 없고, 정보주체는 읽지 않고 누릅니다. 그래서 동의제에서 책임제로, 즉 수집 시점의 동의보다 사용하는 쪽이 유출과 피해에 책임을 지도록 무게를 옮기자는 것이 통제 방안입니다.
둘째 줄이 가장 헷갈립니다. 책임 원칙 훼손은 예측 알고리즘이 「이 사람은 범죄를 저지를 가능성이 높다」·「이 지원자는 이직할 가능성이 높다」고 내놓은 값만으로 아직 벌어지지 않은 일에 대해 불이익을 주는 것입니다. 통제 방안인 결과 기반 책임 원칙은 그 반대편 — 실제로 한 행동의 결과에만 책임을 묻는다는 원칙을 지키자는 것입니다.
데이터 오용은 셋째 줄입니다. 데이터가 틀렸거나, 데이터는 맞는데 그것으로 답할 수 없는 물음에 답하게 시켰을 때 벌어집니다. 과거 채용 기록으로 학습한 모델이 과거의 편향을 그대로 재생산하는 일이 여기에 듭니다 — 알고리즘이 고장 난 것이 아니라 시킨 대로 한 것인데, 결과는 부당합니다.
셋째 줄의 알고리즘 접근권은 알고리즘 때문에 피해를 입었다고 보는 사람이 그 알고리즘이 무엇을 근거로 그렇게 판단했는지 따져 볼 수 있어야 한다는 것입니다. 이 일을 전문으로 하는 사람이 알고리즈미스트(algorithmist)입니다 — 데이터 사이언티스트가 알고리즘을 만드는 쪽이라면, 알고리즈미스트는 그 알고리즘이 부당한 피해를 냈는지 살피고 근거를 검증하는 쪽입니다. 이 이름이 「데이터 사이언티스트의 다른 말」로 보기에 섞여 나오므로 하는 일로 갈라 두어야 합니다.
빅데이터 활용의 3요소
마지막으로 짧은 하나입니다. 빅데이터를 활용하려면 셋이 함께 있어야 합니다 — 데이터(자원), 기술(분산 처리와 분석 기법), 인력(데이터 사이언티스트)입니다. 앞의 두 노트를 통틀어 자원과 기술과 사람을 각각 다루는 셈이고, 셋 중 하나만 빠져도 나머지가 값을 못 냅니다. 데이터와 하둡 클러스터가 있어도 물음을 세울 사람이 없으면 저장 비용만 나갑니다.
연습 문제
빅데이터의 가치 산정이 어려운 이유로 옳지 않은 것은?
① 데이터의 재사용·재조합이 일상이라 쓰임의 수를 셀 수 없다
② 수집 당시 생각하지 못한 목적에서 가치가 나온다
③ 분석 기술이 발전하면 지금 못 쓰는 데이터도 값을 갖게 된다
④ 데이터의 저장 용량을 측정할 표준 단위가 없다④. 용량은 바이트로 정확히 잽니다. 산정을 어렵게 하는 것은 쓰임의 수(활용 방식의 다양화)·쓰임의 종류(새로운 가치 창출)·시간(분석 기술의 발전) 셋입니다.어느 지자체가 부서마다 흩어져 있던 인허가 처리 기록을 한곳에 모아 민원인이 자기 신청의 현재 단계를 볼 수 있게 했습니다. 어느 가치 창출 방식입니까?
① 투명성 제고
② 시뮬레이션
③ 고객 세분화
④ 신규 비즈니스 창출①. 흩어진 정보를 모아 필요한 사람에게 보이게 한 것이고, 판단은 여전히 사람이 합니다. 알고리즘이 처리 순서를 정했다면 의사결정 지원 쪽이었을 자리입니다.「동의제에서 책임제로」라는 통제 방안이 겨냥하는 위기 요인은?
① 사생활 침해
② 책임 원칙 훼손
③ 데이터 오용
④ 데이터 품질 저하①. 수집 시점의 동의만으로는 사후에 정해지는 쓰임을 감당할 수 없으므로, 쓰는 쪽이 책임을 지도록 무게를 옮기자는 것입니다.어느 회사가 재직자의 근태·메신저 사용량으로 이직 가능성 점수를 매기고, 점수가 높은 직원을 승진 대상에서 미리 제외했습니다. 여기서 훼손된 원칙과 그 통제 방안으로 옳게 짝지어진 것은?
① 사생활 침해 — 알고리즘 접근권
② 책임 원칙 훼손 — 결과 기반 책임 원칙
③ 데이터 오용 — 동의제에서 책임제로
④ 책임 원칙 훼손 — 알고리즘 접근권②. 아직 하지 않은 일(이직)에 대한 예측만으로 불이익을 준 것이므로 책임 원칙 훼손이고, 짝이 되는 방안은 실제 한 행동의 결과에만 책임을 묻는 결과 기반 책임 원칙입니다.알고리즈미스트에 대한 설명으로 옳은 것은?
① 데이터 사이언티스트를 가리키는 다른 이름이다
② 알고리즘의 부당한 피해를 살피고 근거를 검증하는 역할이다
③ 분산 클러스터의 자원을 배분하는 소프트웨어다
④ 개인정보를 가명 처리하는 자동화 도구다②. 만드는 쪽이 데이터 사이언티스트라면 알고리즈미스트는 따져 보는 쪽이고, 알고리즘 접근권을 실제로 행사하게 해 주는 자리입니다.빅데이터 활용을 위한 3요소로 옳은 것은?
① 데이터, 기술, 인력
② 데이터, 자본, 규제
③ 저장, 처리, 시각화
④ 정형, 반정형, 비정형①. 자원·기술·사람 셋입니다. ③은 처리 단계, ④는 데이터의 구조에 따른 분류입니다.다음 중 「신규 비즈니스 창출」에 가장 가까운 것은?
① 구매 이력으로 고객을 여덟 집단으로 나눠 다른 쿠폰을 보낸다
② 공장 센서 데이터를 모아 설비 고장을 미리 알리는 서비스를 만들어 다른 제조사에 판다
③ 가격을 세 안으로 놓고 수요 변화를 미리 돌려 본다
④ 부서별로 갇혀 있던 재고 현황을 통합해 보이게 한다②. 없던 사업을 연 것이므로 신규 비즈니스입니다. ①은 고객 세분화, ③은 시뮬레이션, ④는 투명성 제고로 모두 기존 사업의 효율을 올리는 쪽입니다.
가치와 위기는 결국 한 몸입니다. 데이터를 재조합할 수 있어 값이 생기고, 같은 이유로 익명이라 믿었던 것이 개인을 다시 짚어 냅니다. 문항이 사례로 나올 때 「무엇이 붙어서 이 일이 가능해졌는가」를 먼저 찾으면 가치 다섯과 위기 셋 어느 쪽을 묻든 후보가 좁아집니다.

