데이터분석 준전문가 (ADsP) 시험 노트개념 정리20 MIN
빅데이터의 가치와 위기 요인
빅데이터의 가치를 산정하기 어려운 세 이유와 기업·정부·개인에 미친 영향을 정리합니다. 사생활 침해·책임 원칙 훼손·데이터 오용 셋과 그 통제 방안, 그리고 미래를 떠받치는 세 요소까지 붙잡습니다.
앞 노트에서 빅데이터가 무엇이고 무엇으로 다루는지를 봤습니다. 이번에는 그것이 얼마짜리인가, 그리고 잘못 쓰면 무엇이 무너지는가를 다룹니다. 이 범위는 계산도 기법도 없이 목록의 개수와 짝만 묻는 자리라 점수를 가장 싸게 가져갈 수 있습니다. 대신 「세 이유」·「위기 요인 셋」·「통제 방안 셋」처럼 수가 박힌 목록이 몰려 있어, 개수와 이름을 함께 붙잡지 않으면 선택지에서 하나 바꿔치기한 것을 못 잡습니다.
가치 산정의 어려움
빅데이터로 만든 데이터가 얼마짜리인지를 미리 셈하기 어려운 이유가 셋입니다. 셋 다 「지금 시점에는 알 수 없다」는 같은 뿌리에서 나옵니다.
재사용과 재조합
재사용은 같은 데이터를 다른 목적에 다시 쓰는 것이고, 재조합은 서로 다른 데이터를 합쳐 없던 쓸모를 만드는 것입니다. 데이터는 한 번 쓰고 없어지지 않습니다. 같은 값이 다른 목적에 다시 쓰이고, 다른 데이터와 합쳐지면서 처음에 없던 쓸모가 생깁니다. 지도 데이터와 결제 기록이 따로 있을 때와 합쳐졌을 때의 값이 다릅니다. 둘을 합치면 어느 동네에서 무엇이 잘 팔리는지가 보이는데, 그 답은 어느 한쪽 데이터만 들여다봐서는 나오지 않습니다. 처음 모을 때는 그 조합을 알 수 없으므로 값을 매길 수 없습니다. 물건은 팔면 내 손에서 사라지지만 데이터는 넘겨주고도 그대로 남아, 같은 값이 여러 곳에서 동시에 쓸모를 냅니다. 값을 매기는 셈법 자체가 물건과 다른 것입니다.
새로운 가치의 창출
데이터를 모으는 시점에는 그것이 나중에 어디 쓰일지 모릅니다. 검색어 기록은 광고를 위해 쌓였지만 나중에 전염병 확산을 가늠하는 데 쓰였습니다. 처음 쌓을 때 그 쓸모를 예상하고 값을 매긴 사람은 아무도 없었습니다. 쓸 곳이 정해지지 않은 채로 쌓이는 것이 빅데이터의 성질이므로, 값도 뒤늦게 드러납니다. 앞 노트에서 본 사후처리로의 변화가 여기에 그대로 걸립니다 — 무엇에 쓸지 정하고 모으는 것이 아니라 모아 두고 나중에 정하므로, 모으는 시점에는 셈할 근거가 없습니다.
분석 기술의 발전
지금 분석할 수 없는 데이터가 몇 해 뒤에는 분석 가능한 것이 됩니다. 저장해 둔 음성이나 영상이 그렇습니다. 기술이 값을 바꾸므로, 오늘 쓸모없어 보이는 데이터를 버리는 판단이 위험해집니다. 세 이유를 묻는 문항은 대개 「데이터는 시간이 지나면 값이 떨어진다」처럼 방향을 뒤집은 선택지를 하나 섞어 놓습니다.
빅데이터가 바꾼 것
기업
기업은 쌓인 데이터로 혁신의 방향을 찾고, 경쟁 상대가 무엇을 하는지 가늠하며, 생산성을 끌어올리는 자리를 찾아냅니다. 감이 아니라 측정으로 결정을 내리는 쪽으로 옮겨 간 것이 핵심입니다. 고객이 무엇을 보다 그만뒀는지까지 남으니, 팔린 것만 세던 시절에는 물을 수 없던 물음을 물을 수 있게 되었습니다.
정부
정부는 환경 변화를 미리 알아차리고, 사회가 어떻게 변하는지 읽어 정책을 세우며, 국가 안전과 관련된 위험을 탐지하는 데 씁니다. 교통량 기록으로 도로를 새로 놓을 자리를 정하거나 감염병 신고 기록으로 확산을 가늠하는 일이 그 예입니다. 세금 징수와 복지 대상 선정처럼 행정의 정확도를 높이는 쪽으로도 씁니다. 기업이 경쟁에서 앞서려고 쓰는 것과 달리 정부 쪽은 미리 알아차리는 데 무게가 실린다는 차이가 있습니다.
개인
개인에게는 원하는 정보를 값싸게 얻는 길이 열렸습니다. 예전에는 조사 기관이나 언론을 거쳐야 알 수 있던 것을 지금은 공개된 데이터로 직접 확인합니다. 정치인이 유권자의 관심사에 맞춰 메시지를 고르고, 가수가 자기 노래가 어느 지역에서 많이 재생되는지 보고 공연 일정을 잡는 식입니다. 세 주체를 묻는 문항은 「누가 무엇을 얻었는가」의 짝을 어긋나게 해 놓습니다. 기업은 경쟁력, 정부는 미리 알아차리는 힘, 개인은 활용의 문턱이라는 축으로 갈라 두면 선택지에서 하나만 바꿔치기한 것이 눈에 들어옵니다.
위기 요인 셋
사생활 침해
사생활 침해는 가장 널리 알려진 위험입니다. 낱낱이 쌓인 기록으로 개인이 어디에 있었고 무엇을 샀는지가 드러납니다. 문제는 이름과 주민등록번호를 지워도 위치와 결제 기록 몇 개만 겹치면 그 사람이 누구인지 좁혀진다는 데 있습니다. 매일 같은 시각에 같은 곳을 오간 기록은 그 자체로 한 사람을 가리키는 표시가 됩니다. 데이터를 넘겨받은 쪽이 다른 데이터와 합치는 순간 익명이 풀립니다. 앞 절에서 본 재조합이 가치를 만드는 바로 그 성질이, 여기서는 위험을 만듭니다.
책임 원칙 훼손
책임 원칙 훼손은 예측한 결과를 근거로 아직 일어나지 않은 일에 책임을 묻는 위험입니다. 신용 평가 모형이 「이 사람은 연체할 가능성이 높다」고 하자 연체한 적이 없는데도 대출이 막히는 식입니다. 실제 행위가 아니라 성향과 확률로 불이익을 준다는 점에서, 행위에 책임을 묻는다는 원칙이 무너집니다.
데이터 오용
데이터 오용은 데이터에 근거했다는 이유로 잘못된 결론을 그대로 믿는 위험입니다. 과거 데이터로 만든 모형은 과거에 있던 치우침까지 함께 배웁니다. 예전에 특정 집단을 적게 뽑았다면 모형도 그 집단을 낮게 평가하고, 그 결과가 다시 데이터로 쌓여 치우침이 굳습니다. 분석의 전제가 틀렸는데 숫자가 붙어 나오면 오히려 더 믿게 된다는 점에서, 셋 가운데 가장 늦게 드러나는 위험입니다.
통제 방안 셋
위기 요인 셋에 통제 방안이 하나씩 붙습니다. 따로 외우면 셋과 셋이 여섯 개의 낱말로 흩어지지만, 짝으로 붙여 두면 하나만 떠올라도 나머지가 따라옵니다. 문항도 대개 이 짝을 어긋나게 해 놓고 고르게 하는 형태로 나옵니다.
| 위기 요인 | 통제 방안 |
|---|---|
| 사생활 침해 | 동의제에서 책임제로 |
| 책임 원칙 훼손 | 결과 기반 책임 원칙 고수 |
| 데이터 오용 | 알고리즘 접근권과 알고리즈미스트 |
동의제에서 책임제로
지금까지는 데이터를 넘길 때 정보 주체가 동의하면 쓰는 쪽이 면책되었습니다. 그런데 넘어간 데이터가 어디서 어떻게 합쳐질지는 동의하는 시점에 아무도 모릅니다. 그래서 동의를 받았는가가 아니라 쓰는 쪽이 결과에 책임을 지는가로 축을 옮기자는 것이 책임제입니다. 동의를 없애자는 말이 아니라, 동의만으로 책임이 끝나지 않게 하자는 말입니다.
결과 기반 책임 원칙
예측만으로 불이익을 주지 말고 실제로 일어난 행위에만 책임을 묻자는 원칙입니다. 앞의 책임 원칙 훼손에 그대로 대응합니다. 모형이 어떤 사람을 위험군으로 분류했다는 사실 자체는 막지 않되, 그 분류만으로 대출을 거절하거나 채용에서 떨어뜨리는 것은 막자는 선입니다. 예측을 쓰지 말자는 말이 아니라 예측을 처벌의 근거로 삼지 말자는 말이라는 점이 자주 물어지는 자리입니다. 이름이 비슷해 앞 항목과 섞이기 쉬운데, 책임제는 데이터를 쓰는 쪽의 책임을 무겁게 하는 것이고, 결과 기반 책임 원칙은 데이터에 찍힌 쪽을 예측만으로 처벌하지 않는 것입니다.
알고리즘 접근권과 알고리즈미스트
불이익을 받은 사람이 「왜 그런 결과가 나왔는지」를 따져 물을 수 있어야 한다는 것이 알고리즘 접근권입니다. 그런데 모형의 안쪽은 전문가가 아니면 읽을 수 없으므로, 그 일을 대신 해 주는 사람이 필요합니다. 알고리즘이 부당하게 쓰이지 않았는지 살피고 피해자를 대신해 따지는 전문가를 알고리즈미스트라 부릅니다. 하는 일은 모형을 더 정확하게 만드는 것이 아니라 그 모형이 남에게 부당한 결과를 주지 않았는지 보는 것이라, 분석가와 방향이 다릅니다. 이 차이를 뒤집어 놓은 선택지가 그대로 오답이 됩니다.
미래의 빅데이터
미래를 떠받치는 요소가 셋입니다. 데이터, 기술, 인력의 순서로 보면 외우기 쉽고, 앞에서 본 것들이 그대로 하나씩 이어집니다 — 데이터는 재사용과 재조합의 밑감이고, 기술은 가치를 바꾸는 축이며, 인력은 통제 방안이 기대는 자리입니다.
모든 것의 데이터화
예전에는 데이터가 아니던 것이 데이터가 됩니다. 걸음 수, 심박수, 잠든 시각, 문을 여닫은 횟수가 그렇습니다. 사람이 적어 넣는 것이 아니라 기기가 저절로 남긴다는 점이 예전의 기록과 다릅니다. 앞 절의 재사용·재조합이 가능해지는 밑바탕이 바로 이것입니다.
진화하는 알고리즘
쌓인 데이터를 다루는 기술 쪽입니다. 같은 데이터라도 알고리즘이 나아지면 꺼낼 수 있는 것이 달라지므로, 가치 산정이 어려운 세 번째 이유와 이어집니다. 다만 알고리즘이 나아질수록 그 안쪽을 사람이 읽기는 어려워지고, 그래서 앞 절의 알고리즘 접근권이 함께 필요해집니다.
데이터를 다루는 사람
데이터와 기술이 있어도 그것을 읽고 판단하는 사람이 없으면 결과가 나오지 않습니다. 이 자리를 맡는 것이 데이터 사이언티스트이고, 앞에서 본 알고리즈미스트도 여기에 함께 놓입니다. 데이터와 기술은 돈을 들이면 갖출 수 있지만 사람은 그렇지 않아, 셋 중 가장 늦게 채워지는 자리로 꼽힙니다. 세 요소를 묻는 문항에서 인력 대신 「대용량 저장 장치」처럼 장비가 들어가 있으면 그 자리가 오답입니다.
연습 문제
빅데이터의 가치를 산정하기 어려운 이유로 보기 어려운 것은?
① 같은 데이터가 다른 목적에 다시 쓰인다
② 데이터를 모으는 시점에는 쓸 곳이 정해져 있지 않다
③ 분석 기술이 나아지면 지금 못 쓰는 데이터도 쓸 수 있게 된다
④ 데이터는 시간이 지나면 반드시 값이 떨어진다④. 오히려 반대입니다. 기술이 나아지면 묵혀 둔 데이터의 값이 올라갈 수 있다는 것이 세 번째 이유입니다. 나머지 셋이 재사용·재조합, 새로운 가치의 창출, 분석 기술의 발전입니다.다음 사례에 해당하는 위기 요인은?
「연체한 적이 없는 사람이 연체 가능성이 높다는 모형의 판정만으로 대출을 거절당했다」
① 사생활 침해
② 책임 원칙 훼손
③ 데이터 오용
④ 데이터 독점②. 실제 행위가 아니라 예측된 성향으로 불이익을 주었으므로 책임 원칙이 무너진 자리입니다. ④는 세 위기 요인에 없는 이름입니다.위기 요인과 통제 방안의 짝으로 옳은 것은?
① 사생활 침해 — 알고리즘 접근권
② 책임 원칙 훼손 — 동의제에서 책임제로
③ 데이터 오용 — 알고리즈미스트의 활용
④ 사생활 침해 — 결과 기반 책임 원칙③. 사생활 침해에는 동의제에서 책임제로, 책임 원칙 훼손에는 결과 기반 책임 원칙, 데이터 오용에는 알고리즘 접근권과 알고리즈미스트가 짝입니다.알고리즈미스트에 대한 설명으로 옳은 것은?
① 데이터를 수집하고 저장하는 인프라를 운영하는 사람
② 알고리즘이 부당하게 쓰이지 않았는지 살피고 피해자를 대신해 따지는 전문가
③ 모형의 정확도를 높이는 일만 전담하는 분석가
④ 개인정보 동의서를 작성하는 법률 담당자②. 데이터 오용에 대한 통제 방안으로 함께 나옵니다. ③은 데이터 사이언티스트의 일부 역할이고, ①과 ④는 알고리즈미스트의 정의와 무관합니다.「동의제에서 책임제로」의 뜻으로 가장 알맞은 것은?
① 정보 주체의 동의 절차를 없앤다
② 동의를 받았더라도 데이터를 쓰는 쪽이 결과에 책임을 진다
③ 데이터를 넘긴 사람이 그 결과에 책임을 진다
④ 동의서를 더 길고 자세하게 쓴다②. 동의를 없애자는 말이 아니라 동의만으로 면책되지 않게 하자는 말입니다. ③은 책임의 주체가 뒤바뀌었습니다.미래의 빅데이터를 떠받치는 세 요소에 해당하지 않는 것은?
① 모든 것의 데이터화
② 진화하는 알고리즘
③ 데이터를 다루는 인력
④ 대용량 저장 장치의 보급④. 세 요소는 데이터·기술·인력입니다. 저장 장치는 빅데이터가 나오게 된 배경에서 다루는 것이고 미래의 세 요소 목록에는 들어가지 않습니다.

