데이터분석 전문가(ADP) 시험 노트개념 정리19 MIN
미래의 빅데이터와 가치 패러다임
ADP 1과목의 마지막 자리입니다. 미래를 데이터·기술·인재 셋으로 나눠 보고, 모든 것의 데이터화와 진화하는 알고리즘, 알고리즈미스트, 디지털화에서 에이전시까지의 가치 패러다임을 정리합니다.
앞의 두 노트가 「빅데이터가 무엇인가」와 「지금 무엇을 바꾸고 있는가」였다면, 이 노트는 「앞으로 무엇이 될 것인가」를 다룹니다. 1과목에서 가장 추상적인 자리이고 그래서 오히려 출제 형태가 뻔합니다 — 셋으로 나눈 목록의 짝을 어긋나게 놓거나, 세 시대를 뒤섞어 순서를 묻습니다. 목록의 구조를 붙들면 그대로 답이 나옵니다.
미래를 셋으로 나눠 보기
빅데이터의 미래를 이야기할 때는 데이터·기술·인재 셋으로 나눠 봅니다. 각각에 붙는 열쇳말이 정해져 있습니다.
| 축 | 무엇이 달라지나 | 열쇳말 |
|---|---|---|
| 데이터 | 세상의 모든 것이 데이터로 바뀐다 | 모든 것의 데이터화 |
| 기술 | 알고리즘이 스스로 배우고 판단한다 | 지능화되고 진화하는 알고리즘 |
| 인재 | 데이터를 다루는 새 직업이 선다 | 데이터 사이언티스트, 알고리즈미스트 |
이 셋은 서로 물려 있습니다. 데이터가 늘어나니 알고리즘이 배울 재료가 생기고, 알고리즘이 판단을 대신하게 되니 그 판단을 감시할 사람이 필요해집니다. 순서를 거꾸로 읽어도 성립합니다 — 감시할 사람이 없으면 알고리즘의 판단을 믿고 맡길 수 없고, 맡기지 못하면 데이터를 아무리 모아도 결정으로 이어지지 않습니다. 문제에서 셋 중 하나를 빼고 「빠진 것을 고르라」고 묻는 형태가 나오면 이 고리를 떠올리면 됩니다.
모든 것이 데이터가 된다
데이터화(datafication)는 이제껏 데이터가 아니었던 것을 측정하고 기록해 분석할 수 있는 형태로 바꾸는 일입니다. 위치가 좌표가 되고, 사람 사이의 친분이 관계망의 간선이 되고, 걸음걸이와 심박이 시계열이 되는 것이 그렇습니다.
이 낱말을 디지털화(digitization)와 헷갈리면 안 됩니다. 디지털화는 종이 책을 스캔해 파일로 만드는 것처럼 아날로그 매체를 0과 1로 옮기는 일입니다. 스캔한 책은 화면에 띄울 수는 있어도 「어느 낱말이 몇 번 나왔는가」에 답하지 못합니다. 그 책의 본문을 낱말 단위로 색인해 셀 수 있게 만드는 것이 데이터화입니다.
| 견줄 것 | 디지털화 | 데이터화 |
|---|---|---|
| 무엇을 바꾸나 | 매체의 형식 | 대상의 표현 방식 |
| 결과 | 컴퓨터에 담긴다 | 계산·분석할 수 있게 된다 |
| 예 | 종이 책을 스캔한 이미지 파일 | 그 본문을 낱말로 쪼개 색인한 것 |
스스로 바뀌는 알고리즘
예전의 알고리즘은 사람이 적어 둔 규칙의 목록이었습니다. 입력이 같으면 결과가 같고, 왜 그렇게 됐는지 따라 읽을 수 있었습니다. 지금의 알고리즘은 데이터를 먹고 규칙을 스스로 만들며, 데이터가 바뀌면 규칙도 바뀝니다. 이것을 지능화되고 진화하는 알고리즘이라 부릅니다.
여기서 두 가지가 따라옵니다. 하나는 알고리즘이 도구가 아니라 판단의 주체 자리에 선다는 것입니다 — 대출 승인, 채용 서류 선별, 보험료 산정이 이미 그렇습니다. 다른 하나는 그 판단의 근거를 사람이 따라 읽기 어려워진다는 것입니다. 규칙을 적은 사람이 없으니 「왜 떨어뜨렸느냐」에 답할 사람도 없습니다.
| 견줄 것 | 규칙을 적어 둔 알고리즘 | 배워서 진화하는 알고리즘 |
|---|---|---|
| 규칙의 출처 | 사람이 미리 적는다 | 데이터에서 스스로 만든다 |
| 데이터가 바뀌면 | 그대로다 | 규칙이 함께 바뀐다 |
| 근거 설명 | 코드를 따라 읽으면 된다 | 따라 읽을 코드가 없다 |
| 사람의 자리 | 규칙을 고친다 | 학습 데이터와 목표를 고른다 |
마지막 줄이 앞으로의 쟁점입니다. 사람이 손을 대는 자리가 규칙에서 데이터와 목표로 옮겨 갔으므로, 잘못이 생겼을 때 따져 물을 곳도 코드가 아니라 「무엇을 먹였고 무엇을 잘한 것으로 셌는가」 쪽입니다.
알고리즈미스트라는 직업
알고리즈미스트(algorithmist)는 알고리즘의 판단 때문에 부당한 피해를 입은 사람을 대신해 그 알고리즘을 들여다보고 문제를 밝히는 전문가입니다. 앞 노트에서 본 위기 요인 셋 가운데 「데이터 오용」의 통제 방안으로 나오는 그 직업입니다.
하는 일은 셋으로 정리됩니다. 알고리즘이 어떤 데이터를 어떻게 썼는지 확인하고, 그 결과가 특정 집단에 치우쳤는지 따져 보고, 피해를 주장하는 쪽을 대신해 그 근거를 설명하는 것입니다. 그래서 필요한 역량이 한쪽으로 몰리지 않습니다 — 컴퓨터과학·수학·통계처럼 알고리즘 자체를 읽는 힘과, 법·제도·비즈니스처럼 그 결과가 무엇을 뜻하는지 읽는 힘이 함께 필요합니다.
위치가 헷갈릴 때는 편을 보면 됩니다. 데이터 사이언티스트는 알고리즘을 만드는 쪽에 서고, 알고리즈미스트는 그 알고리즘에 당했다고 말하는 쪽에 섭니다. 두 직업 다 인재 축에 들어가지만 서 있는 자리가 반대입니다.
이 직업이 성립하려면 제도가 하나 받쳐 줘야 합니다. 알고리즘 접근권 — 외부인이 알고리즘과 그 입력 데이터를 들여다볼 수 있게 하는 권리입니다. 접근이 막혀 있으면 알고리즈미스트가 할 수 있는 일이 없습니다.
가치를 만드는 자리가 옮겨 왔다
무엇이 가치를 만드는가에 대한 답은 시대에 따라 세 번 옮겨 왔습니다. 이 순서를 뒤섞어 묻는 문제가 자주 나옵니다.
| 시대 | 가치의 원천 | 무슨 일이 있었나 |
|---|---|---|
| 디지털화 | 아날로그를 디지털로 옮기는 것 자체 | 문서·음악·사진이 파일이 되면서 복제와 전달의 비용이 사라졌다 |
| 연결 | 흩어진 것을 이어 주는 방식 | 검색과 플랫폼이 사람·정보·상품을 잇고, 잇는 자리를 쥔 쪽이 가치를 가져갔다 |
| 에이전시 | 연결을 대신 다뤄 주는 존재 | 이어진 것이 너무 많아져, 무엇을 볼지 골라 주고 대신 처리해 주는 쪽으로 가치가 옮겼다 |
같은 사업을 세 시대에 놓고 보면 차이가 분명해집니다. 음악을 예로 들면, 음반을 파일로 만들어 판 자리가 디지털화이고, 흩어진 곡과 듣는 사람을 이어 준 스트리밍 서비스가 연결이며, 무엇을 들을지 대신 골라 주는 추천이 에이전시입니다. 파는 물건은 내내 음악이었지만 값을 받는 지점이 세 번 옮겨 갔습니다.
에이전시(agency)는 넘치는 연결 속에서 사용자를 대신해 판단하고 행동하는 주체를 뜻합니다. 추천 시스템과 개인 비서 서비스가 그 자리에 있고, 그 판단의 재료가 곧 데이터입니다. 세 시대는 앞의 것을 버리고 다음으로 가는 것이 아니라 층으로 쌓입니다 — 디지털화되지 않은 것은 연결되지 못하고, 연결되지 않은 것은 대신 다뤄 줄 수도 없습니다.
데이터 사이언스가 닿지 못하는 곳
데이터 사이언스는 만능이 아닙니다. 분석은 언제나 가정 위에 서 있고, 그 가정은 사람이 고릅니다. 어떤 변수를 넣을지, 무엇을 성공으로 셀지, 어느 기간을 볼지가 모두 선택입니다. 데이터가 아무리 많아도 이 선택이 틀리면 결과는 정교하게 틀립니다.
한계가 드러나는 자리는 대개 셋 중 하나입니다. 측정하기 쉬운 것만 목표로 삼아 정작 중요한 것을 빼놓는 자리, 과거 데이터에 담긴 관행을 그대로 배워 미래에 되풀이하는 자리, 그리고 통계적으로 유의하다는 말을 업무적으로 중요하다는 말과 바꿔 읽는 자리입니다. 셋 다 계산이 틀려서 생기는 문제가 아니라 계산을 시작하기 전과 끝난 뒤의 판단에서 생깁니다.
그래서 함께 이야기되는 것이 인문학적 사고 — 숫자가 말하지 않는 맥락과 사람의 동기를 읽는 힘입니다. 이 이야기가 힘을 얻은 배경으로 셋을 듭니다.
| 배경 | 무엇이 달라졌나 |
|---|---|
| 단순한 세계화에서 복잡한 세계화로 | 시장이 하나로 수렴하는 대신 지역·문화마다 갈라져, 맥락을 읽지 않으면 통하지 않는다 |
| 제품 생산에서 서비스로 | 파는 것이 물건에서 경험으로 옮겨 가, 고객이 무엇을 느끼는지가 성능만큼 중요해졌다 |
| 생산에서 시장 창조로 | 잘 만드는 경쟁에서 없던 수요를 만들어 내는 경쟁으로 옮겨 갔다 |
정리하면 이 절이 말하는 것은 「통계를 버리고 인문학을 하라」가 아닙니다. 분석의 결과를 판단으로 옮기는 마지막 구간이 여전히 사람의 몫이고, 그 구간의 품질을 좌우하는 것이 맥락을 읽는 힘이라는 이야기입니다. 서술형에서 이 자리가 나오면 한계를 지적하는 데서 끝내지 말고 「그래서 분석 과정의 어디에 사람의 판단을 끼워 넣을 것인가」까지 적어야 배점이 채워집니다.
연습 문제
다음 중 데이터화(datafication)의 사례로 가장 알맞은 것은?
① 종이 계약서를 스캔해 PDF로 보관한다
② 매장 안 손님의 이동 경로를 좌표와 시각으로 기록해 체류 시간을 계산한다
③ 카세트테이프의 음악을 파일로 변환한다
④ 필름 사진을 디지털카메라로 다시 찍는다②. 나머지 셋은 매체를 디지털 형식으로 옮긴 디지털화입니다. ②만 이제껏 데이터가 아니던 행동을 측정·계산할 수 있는 값으로 바꿨습니다.알고리즈미스트에 대한 설명으로 옳지 않은 것은?
① 알고리즘의 판단으로 피해를 입었다고 주장하는 쪽을 대신한다
② 알고리즘과 입력 데이터를 들여다볼 수 있어야 일이 성립한다
③ 통계와 컴퓨터과학뿐 아니라 법·비즈니스 이해가 함께 필요하다
④ 알고리즘의 예측 정확도를 끌어올리는 것이 주된 임무다④. 정확도를 올리는 일은 모델을 만드는 쪽의 몫입니다. 알고리즈미스트는 그 판단이 부당하지 않은지 밖에서 따지는 자리입니다.가치 패러다임의 변화 순서로 옳은 것은?
① 연결 → 디지털화 → 에이전시
② 디지털화 → 연결 → 에이전시
③ 에이전시 → 디지털화 → 연결
④ 디지털화 → 에이전시 → 연결②. 아날로그가 디지털이 되고, 그 디지털이 서로 이어지고, 이어진 것이 너무 많아져 대신 다뤄 주는 존재가 가치를 갖는 순서입니다.빅데이터의 미래를 데이터·기술·인재 셋으로 나눌 때, 기술 축의 열쇳말로 알맞은 것은?
① 모든 것의 데이터화
② 지능화되고 진화하는 알고리즘
③ 알고리즘 접근권
④ 데이터 사이언티스트의 소프트 스킬②. ①은 데이터 축, ④는 인재 축입니다. ③은 인재 축을 받치는 제도이지 기술 축의 열쇳말이 아닙니다.데이터 사이언스의 한계에 대한 설명으로 가장 알맞은 것은?
① 데이터의 양이 충분하면 분석자의 가정은 결과에 영향을 주지 않는다
② 어떤 변수를 넣고 무엇을 성공으로 셀지가 사람의 선택이라 그 선택이 틀리면 결과도 틀린다
③ 정량적 방법만으로 사람의 동기까지 남김없이 설명할 수 있다
④ 상관관계를 찾으면 인과관계도 함께 밝혀진다②. 데이터가 아무리 많아도 분석의 틀은 사람이 고르고, 그 틀이 결과의 상한을 정합니다.서술형 연습입니다. 한 채용 서비스가 지원서를 학습한 모델로 서류 합격 여부를 자동 판정하고 있습니다. 여기서 생길 수 있는 위험 하나를 들고, 알고리즈미스트와 알고리즘 접근권이 그 위험을 어떻게 다루는지 5줄 이내로 쓰시오.
채점 기준은 셋입니다. (1) 위험을 구체적으로 들었는가 — 과거 합격자 데이터에 특정 집단이 적게 들어 있으면 모델이 그 편향을 그대로 배워 재생산하고, 학습으로 규칙이 만들어졌으므로 탈락 사유를 지원자에게 설명할 수 없다는 점입니다. (2) 알고리즈미스트가 하는 일을 적었는가 — 어떤 데이터를 어떻게 썼는지 확인하고 결과가 특정 집단에 치우쳤는지 따져, 피해를 주장하는 쪽을 대신해 근거를 밝힙니다. (3) 접근권을 제도로 짚었는가 — 알고리즘과 입력 데이터를 외부에서 들여다볼 수 있어야 그 확인이 가능하므로, 접근권이 막혀 있으면 앞의 일은 성립하지 않는다는 점입니다. 「편향이 생길 수 있다」까지만 쓰고 통제 수단을 적지 않으면 배점의 절반만 붙습니다.
1과목은 여기까지입니다. 세 노트의 표를 한 장으로 옮겨 적어 두면 열 문항 중 여덟은 그 한 장 안에서 풀립니다. 다음 자리부터는 2과목 「데이터 처리 기술 이해」로 넘어가 데이터를 실제로 옮기고 쌓는 기술을 봅니다.

