데이터분석 준전문가 (ADsP) 시험 노트과목 총정리28 MIN
ADsP 1과목 데이터의 이해 총정리
ADsP 1과목 열 문항이 걸치는 범위를 계획 순서대로 훑는 복습용 노트입니다. DIKW와 SECI부터 데이터베이스 활용 분야, 3V와 활용 테크닉, 위기 요인, 전략 인사이트까지 표로 갈라 둡니다.
ADsP 1과목 「데이터의 이해」는 필기 50문항 가운데 10문항, 20점입니다. 과목별 과락이 40%라 열 문항 중 넷은 맞혀야 하고, 셋에 그치면 총점이 60점을 넘어도 불합격입니다. 이 글은 그 열 문항이 걸치는 범위를 상세 노트의 차례대로 한 번에 훑는 복습용입니다. 설명을 새로 펼치는 자리가 아니라 뼈대와 헷갈리는 짝을 표로 되살리는 자리이므로, 절마다 마지막 문단에서 그 자리가 어떻게 문제로 바뀌는지만 짚습니다.
데이터와 정보, DIKW 피라미드
데이터는 다른 것과의 관계를 따지지 않고 그 자체로 존재하는 객관적 사실입니다. 가공해 관계를 붙이면 정보, 정보를 구조화해 규칙으로 만들면 지식, 거기에 근본 원리를 더하면 지혜입니다. 이 네 층을 아래에서 위로 쌓은 것이 DIKW 피라미드입니다.
| 층 | 이름 | 무엇인가 | 예 |
|---|---|---|---|
| 1 | 데이터(Data) | 가공되지 않은 객관적 사실 | A마트는 볼펜을 1,000원, B마트는 1,200원에 판다 |
| 2 | 정보(Information) | 데이터를 가공해 얻은 의미 | A마트의 볼펜이 B마트보다 싸다 |
| 3 | 지식(Knowledge) | 정보를 구조화해 얻은 판단 | 볼펜은 A마트에서 사는 것이 좋겠다 |
| 4 | 지혜(Wisdom) | 근본 원리를 더한 창의적 아이디어 | A마트는 다른 상품도 B마트보다 쌀 것이다 |
같은 데이터를 형태로 한 번 더 가릅니다.
| 갈래 | 형태 | 다루는 비용 | 예 |
|---|---|---|---|
| 정성적 데이터 | 언어·문자로 서술한 것 | 형태가 제각각이라 저장·검색·분석이 비싸다 | 「이번 달 매출이 늘었다」, 고객 후기 |
| 정량적 데이터 | 수치·기호·도형으로 적힌 것 | 그대로 계산하고 집계할 수 있다 | 나이 32세, 기온 21.5도 |
정성적 데이터는 대개 비정형으로 쌓이고 정량적 데이터는 정형·반정형에 담깁니다. 그 구조를 기준으로 가른 것이 다음 셋입니다. 여기서 구조란 값이 들어갈 자리와 그 자리의 이름이 미리 정해져 있는 것을 말합니다.
| 유형 | 구조 | 값과 구조의 관계 | 예 |
|---|---|---|---|
| 정형 | 행과 열이 고정 | 구조가 데이터 밖(스키마)에 따로 있다 | 관계형 데이터베이스 테이블, 스프레드시트, CSV |
| 반정형 | 느슨한 구조 | 구조가 데이터 안에 함께 들어 있다 | XML, JSON, HTML, 웹 로그, 센서 데이터 |
| 비정형 | 없음 | 구조 자체가 없다 | 텍스트 문서, 이미지, 동영상, 음성 |
지식이 사람의 머릿속에 있어 말로 옮기기 어려우면 암묵지, 문서나 매뉴얼로 드러나 있으면 형식지입니다. 둘이 오가는 네 걸음을 SECI 모델이라 부릅니다.
| 단계 | 방향 | 하는 일 |
|---|---|---|
| 공통화(Socialization) | 암묵지 → 암묵지 | 함께 일하며 경험을 나눠 갖는다 |
| 표출화(Externalization) | 암묵지 → 형식지 | 머릿속의 요령을 문서로 꺼낸다 |
| 연결화(Combination) | 형식지 → 형식지 | 흩어진 문서를 묶어 새 지식으로 만든다 |
| 내면화(Internalization) | 형식지 → 암묵지 | 그 문서를 익혀 다시 몸에 붙인다 |
지식 경영은 이 네 걸음이 개인과 조직 사이를 돌게 만드는 경영 방식이고, 그 바퀴를 굴리는 연료가 조직에 쌓인 데이터입니다. 예문 하나를 주고 DIKW의 어느 층인지, 또는 SECI의 어느 단계인지 고르게 합니다. DIKW는 관측한 사실 그대로면 데이터, 둘을 견줘 의미를 붙였으면 정보, 그래서 무엇을 할지 정했으면 지식, 관측하지 않은 대상까지 미루어 짐작했으면 지혜입니다. SECI는 화살표의 출발점과 도착점이 암묵지인지 형식지인지만 보면 갈립니다.
데이터베이스의 정의와 활용 분야
데이터베이스는 여러 사람이 함께 쓰려고 체계적으로 정리해 통합 관리하는 데이터의 묶음입니다. 성질이 넷입니다. 중복을 없애 하나로 모은 통합된 데이터, 컴퓨터가 접근할 수 있는 매체에 담긴 저장된 데이터, 여러 사용자가 나눠 쓰는 공용 데이터, 삽입·삭제·갱신으로 계속 달라지는 변화되는 데이터입니다.
DBMS는 그 데이터베이스를 만들고 다루고 지키는 소프트웨어이고, SQL은 DBMS에 일을 시키는 표준 질의 언어입니다. 정의(DDL)·조작(DML)·제어(DCL) 셋으로 나뉩니다.
CREATE TABLE member (id INT, name VARCHAR(20)); -- 정의(DDL)
INSERT INTO member VALUES (1, '김팔딘'); -- 조작(DML)
GRANT SELECT ON member TO analyst; -- 제어(DCL)
기업 안에서는 하는 일에 따라 시스템이 갈립니다.
| 갈래 | 무엇을 하는가 | 데이터의 모양 |
|---|---|---|
| OLTP | 주문·결제처럼 그때그때 일어난 거래를 처리한다 | 현재 시점, 갱신이 잦다 |
| OLAP | 쌓인 데이터를 여러 각도로 집계해 분석한다 | 과거까지 누적, 읽기 중심 |
| 약어 | 이름 | 하는 일 |
|---|---|---|
| CRM | 고객관계관리 | 고객 접점 데이터를 모아 마케팅과 응대에 쓴다 |
| SCM | 공급망관리 | 자재·재고·물류를 사슬로 이어 흐름을 맞춘다 |
| ERP | 전사적자원관리 | 인사·회계·생산을 한 시스템으로 통합한다 |
| EAI | 기업 애플리케이션 통합 | 따로 놀던 시스템끼리 데이터를 주고받게 잇는다 |
데이터웨어하우스는 흩어진 운영 데이터를 분석용으로 한곳에 모아 둔 저장소이고, 뽑아 형식을 맞추고 실어 넣는 과정이 ETL입니다. 특성은 넷입니다 — 업무가 아니라 「고객」·「매출」 같은 분석 주제로 묶는 주제 지향성, 시스템마다 다른 코드와 단위를 하나로 맞추는 통합성, 시점별 스냅숏을 남겨 과거와 견주는 시계열성, 한번 들어간 값을 고치거나 지우지 않는 비휘발성입니다. 거기서 한 부서나 한 주제에 필요한 부분만 떼어 낸 작은 저장소가 데이터마트입니다.
산업과 사회 기반에서 쓰이는 자리도 함께 묻습니다.
| 자리 | 무엇이 쓰이는가 |
|---|---|
| 제조 | 실시간 생산·재고 정보를 위한 ERP와 SCM, 시스템을 잇는 EAI |
| 금융 | 계정계와 정보계를 잇는 EAI, 고객 분석용 e-CRM과 데이터웨어하우스 |
| 유통 | 판매 시점 데이터와 RFID를 SCM·CRM에 태워 재고와 고객을 함께 본다 |
| 물류 | 첨단화물운송체계 CVO, 전자문서교환 EDI |
| 지리 | 지리정보시스템 GIS, 원격탐사 RS, 위치기반서비스 LBS |
| 교통 | 지능형교통정보시스템 ITS |
| 의료 | 의료영상저장전송시스템 PACS, 전자의무기록 |
| 교육 | 교육행정정보시스템 NEIS |
네 성질의 이름을 그대로 묻거나 셋만 나열하고 아닌 것 하나를 섞습니다. 「영구적 데이터」처럼 그럴듯하지만 목록에 없는 말이 오답으로 나옵니다 — 데이터베이스는 변화되는 데이터입니다. 약어와 분야를 한 칸씩 밀어 짝지어 놓는 문제도 잦으니 위 두 표는 약어 → 분야 방향으로 한 번, 분야 → 약어 방향으로 한 번 되뇌어 둡니다.
빅데이터의 3V와 활용 기본 테크닉
빅데이터가 나온 배경은 셋입니다. 저장 비용이 떨어지고 클라우드와 분산 처리가 퍼져 버리던 데이터를 남길 수 있게 된 것, 모바일과 SNS와 센서가 데이터를 쉼 없이 만들어 낸 것, 그리고 게놈 해독이나 기상 관측처럼 학계가 먼저 거대 데이터를 다뤄 본 것입니다.
부르는 범위도 셋으로 갈립니다.
| 관점 | 무엇을 빅데이터라 부르는가 |
|---|---|
| 협의 | 기존 도구로는 저장·관리·분석하기 어려운 규모의 데이터 그 자체 |
| 중의 | 그 데이터에 처리 기술과 다루는 인재·조직까지 더한 것 |
| 광의 | 사회와 경제를 바꾸는 새로운 가치와 패러다임까지 포함한 것 |
기본 특징은 3V입니다. 데이터의 양이 큰 규모(Volume), 정형과 비정형이 섞인 다양성(Variety), 실시간에 가깝게 생성되고 처리되는 속도(Velocity)입니다. 여기에 값어치를 뜻하는 가치(Value), 신뢰성을 뜻하는 정확성(Veracity)을 더해 4V·5V로 넓혀 부르기도 합니다.
빅데이터는 일하는 방식도 바꿉니다.
| 전 | 후 | 무엇이 달라졌나 |
|---|---|---|
| 사전 처리 | 사후 처리 | 목적을 정해 모으는 대신 일단 모아 두고 나중에 쓴다 |
| 표본조사 | 전수조사 | 일부를 뽑는 대신 있는 것을 전부 본다 |
| 질 | 양 | 하나하나의 정확도보다 규모로 메운다 |
| 인과관계 | 상관관계 | 왜인지 밝히기 전에 함께 움직이는 것부터 찾는다 |
활용 기본 테크닉은 일곱입니다.
| 테크닉 | 무엇을 답하는가 | 예 |
|---|---|---|
| 연관규칙학습 | 무엇과 무엇이 함께 일어나는가 | 이 상품을 산 사람이 같이 담는 것은 |
| 유형분석 | 이것은 어느 그룹에 속하는가 | 들어온 문의가 어느 부서 건인가 |
| 유전 알고리즘 | 주어진 조건에서 가장 나은 답은 | 배차를 어떻게 짜면 대기가 줄까 |
| 기계학습 | 과거를 학습해 무엇을 예측하는가 | 이 사용자가 볼 만한 영화는 |
| 회귀분석 | 두 변수는 어떤 관계인가 | 광고비를 늘리면 매출은 얼마나 오르는가 |
| 감정분석 | 글쓴이의 태도는 어떠한가 | 이 후기는 호평인가 혹평인가 |
| 소셜 네트워크 분석 | 누가 누구와 이어져 있는가 | 이 모임에서 영향력이 큰 사람은 |
3V의 항목을 묻거나, 확장된 V 중 기본 3V가 아닌 것을 고르게 합니다. Value와 Veracity는 나중에 더해진 것이라는 점이 답의 근거입니다. 테크닉은 상황 한 줄을 주고 무엇을 쓸지 고르게 하므로 위 표의 「무엇을 답하는가」 열이 그대로 판단 기준이 됩니다.
빅데이터의 가치와 위기 요인
빅데이터의 가치는 미리 값을 매기기 어렵습니다. 이유가 셋입니다 — 한 번 쓰고 사라지지 않고 재사용·재조합되며, 모을 때는 없던 쓸모가 나중에 생기고, 분석 기술이 발전하면 예전에 못 쓰던 데이터가 쓸모를 얻기 때문입니다.
그 가치는 세 곳에 다르게 나타납니다.
| 대상 | 무엇이 달라졌나 |
|---|---|
| 기업 | 혁신 수단이자 경쟁력의 원천, 생산성 향상 |
| 정부 | 환경 탐색(기상·인구), 상황 분석(사회 관계망·이상 징후), 미래 대응(재난과 미래 전략) |
| 개인 | 목적에 맞는 데이터를 골라 써서 활동의 효율과 삶의 질을 높인다 |
같은 힘이 위험도 만듭니다. 위기 요인 셋과 통제 방안은 짝으로 외웁니다.
| 위기 요인 | 무엇이 문제인가 | 통제 방안 |
|---|---|---|
| 사생활 침해 | 익명 데이터를 모으면 개인이 다시 식별된다 | 동의제에서 책임제로 — 제공자의 사전 동의 대신 사용자에게 책임을 지운다 |
| 책임 원칙 훼손 | 아직 하지 않은 일을 예측해 불이익을 준다 | 결과 기반 책임 원칙을 지킨다 — 예측이 아니라 실제 행동으로만 묻는다 |
| 데이터 오용 | 잘못된 지표와 알고리즘이 엉뚱한 결론을 낸다 | 알고리즘에 대한 접근권을 열고 알고리즈미스트를 둔다 |
알고리즈미스트는 알고리즘이 어떤 근거로 그런 판단을 냈는지 설명하고 그 피해를 가려내는 전문가입니다. 앞으로의 빅데이터를 떠받치는 것도 셋으로 정리됩니다. 위치·행동·감정처럼 수치가 아니던 것까지 데이터가 되는 모든 것의 데이터화, 스스로 규칙을 고쳐 가는 진화하는 알고리즘, 그리고 그 둘을 다루는 데이터 사이언티스트와 알고리즈미스트라는 인력입니다.
위기 요인과 통제 방안을 어긋나게 짝지어 놓고 고르게 합니다. 「사생활 침해 — 결과 기반 책임 원칙」처럼 한 칸씩 밀어 놓는 식입니다. 사생활 침해는 동의와 책임, 책임 원칙 훼손은 결과 기반, 데이터 오용은 알고리즘 접근권으로 붙여 두면 밀려도 알아챕니다.
데이터 사이언티스트와 전략 인사이트
산업마다 익숙한 분석이 있습니다. 금융의 신용 점수, 유통의 재고 최적화 같은 것입니다. 업무에는 필요하지만 그 자리에 머무는 것이 일차원적 분석이고, 한계가 분명합니다. 경쟁자도 같은 것을 하고 있어 차별이 되지 않고, 무엇보다 사업 성과를 실제로 움직이는 질문에는 답하지 못합니다. 전략 인사이트를 주는 분석은 「우리 성과를 무엇이 좌우하는가」를 먼저 묻고, 그렇게 분석을 의사결정의 축으로 삼는 경영이 분석 기반 경영입니다. 남들과 같은 데이터에서 남들이 못 본 관계를 찾아내는 힘이 그대로 경쟁 우위가 됩니다.
데이터 사이언스는 분석 기법(Analytics), 데이터를 다루는 기술(IT), 문제를 정의하는 비즈니스 분석이 겹치는 자리에 있습니다. 그래서 요구되는 역량도 둘로 갈립니다.
| 갈래 | 무엇인가 | 예 |
|---|---|---|
| 하드 스킬 | 빅데이터에 대한 이론적 지식과 분석 기술의 숙련도 | 통계·머신러닝 이론, 분석 도구를 쓰는 능력 |
| 소프트 스킬 | 통찰력 있는 분석, 설득력 있는 전달, 여러 분야와의 협력 | 호기심과 논리적 비판, 시각화와 스토리텔링, 커뮤니케이션 |
소프트 스킬을 요구하는 배경이 가치 패러다임의 변화입니다.
| 단계 | 무엇이 값어치를 만들었나 |
|---|---|
| 디지털화(Digitalization) | 아날로그 세상을 디지털로 옮기는 일 자체 |
| 연결(Connection) | 흩어진 디지털 정보를 이어 주는 것 — 검색과 플랫폼 |
| 에이전시(Agency) | 복잡해진 연결을 사용자 대신 관리해 주는 것 — 에이전트 |
에이전시 단계에서는 「사람이 무엇을 원하는가」를 읽어야 하므로 인문학적 사고가 요구됩니다. 세계화가 단순 확장에서 복잡성 관리로, 비즈니스 중심이 제품 생산에서 서비스로, 경제 패러다임이 생산에서 시장 창조로 옮겨 간 흐름과 같은 자리입니다.
보기를 하나 주고 하드 스킬인지 소프트 스킬인지 고르게 합니다. 시각화와 스토리텔링은 도구를 다루는 능력이 아니라 전달하는 능력으로 분류된다는 점이 함정입니다. 가치 패러다임 셋은 순서를 뒤섞어 놓고 바로잡게 합니다.
연습 문제
「배송이 생각보다 빨랐다」는 고객 후기와 그 주문의 배송 소요 시간 31시간은 각각 어느 갈래인가?
① 정성적 데이터 - 정량적 데이터
② 정량적 데이터 - 정성적 데이터
③ 둘 다 정성적 데이터
④ 둘 다 정량적 데이터①. 언어로 서술한 앞쪽이 정성적, 수치로 적힌 뒤쪽이 정량적입니다. 정성적 데이터는 형태가 제각각이라 저장·검색·분석에 비용이 더 들고 대개 비정형으로 쌓입니다.선배가 정리해 둔 응대 매뉴얼을 신입이 여러 번 읽고 몸에 익혀 자기 요령이 되었다면 SECI의 어느 단계인가?
① 공통화
② 표출화
③ 연결화
④ 내면화④. 형식지인 매뉴얼이 암묵지인 요령으로 옮겨 갔으므로 내면화입니다. 선배가 자기 요령을 매뉴얼로 적은 순간은 표출화이고, 매뉴얼 여럿을 묶어 새 지침서를 만들면 연결화입니다.다음 중 반정형 데이터로 볼 수 없는 것은?
① 웹 서버 접속 로그
② JSON 응답
③ 관계형 데이터베이스의 주문 테이블
④ 온습도 센서가 보내는 측정값③. 테이블은 열 이름과 자료형이 스키마로 데이터 밖에 정해져 있으므로 정형입니다. 나머지 셋은 값 옆에 키나 태그가 함께 붙어 구조가 데이터 안에 들어 있는 반정형입니다.시스템과 그 쓰임의 짝이 잘못된 것은?
① CVO - 물류
② GIS - 지리
③ NEIS - 의료
④ ITS - 교통③. NEIS는 교육행정정보시스템이므로 교육 분야입니다. 의료 쪽 예로는 의료영상을 저장하고 전송하는 PACS가 있습니다.빅데이터의 기본 특징인 3V에 해당하지 않는 것은?
① Volume
② Variety
③ Velocity
④ Veracity④. 3V는 규모·다양성·속도입니다. Veracity(정확성)와 Value(가치)는 나중에 더해져 4V·5V로 부르는 확장 항목입니다.새 요금제를 두고 올라온 게시글에서 호감과 반감을 가려내려 한다. 어느 테크닉인가?
① 연관규칙학습
② 감정분석
③ 유전 알고리즘
④ 소셜 네트워크 분석②. 글쓴이의 태도를 가려내는 것이 감정분석입니다. ①은 무엇과 무엇이 함께 일어나는지, ③은 주어진 조건에서 가장 나은 배치를 찾는 것, ④는 누가 누구와 이어져 있는지를 답합니다.익명 처리해 공개한 위치 기록을 다른 공개 데이터와 겹쳐 보니 특정 인물의 동선이 드러났다. 이 상황의 위기 요인과 그에 맞는 통제 방안을 짝지은 것은?
① 사생활 침해 - 동의제에서 책임제로
② 사생활 침해 - 결과 기반 책임 원칙
③ 책임 원칙 훼손 - 동의제에서 책임제로
④ 데이터 오용 - 알고리즘 접근권 보장①. 익명 처리를 하고도 다시 식별됐으므로 사생활 침해입니다. 넘길 때마다 제공자의 동의를 받는 방식은 여러 데이터를 겹쳐 보는 일을 막지 못하니, 쓰는 쪽이 그 결과에 책임을 지는 책임제로 옮깁니다. ②의 결과 기반 책임 원칙은 아직 하지 않은 일을 예측만으로 처벌하는 책임 원칙 훼손에 붙는 통제이고, ④는 짝 자체는 맞지만 데이터 오용의 통제라 이 상황과는 다른 자리입니다 — 알고리즘 접근권은 알고리즘이 잘못 판단했을 때 그 근거를 따져 주는 알고리즈미스트와 함께 갑니다.가치 패러다임의 세 단계를 나타난 순서대로 배열한 것은?
① 연결 - 에이전시 - 디지털화
② 디지털화 - 연결 - 에이전시
③ 디지털화 - 에이전시 - 연결
④ 연결 - 디지털화 - 에이전시②. 아날로그를 디지털로 옮기는 일이 값어치이던 시기가 먼저고, 그렇게 생긴 디지털 정보를 이어 주는 연결이 다음이며, 연결이 복잡해지자 그것을 대신 관리해 주는 에이전시가 마지막입니다.데이터 사이언티스트의 역량에 대한 설명으로 옳은 것은?
① 분석 도구를 다루는 숙련도는 소프트 스킬이다
② 시각화와 스토리텔링은 도구를 쓰는 일이므로 하드 스킬이다
③ 머신러닝 이론 지식은 하드 스킬이다
④ 논리적 비판은 협력이 아니므로 소프트 스킬에 들지 않는다③. 이론적 지식과 분석 기술의 숙련도가 하드 스킬이므로 ③이 맞고 ①은 뒤집힌 설명입니다. ②의 시각화와 스토리텔링은 전달하는 능력이라 소프트 스킬이고, ④의 논리적 비판은 호기심과 함께 통찰력 쪽에 들어갑니다.
1과목은 외울 것이 많아 보이지만 묻는 자리는 위 다섯 덩어리 안에 있습니다. 표로 갈라 둔 것부터 손으로 다시 그려 보면 남는 것이 빨리 잡힙니다 — 데이터의 세 유형과 DIKW 네 층, SECI 네 단계, 약어와 분야의 짝, 그리고 위기 요인과 통제 방안의 짝입니다.

