빅데이터분석기사 시험 노트개념 정리17 MIN
빅데이터의 특징과 데이터 산업 구조
빅데이터분석기사 1과목의 첫 자리입니다. 3V와 5V, DIKW 피라미드, 데이터 세 갈래를 가른 다음 빅데이터가 바꾼 네 가지 사고방식과 분석 조직·준비도·성숙도까지 이어 정리합니다.
빅데이터분석기사 필기는 네 과목 각 20문항, 모두 80문항입니다. 그중 1과목 「빅데이터 분석 기획」은 계산이 거의 없고 용어와 분류를 정확히 아는가만 묻는 자리라, 아는 사람은 다 맞고 대충 읽은 사람은 절반을 놓칩니다. 이 노트는 그 과목의 출발점인 빅데이터의 정의와 특징, 그리고 그것을 다루는 조직의 모습을 정리합니다.
3V에서 5V로
빅데이터는 기존의 데이터베이스 관리 도구로는 수집·저장·분석하기 어려운 규모의 데이터와 그것을 다루는 기술을 함께 가리키는 말입니다. 「몇 테라바이트부터 빅데이터인가」라는 기준은 없습니다 — 크기가 아니라 기존 도구로 감당이 되느냐가 선입니다.
특징은 흔히 V로 시작하는 낱말로 셉니다. 처음 셋이 3V입니다.
| 특징 | 뜻 | 무엇이 어려워지는가 |
|---|---|---|
| Volume (규모) | 데이터의 양 자체가 크다 | 한 대에 못 담아 분산 저장이 필요해진다 |
| Variety (다양성) | 표 말고도 로그·이미지·음성이 섞인다 | 스키마를 미리 못 정한다 |
| Velocity (속도) | 생성과 유입이 빠르고 처리도 빨라야 한다 | 배치만으로는 못 따라가 실시간 처리가 붙는다 |
여기에 둘을 더하면 5V입니다. Veracity(신뢰성)는 데이터에 잡음·결측·거짓이 섞여 있어 믿을 수 있는지를 따져야 한다는 뜻이고, Value(가치)는 그 많은 데이터에서 실제로 쓸 만한 것을 뽑아내야 비로소 의미가 생긴다는 뜻입니다. 더 늘려 7V로 셀 때는 Validity(정확성)와 Volatility(휘발성, 데이터가 언제까지 유효한가)가 붙습니다.
시험에서 갈리는 자리는 정확히 하나입니다 — Veracity와 Value 중 어느 것이 4V의 네 번째인가를 묻는 문항은 답이 갈리므로 잘 나오지 않고, 대신 「다음 중 3V에 해당하지 않는 것은」이 나옵니다. 3V는 규모·다양성·속도 셋으로 못 박아 외웁니다.
이 특징들이 그저 수식어가 아닌 이유는 셋이 각각 다른 기술을 불러오기 때문입니다. Volume은 한 대에 안 담기니 여러 대에 쪼개 두는 분산 파일 시스템을, Variety는 넣을 때 스키마를 못 정하니 읽을 때 정하는 저장 방식을, Velocity는 하루에 한 번 도는 배치로는 못 따라가니 흘러 들어오는 대로 처리하는 스트리밍을 부릅니다. 뒤에 나올 하둡·NoSQL·스파크가 전부 이 셋 중 하나에 대한 답입니다.
DIKW 피라미드
데이터가 지혜가 되기까지의 단계를 네 층으로 그린 것이 DIKW 피라미드입니다. 아래에서 위로 올라갈수록 사람의 해석이 더 들어갑니다.
| 층 | 뜻 | 예 |
|---|---|---|
| Data (데이터) | 가공되지 않은 사실 그 자체 | A마트의 우유가 800원, B마트의 우유가 900원이다 |
| Information (정보) | 데이터를 가공해 얻은 의미 | A마트의 우유가 B마트보다 싸다 |
| Knowledge (지식) | 정보를 엮어 얻은 규칙·패턴 | 우유는 A마트에서 사는 것이 유리하다 |
| Wisdom (지혜) | 지식을 바탕으로 한 창의적 판단 | A마트는 다른 품목도 쌀 것이니 거기서 장을 보자 |
마지막 층이 헷갈리는데, 지식은 관찰한 것에서 나오고 지혜는 관찰하지 않은 것까지 미루어 짐작하는 것입니다. 「우유가 싸다」까지가 지식, 「그러니 다른 것도 쌀 것이다」가 지혜입니다.
정형·반정형·비정형
데이터를 구조로 가르면 셋입니다. 판별의 열쇠는 스키마(구조 정의)가 어디에 있는가입니다.
| 갈래 | 스키마의 자리 | 예 |
|---|---|---|
| 정형 | 데이터 바깥에 미리 정해져 있다 | 관계형 데이터베이스 테이블, 스프레드시트, CSV |
| 반정형 | 데이터 안에 함께 들어 있다 | JSON, XML, HTML, 웹 로그, 센서 데이터 |
| 비정형 | 없다 | 이메일 본문, 이미지, 동영상, 음성, SNS 게시글 |
CSV가 정형이고 JSON이 반정형인 이유가 여기 있습니다. CSV는 열 이름이 파일 밖의 약속이지만 JSON은 키가 값 옆에 붙어 다닙니다.
import json
structured = [("2026-09-04", 800), ("2026-09-04", 900)] # 열 뜻은 파일 밖에 있다
semi = json.loads('{"date": "2026-09-04", "price": 800}') # 키가 데이터 안에 있다
unstructured = "오늘 A마트에서 우유를 샀는데 생각보다 쌌다" # 구조가 없다
print(semi["price"]) # 800 — 키를 알면 바로 꺼낸다
비정형이라도 저장은 됩니다. 파일로 담기니까요. 갈리는 것은 꺼내 쓸 때 파싱이 필요한가입니다.
빅데이터가 바꾼 네 가지
빅데이터가 널리 쓰이면서 데이터를 다루는 방식 자체가 넷 바뀌었다고 정리합니다. 이 넷은 앞뒤 짝으로 외우면 문항에서 바로 갈립니다.
| 이전 | 이후 | 왜 바뀌었나 |
|---|---|---|
| 사전 처리 | 사후 처리 | 쓸 것만 골라 모으는 대신 일단 다 모으고 나중에 고른다 |
| 표본조사 | 전수조사 | 저장과 계산이 싸져 전체를 다 볼 수 있게 됐다 |
| 질 | 양 | 잡음이 섞여도 양이 많으면 전체 경향이 드러난다 |
| 인과관계 | 상관관계 | 왜인지 몰라도 함께 움직인다는 사실만으로 예측에 쓴다 |
마지막 줄을 「인과관계가 필요 없어졌다」로 읽으면 안 됩니다. 예측에는 상관만으로 충분하지만 개입해서 결과를 바꾸려면 여전히 인과가 필요합니다 — 아이스크림 판매와 익사 사고가 함께 오른다고 아이스크림을 금지할 수는 없습니다.
데이터 사이언티스트의 역량
데이터 사이언티스트에게 요구되는 것은 둘로 갈립니다. 하드 스킬은 빅데이터에 대한 이론적 지식과 분석 기술의 숙련도이고, 소프트 스킬은 통찰력 있는 분석, 다분야 간 협력, 설득력 있는 전달입니다.
시험이 노리는 것은 소프트 스킬 쪽에 무엇이 들어가는가입니다. 「시각화로 설득한다」·「현업 담당자와 함께 문제를 정의한다」는 소프트 스킬이고, 「하둡 클러스터를 운영한다」·「모델의 수식을 이해한다」는 하드 스킬입니다.
여기에 하나 더 붙는 이름이 있습니다. 알고리즈미스트(algorithmist)는 알고리즘이 부당한 피해를 입혔는지 살피고 그 근거를 따지는 사람으로, 뒤에서 다룰 빅데이터 위기 요인의 통제 방안 쪽에서 다시 나옵니다.
분석 조직을 어떻게 세우는가
분석을 담당하는 조직의 모양은 셋입니다. 인력이 어디에 앉아 있는가로 갈립니다.
| 구조 | 인력의 자리 | 장점 | 약점 |
|---|---|---|---|
| 집중 구조 | 전사 분석 전담 조직에 모여 있다 | 전사 우선순위를 두고 과제를 고를 수 있다 | 현업 부서의 분석 업무와 이중으로 겹친다 |
| 기능 구조 | 별도 조직 없이 각 현업 부서 안에 있다 | 해당 업무를 잘 아는 사람이 직접 한다 | 부서별로 갇혀 전사 차원의 분석이 어렵다 |
| 분산 구조 | 전담 조직 인력을 현업 부서로 보내 배치한다 | 업무에 신속히 적용되고 사례를 공유한다 | 조직 간 조율 비용이 든다 |
「전사 관점의 과제 선정」이 나오면 집중, 「부서마다 따로 분석해 전체를 못 본다」가 나오면 기능, 「전담 인력을 현업에 배치한다」가 나오면 분산입니다. 셋 중 무엇이 옳다는 답은 없습니다 — 분석을 막 시작하는 조직은 인력을 한곳에 모아 두는 편이 배우기 빠르고, 업무마다 데이터가 크게 다른 조직은 현업 가까이 두는 편이 빠릅니다.
준비도와 성숙도, 그리고 사분면
조직이 분석을 할 준비가 됐는지 재는 두 자를 함께 씁니다.
분석 준비도는 지금 갖춘 것을 여섯 영역으로 점검합니다 — 분석 업무 파악, 인력 및 조직, 분석 기법, 분석 데이터, 분석 문화, IT 인프라입니다.
분석 성숙도는 얼마나 무르익었는지를 네 단계로 봅니다 — 도입 → 활용 → 확산 → 최적화이고, 비즈니스 부문·조직 및 역량 부문·IT 부문 셋을 함께 진단합니다.
둘을 축으로 놓으면 사분면이 나옵니다.
| 성숙도 낮음 | 성숙도 높음 | |
|---|---|---|
| 준비도 높음 | 도입형 | 확산형 |
| 준비도 낮음 | 준비형 | 정착형 |
이름이 헷갈리기 쉬운데 규칙이 하나 있습니다 — 준비도가 높으면 시작할 수 있으니 「도입」, 성숙도가 이미 높은데 준비도가 낮으면 일부에 「정착」한 것입니다. 둘 다 높으면 확산형, 둘 다 낮으면 준비형입니다. 문항은 대개 조직 상황을 서술하고 사분면 이름을 고르게 하므로, 서술문에서 「전사에 이미 쓰고 있다」(성숙도)와 「인력과 인프라가 갖춰졌다」(준비도)를 따로 찾아 읽는 연습이 곧 대비입니다.
연습 문제
빅데이터의 3V에 해당하지 않는 것은?
① Volume
② Variety
③ Veracity
④ Velocity③. 3V는 규모·다양성·속도입니다. Veracity(신뢰성)와 Value(가치)는 5V로 늘릴 때 붙는 둘입니다.DIKW 피라미드에서 「A마트의 우유가 B마트보다 싸다」는 어느 층입니까?
① Data
② Information
③ Knowledge
④ Wisdom②. 두 가격이라는 데이터를 견주어 얻은 의미이므로 정보입니다. 「우유는 A마트에서 사자」가 지식, 「다른 품목도 쌀 테니 거기서 장을 보자」가 지혜입니다.다음 중 반정형 데이터로만 묶인 것은?
① CSV 파일, 관계형 DB 테이블
② XML 문서, 웹 서버 로그
③ 감시 카메라 영상, 통화 녹음
④ 스프레드시트, SNS 사진②. 반정형은 스키마가 데이터 안에 함께 들어 있는 갈래입니다. CSV는 열 뜻이 파일 밖의 약속이라 정형, 영상·음성·사진은 비정형입니다.빅데이터가 가져온 변화로 옳지 않은 것은?
① 사전 처리에서 사후 처리로 옮겨 갔다
② 표본조사에서 전수조사로 옮겨 갔다
③ 상관관계에서 인과관계로 옮겨 갔다
④ 질보다 양을 중시하게 됐다③. 방향이 거꾸로입니다. 인과관계에서 상관관계로 옮겨 갔습니다 — 다만 예측이 아니라 개입해서 결과를 바꾸려면 여전히 인과가 필요합니다.전사 차원의 분석 전담 조직을 두되 그 인력을 각 현업 부서에 보내 앉히는 형태는?
① 집중 구조
② 기능 구조
③ 분산 구조
④ 매트릭스 구조③. 분산 구조입니다. 집중 구조는 인력이 전담 조직에 모여 있고, 기능 구조는 전담 조직 자체가 없습니다.어느 회사가 데이터 웨어하우스와 분석 인력을 갖췄고 사내 교육도 돌지만, 분석 결과를 실제 의사결정에 쓴 사례는 한두 부서의 시범 과제뿐입니다. 이 조직은 사분면의 어디입니까?
① 준비형
② 도입형
③ 정착형
④ 확산형②. 인프라·인력·문화가 갖춰졌으니 준비도는 높고, 쓰인 곳이 시범 과제뿐이니 성숙도는 낮습니다. 준비도 높고 성숙도 낮은 자리가 도입형입니다.다음 중 데이터 사이언티스트의 소프트 스킬에 해당하는 것은?
① 분산 처리 프레임워크 운영 능력
② 머신러닝 알고리즘의 수학적 이해
③ 분석 결과를 이해관계자에게 설득력 있게 전달하는 능력
④ 대용량 데이터베이스 튜닝 능력③. 소프트 스킬은 통찰력 있는 분석·다분야 간 협력·설득력 있는 전달 셋입니다. 나머지 셋은 모두 하드 스킬입니다.
일곱 문항이 요구하는 습관은 같습니다. 분류를 묻는 문항은 기준을 먼저 떠올리는 것입니다 — 데이터 세 갈래는 스키마가 어디 있는가, 조직 셋은 인력이 어디 앉아 있는가, 사분면 넷은 준비도와 성숙도 중 어느 쪽이 높은가입니다. 기준을 잡고 보기를 읽으면 후보가 대개 하나로 줄어듭니다.

