데이터분석 준전문가 (ADsP)

데이터분석 준전문가 (ADsP) 시험 노트개념 정리18 MIN

데이터와 정보, DIKW 피라미드

ADsP 1과목의 첫 자리입니다. 데이터의 존재적·당위적 특징과 정형·반정형·비정형을 가르고, DIKW 피라미드 네 층과 암묵지·형식지가 오가는 SECI 모델 네 단계, 지식 경영과 데이터의 관계까지 정리합니다.

ADsP 필기는 객관식 50문항이고 1과목 「데이터의 이해」가 그중 10문항입니다. 과목마다 40% 미만이면 과락이라 열 문항에서 넷은 맞혀야 하고, 배점이 작다고 버리면 총점 60점을 넘기고도 떨어집니다. 이 노트는 그 과목의 첫 자리를 다룹니다 — 데이터라는 낱말을 정의하고, 그것이 정보·지식·지혜로 올라가는 층을 세우고, 사람 머릿속의 지식이 문서로 오가는 네 걸음까지입니다. 계산이 없는 대신 낱말의 자리를 정확히 아는지만 묻는 범위라, 표의 왼쪽 열과 오른쪽 열을 가리고 서로 불러 보는 연습이 그대로 대비가 됩니다.

데이터

존재적 특징과 당위적 특징

데이터는 다른 것과의 관계를 따지지 않고 그 자체로 존재하는 객관적 사실입니다. 이 성질을 데이터의 존재적 특징이라 부릅니다. 같은 값이 추론·예측·전망·추정의 근거로 쓰이는 쪽을 가리킬 때는 당위적 특징이라 부릅니다.

온도계에 찍힌 「25도」는 그 자체로 존재적 특징입니다. 그 값을 보고 에어컨을 켜기로 하면 당위적 특징이 드러난 것입니다. 둘은 다른 데이터가 아니라 같은 데이터의 다른 면입니다. 예문 하나를 주고 어느 쪽인지 고르게 하는 문항이 나오는데, 문장이 값을 적기만 했으면 존재이고 그 값을 무엇에 쓰겠다는 말이 붙어 있으면 당위입니다.

정성과 정량

데이터는 적히는 방식으로 한 번 갈립니다.

갈래 형태 다루는 비용 예
정성적 데이터 언어와 문자로 서술한 것 형태가 제각각이라 저장·검색·분석이 비싸다 「이번 달 매출이 늘었다」, 고객 후기, 설문 주관식 답변
정량적 데이터 수치·기호·도형으로 적힌 것 그대로 계산하고 집계할 수 있다 나이 32세, 기온 21.5도, 판매량 480개

정성적 데이터라고 분석을 못 하는 것은 아닙니다. 다만 값을 세기 전에 형태를 맞추는 일이 먼저 붙어 비용이 커집니다. 「고객 후기 3만 건」은 정성적 데이터이고, 거기서 별점만 뽑아 세면 그 순간 정량적 데이터가 됩니다.

정형·반정형·비정형

다른 축은 구조입니다. 여기서 구조란 값이 들어갈 자리와 그 자리의 이름이 미리 정해져 있는 것을 말합니다.

유형 구조 구조가 어디에 있나 예
정형 행과 열이 고정 데이터 밖(스키마)에 따로 있다 관계형 데이터베이스 테이블, 스프레드시트, CSV
반정형 느슨한 구조 데이터 안에 값과 함께 들어 있다 XML, JSON, HTML, 웹 로그, 센서 데이터
비정형 없음 구조 자체가 없다 텍스트 문서, 이미지, 동영상, 음성

가장 자주 틀리는 것이 반정형입니다. 판정은 「구조가 어디에 적혀 있나」 하나로 끝납니다. 테이블은 열 이름이 테이블 밖 스키마에 한 번 적혀 있고 행에는 값만 들어갑니다. 반면 JSON은 {"age": 32}처럼 이름과 값이 한 덩어리로 같이 있습니다. 파일을 열었을 때 이름표가 값 옆에 붙어 있으면 반정형입니다.

두 축은 서로 다른 축이라 짝이 고정되지 않습니다. 대체로 정성적 데이터가 비정형으로 쌓이고 정량적 데이터가 정형에 담기지만, 센서가 뱉는 온도값은 정량적이면서 반정형입니다.

DIKW 피라미드

네 층

데이터를 가공해 관계를 붙이면 정보, 정보를 구조화해 규칙으로 만들면 지식, 거기에 근본 원리를 더하면 지혜입니다. 이 네 층을 아래에서 위로 쌓은 것이 DIKW 피라미드입니다.

층 이름 무엇인가 예
1 데이터(Data) 가공하지 않은 객관적 사실 A마트는 볼펜을 1,000원, B마트는 1,200원에 판다
2 정보(Information) 데이터를 가공해 얻은 의미 A마트의 볼펜이 B마트보다 200원 싸다
3 지식(Knowledge) 정보를 구조화해 얻은 판단 볼펜은 A마트에서 사는 것이 좋겠다
4 지혜(Wisdom) 근본 원리를 더한 창의적 아이디어 A마트는 다른 상품도 B마트보다 쌀 것이다

층을 가르는 물음

표를 통째로 외우는 것보다 물음 넷을 기억하는 편이 빠릅니다. 관측한 값을 적기만 했는가 — 데이터입니다. 값 둘 이상을 견주어 의미를 붙였는가 — 정보입니다. 그래서 무엇을 하겠다는 판단까지 갔는가 — 지식입니다. 관측하지 않은 대상까지 미루어 짐작했는가 — 지혜입니다.

마지막 물음이 지혜를 가르는 열쇠입니다. 「A마트가 싸니 볼펜은 A마트에서 사자」는 확인한 품목 안에 머무는 판단이라 지식이지만, 「그러니 다른 상품도 쌀 것이다」는 확인하지 않은 품목으로 넘어갔으므로 지혜입니다.

정보와 지식의 경계

정보와 지식을 가르는 자리도 자주 나옵니다. 정보는 아직 누구의 것도 아니고 지식은 행동에 붙습니다. 「볼펜 가격은 A마트가 더 싸다」까지는 누가 읽어도 같은 문장이지만, 「그러니 볼펜은 A마트에서 산다」는 그 사람이 다음에도 쓸 규칙입니다. 규칙으로 굳어 되풀이해 쓸 수 있으면 지식으로 봅니다.

위로 올라갈수록 사람의 몫이 커지는 것도 함께 잡아 둡니다. 데이터에서 정보로 가는 일은 집계와 비교라 기계가 대신할 수 있지만, 지식은 그 의미를 자기 상황에 붙여야 나오고 지혜는 겪어 보지 않은 자리까지 미루어 짐작해야 나옵니다. 「층이 올라갈수록 자동화하기 쉬워진다」는 선택지가 오답으로 나오는 이유입니다.

암묵지와 형식지

두 지식

지식이 사람의 머릿속에 있어 말로 옮기기 어려우면 암묵지, 문서나 매뉴얼로 드러나 있으면 형식지입니다. 자전거를 타는 요령은 암묵지이고, 자전거 조립 설명서는 형식지입니다.

갈래 어디에 있나 옮기는 방법 약점
암묵지 개인의 경험과 몸 함께 일하며 보고 따라 한다 조직 전체가 나눠 갖기 어렵다
형식지 문서·매뉴얼·데이터 복사해 나눠 준다 쌓아 두기만 하고 아무도 안 읽으면 늙는다

지식의 이동

조직이 겪는 문제는 대개 암묵지 쪽에 있습니다. 숙련된 직원 한 사람이 그만두면 그 사람이 들고 있던 요령이 통째로 사라집니다. 그렇다고 문서로만 쌓아 두면 이번에는 읽는 사람이 없어 지식이 자산이 되지 못합니다. 그래서 지식을 한 번 옮기고 끝내는 것이 아니라 두 갈래 사이를 계속 돌게 만드는 모형이 필요했고, 그것이 다음 절입니다.

SECI 모델

암묵지와 형식지가 오가는 네 걸음을 SECI 모델이라 부릅니다. 이름은 네 단계의 영문 머리글자를 이은 것입니다.

단계 방향 하는 일
공통화(Socialization) 암묵지 → 암묵지 함께 일하며 경험을 나눠 갖는다
표출화(Externalization) 암묵지 → 형식지 머릿속의 요령을 문서로 꺼낸다
연결화(Combination) 형식지 → 형식지 흩어진 문서를 묶어 새 지식으로 만든다
내면화(Internalization) 형식지 → 암묵지 그 문서를 익혀 다시 몸에 붙인다

공통화와 표출화

공통화는 신입이 선배 옆에 붙어 일하며 요령을 배우는 걸음입니다. 말로 정리된 것이 없어도 지식이 옮겨 가므로 출발도 도착도 암묵지입니다. 표출화는 그 선배가 자기 요령을 작업 표준서로 적는 걸음입니다. 머릿속에만 있던 것이 문서가 되었으므로 암묵지에서 형식지로 갑니다.

연결화와 내면화

연결화는 부서마다 흩어진 표준서를 모아 회사 전체의 매뉴얼로 엮는 걸음입니다. 들어간 것도 나온 것도 문서라 형식지끼리의 이동입니다. 내면화는 신입이 그 매뉴얼을 읽고 몸에 익히는 걸음입니다. 문서가 다시 개인의 몸으로 들어가므로 형식지에서 암묵지로 갑니다.

나선형 순환

네 단계는 한 바퀴로 끝나지 않고 돌 때마다 지식의 수준이 올라갑니다. 내면화로 몸에 붙은 요령이 다음 바퀴의 공통화에서 다른 사람에게 다시 넘어가는 식입니다. 문항은 대개 예문 하나를 주고 어느 단계인지 고르게 하는데, 화살표의 출발점과 도착점만 보면 갈립니다 — 사람에게서 사람으로면 공통화, 사람에게서 문서로면 표출화, 문서에서 문서로면 연결화, 문서에서 사람으로면 내면화입니다.

지식 경영과 데이터

조직의 지식 자산

지식 경영은 개인에게 흩어진 지식을 조직의 자산으로 바꿔 쓰는 경영 방식입니다. SECI 모델의 네 걸음이 그 안에서 도는 바퀴이고, 바퀴를 굴리는 연료가 조직에 쌓인 데이터입니다. 표출화에서 적어 둔 표준서, 연결화에서 엮은 매뉴얼, 업무 시스템이 남긴 기록이 모두 데이터의 모습으로 저장되기 때문입니다.

데이터와 지식의 사이

여기서 지식 경영이 DIKW와 이어집니다. 조직이 처음 손에 쥐는 것은 데이터뿐이고, 그것을 가공해야 정보가 되고 구조화해야 지식이 됩니다. 지식 경영 시스템이 하는 일이 정확히 그 가공과 구조화를 시스템으로 붙박아 두는 것입니다. 시험에서는 「쌓아 둔 데이터가 곧 조직의 지식이다」처럼 층을 건너뛴 선택지가 오답으로 나옵니다. 데이터는 지식의 재료이지 지식 자체가 아니라는 것만 잡고 있으면 됩니다.

연습 문제

  1. 다음 문장이 DIKW 피라미드의 어느 층에 해당하는지 고르시오.
    「지난 세 달 동안 A마트가 늘 B마트보다 쌌으므로, 아직 확인하지 않은 다른 품목도 A마트가 쌀 것이다」
    ① 데이터
    ② 정보
    ③ 지식
    ④ 지혜
    ④. 확인하지 않은 품목까지 미루어 짐작했으므로 지혜입니다. 세 달치 가격을 견준 것까지가 정보이고, 「그러니 A마트에서 사자」까지가 지식입니다.
  2. 데이터 유형의 짝으로 옳지 않은 것은?
    ① 정형 — 관계형 데이터베이스 테이블
    ② 반정형 — JSON
    ③ 비정형 — 웹 로그
    ④ 비정형 — 동영상
    ③. 웹 로그는 반정형입니다. 줄마다 시각·주소·상태 코드처럼 이름을 붙일 수 있는 항목이 값과 함께 들어 있습니다.
  3. 부서마다 따로 쓰던 작업 표준서를 모아 회사 전체 매뉴얼로 엮었다. SECI 모델의 어느 단계인가?
    ① 공통화
    ② 표출화
    ③ 연결화
    ④ 내면화
    ③. 들어간 것도 나온 것도 문서이므로 형식지에서 형식지로 가는 연결화입니다. ②는 머릿속 요령을 처음 문서로 꺼내는 걸음입니다.
  4. 데이터의 당위적 특징이 드러난 문장은?
    ① 어제 서울의 최고 기온은 25도였다
    ② 매장 A의 3월 매출은 4,800만 원이다
    ③ 기온이 25도를 넘었으니 냉방기를 켜기로 한다
    ④ 이 파일에는 행이 12만 개 들어 있다
    ③. 값을 근거로 무엇을 하겠다는 판단이 붙었습니다. 나머지 셋은 값을 적기만 했으므로 존재적 특징입니다.
  5. 정성적 데이터와 정량적 데이터에 대한 설명으로 옳은 것은?
    ① 정성적 데이터는 언제나 비정형으로만 저장된다
    ② 정량적 데이터는 수치·기호·도형으로 적혀 그대로 집계할 수 있다
    ③ 정성적 데이터는 분석할 수 없다
    ④ 설문의 주관식 답변은 정량적 데이터다
    ②. ①은 「언제나」가 틀렸습니다. 대체로 비정형에 쌓이지만 표의 한 열에 짧은 서술을 담으면 정형에도 들어갑니다. ③은 비용이 더 들 뿐 분석이 가능하고, ④의 주관식 답변은 정성적 데이터입니다.
  6. 암묵지와 형식지에 대한 설명으로 옳지 않은 것은?
    ① 암묵지는 개인의 경험에 배어 있어 말로 옮기기 어렵다
    ② 형식지는 복사해 나눠 줄 수 있어 널리 퍼뜨리기 쉽다
    ③ 내면화는 형식지가 다시 암묵지로 가는 단계다
    ④ 형식지는 문서로 남아 있으므로 조직의 지식 수준과 언제나 같다
    ④. 문서로 쌓여 있어도 아무도 읽지 않으면 조직의 것이 되지 않습니다. 그 문서를 익히는 내면화까지 돌아야 지식 수준이 올라갑니다.
데이터분석 준전문가 (ADsP) 시험 노트 전체 보기