데이터분석 준전문가 (ADsP)

데이터분석 준전문가 (ADsP) 시험 노트개념 정리19 MIN

빅데이터의 3V와 활용 기본 테크닉

빅데이터가 나온 배경과 Volume·Variety·Velocity, 정의를 세 관점으로 가르는 법을 정리합니다. 사전처리에서 사후처리로 이어지는 변화 네 가지와 활용 기본 테크닉 일곱 가지를 예와 함께 붙잡습니다.

앞 노트에서 데이터가 담기는 그릇을 봤습니다. 이번에는 그 그릇으로 감당이 안 되는 크기가 되었을 때 무엇이 달라지는지를 다룹니다. ADsP 1과목에서 3V와 변화 네 가지는 거의 매 회 나오는 자리이고, 활용 기본 테크닉 일곱은 이름과 예를 짝지어 고르게 하는 형태로 나옵니다. 테크닉은 3과목에서 기법으로 다시 만나므로, 여기서는 「무엇을 하는 기법인가」만 한 줄씩 붙잡아 둡니다.

빅데이터의 출현 배경

산업계의 변화

기업이 고객 한 사람의 행동을 낱낱이 기록하기 시작하면서 데이터의 양이 먼저 불었습니다. 매장 계산대의 판매 기록, 웹사이트의 클릭 기록, 휴대전화가 남기는 위치 기록이 그것입니다. 예전에는 「이번 달 몇 개 팔렸나」만 남았다면, 지금은 「누가 몇 시에 무엇을 보다가 사지 않고 나갔나」까지 남습니다.

학계의 변화

학문 쪽에서는 관측 장비가 뱉는 데이터가 사람이 읽을 수 있는 한계를 넘었습니다. 천문 관측, 유전체 해독, 기상 모형이 그런 자리입니다. 가설을 세우고 실험을 설계하던 방식만으로는 다 못 쓰는 데이터가 남았고, 그 데이터에서 거꾸로 규칙을 찾는 접근이 필요해졌습니다.

기술의 발전

앞의 둘이 수요라면 이쪽은 공급입니다. 저장 장치의 값이 꾸준히 내려갔고, 값싼 서버 여러 대를 묶어 한 덩어리처럼 쓰는 분산 처리 기술이 자리를 잡았으며, 클라우드가 생겨 장비를 사지 않고 빌려 쓸 수 있게 되었습니다. 데이터를 버리지 않고 쌓아 두는 쪽이 싸졌다는 것이 이 변화의 핵심입니다.

3V

빅데이터는 기존의 방식으로는 저장·관리·분석하기 어려운 규모의 데이터, 그리고 그것을 다루는 기술과 인재까지를 아우르는 말입니다. 크기를 재는 축이 셋이라 3V라 부릅니다.

축 무엇을 재나 무엇이 문제가 되나
Volume(규모) 데이터의 양 한 대에 담기지 않아 나눠 저장해야 한다
Variety(다양성) 데이터의 형태 정형뿐 아니라 반정형·비정형이 섞여 들어온다
Velocity(속도) 생성과 처리의 빠르기 쌓이는 속도가 빨라 실시간으로 처리해야 한다

Volume과 Variety

Volume은 그저 「크다」가 아니라 한 대의 장비에 담기지 않는다는 뜻으로 읽어야 합니다. 담기지 않으니 여러 대에 나눠 저장해야 하고, 나눠 저장했으니 계산도 나눠서 해야 합니다. 뒤에 나오는 분산 처리 기술이 전부 이 한 줄에서 나옵니다.

Variety는 형태가 여럿이라는 뜻입니다. 예전 시스템에 들어오던 것은 행과 열이 정해진 정형 데이터뿐이었는데, 지금은 웹 로그와 센서 기록 같은 반정형, 사진과 음성 같은 비정형이 함께 들어옵니다. 담는 그릇을 미리 짜 둘 수 없다는 것이 이 축의 어려움입니다.

Velocity

Velocity를 「분석이 빨라야 한다」로만 외우면 반쪽입니다. 데이터가 생기는 속도와 그것을 처리하는 속도 양쪽을 함께 가리킵니다. 초당 수천 건이 들어오는 결제 기록처럼 쌓이는 쪽이 빠른 경우가 있고, 부정 거래를 몇 밀리초 안에 걸러야 하는 경우처럼 처리 쪽이 급한 경우가 있습니다. 쌓아 두고 나중에 한꺼번에 도는 일괄 처리와, 들어오는 대로 흘려보내며 바로 처리하는 실시간 처리를 갈라 두는 것도 이 축입니다.

덧붙은 V

셋에 더 붙이는 V가 있습니다. 데이터가 실제로 쓸모를 내는가를 뜻하는 Value, 값을 믿을 수 있는가를 뜻하는 Veracity입니다. 셋에 하나를 더하면 4V, 둘을 더하면 5V라고 부르는데, 시험에서 「빅데이터의 3V」라고 물으면 답은 언제나 Volume·Variety·Velocity입니다. Value나 Veracity가 선택지에 섞여 있으면 그것이 오답 자리입니다.

정의의 세 관점

빅데이터라는 말을 정의하는 방식이 셋이고, 뒤로 갈수록 범위가 넓어집니다.

관점 무엇으로 정의하나
데이터 규모 기존 도구로는 수집·저장·분석이 어려운 크기의 데이터 자체
처리 기술 그 크기의 데이터에서 가치를 뽑아내는 기술까지 포함
인재와 조직 그 기술을 굴리는 사람과 조직 문화의 변화까지 포함

좁은 정의와 넓은 정의

가장 좁은 것이 규모 관점입니다. 「몇 테라바이트부터 빅데이터인가」라는 물음이 여기서 나오는데, 기준이 되는 숫자는 정해져 있지 않습니다. 같은 1테라바이트도 다루는 조직의 도구에 따라 크기도 하고 작기도 하기 때문입니다. 정의가 절대적인 크기가 아니라 「기존 방식으로 감당이 되는가」라는 상대적인 조건으로 적혀 있는 이유가 여기 있습니다. 그래서 선택지에 특정 용량이 숫자로 박혀 있으면 대개 그 자리가 오답입니다.

넓어지는 이유

기술과 인재까지 넣는 이유는, 데이터만 쌓아 두면 아무 일도 일어나지 않기 때문입니다. 저장은 했는데 꺼내 쓸 기술이 없거나, 기술은 들여왔는데 분석 결과를 의사결정에 쓰는 조직이 아니면 그 데이터는 비용으로만 남습니다. 세 관점을 묻는 문항은 「가장 넓은 정의는 무엇인가」 또는 「어느 관점의 설명인가」로 나옵니다.

변화 네 가지

빅데이터가 바꾼 것을 네 짝으로 정리합니다. 앞이 예전 방식이고 뒤가 지금 방식입니다.

사전처리에서 사후처리로

예전에는 쓸 데이터를 미리 정해 놓고 그것만 모았습니다. 저장이 비쌌기 때문입니다. 지금은 일단 다 모아 두고 나중에 필요한 것을 꺼내 씁니다. 무엇에 쓸지 정하기 전에 모은다는 것이 이 변화의 뜻입니다. 이 말이 「정제를 하지 않는다」는 뜻은 아닙니다. 정제하는 시점이 모으기 전에서 쓰기 직전으로 옮겨 간 것이고, 그래서 같은 원본에서 목적에 따라 다르게 가공한 결과를 여러 벌 만들 수 있게 되었습니다.

표본조사에서 전수조사로

예전에는 전체를 다 다룰 수 없어 일부를 뽑아 조사하고 거기서 전체를 미루어 짐작했습니다. 지금은 전체를 그대로 다룰 수 있게 되어 표본을 뽑는 단계 자체가 빠지는 경우가 생겼습니다. 표본조사가 사라졌다는 뜻이 아니라 전수조사가 가능해진 자리가 늘었다는 뜻입니다. 전수를 다루면 표본을 잘못 뽑아 생기는 치우침이 없어지고, 전체 중 아주 드물게 나타나는 사건도 눈에 들어옵니다. 표본에서는 그런 사건이 통째로 빠지기 쉽습니다.

질에서 양으로

값 하나하나를 정확하게 만드는 데 드는 비용보다, 값을 많이 모아 오차를 묻어 버리는 쪽이 싸진 자리가 있습니다. 결측이나 오타가 섞여 있어도 데이터가 충분히 많으면 전체의 경향은 흔들리지 않기 때문입니다. 「양이 질보다 늘 낫다」가 아니라 「양이 질을 어느 정도 대신할 수 있게 되었다」로 읽어야 합니다.

인과관계에서 상관관계로

예전에는 「왜 그런가」를 밝혀야 움직였습니다. 지금은 「무엇과 무엇이 함께 움직이는가」만 알아도 쓸 수 있는 자리가 많습니다. 어떤 검색어가 늘면 그 지역의 독감 환자도 는다는 사실은 원인을 몰라도 대비에 쓸 수 있습니다. 다만 상관관계만 보고 원인을 단정하면 틀리므로, 인과관계가 필요 없어졌다는 서술은 오답입니다.

활용 기본 테크닉

활용 기본 테크닉은 빅데이터에서 답을 꺼낼 때 쓰는 대표적인 방법 일곱 가지를 묶어 부르는 이름입니다. 3과목에서 기법으로 다시 만나므로 여기서는 「무엇을 묻는 기법인가」만 한 줄씩 붙잡아 둡니다.

일곱 가지

테크닉 무엇을 하나 예
연관규칙학습 함께 일어나는 것을 찾는다 기저귀를 산 사람이 맥주도 사는가
유형분석 대상을 비슷한 무리로 나눈다 고객을 구매 성향별로 묶는다
유전 알고리즘 조건에 맞는 답을 세대를 거듭해 찾는다 배송 차량의 최적 경로를 찾는다
기계학습 과거 데이터로 규칙을 학습해 예측한다 이 고객이 볼 만한 영화를 추천한다
회귀분석 변수들의 관계로 값을 설명하고 예측한다 광고비가 매출에 얼마나 영향을 주는가
감정분석 글에 담긴 태도를 가른다 후기가 긍정인가 부정인가
소셜네트워크 분석 관계망에서 영향력을 잰다 누가 가장 많이 연결된 사람인가

표에서 위의 넷은 데이터에서 규칙이나 무리를 찾아내는 쪽이고, 아래 셋은 값·글·관계망처럼 다루는 대상이 정해져 있는 쪽입니다. 이름만 외우면 예문을 만났을 때 고르지 못하므로, 오른쪽 예를 가리고 왼쪽 이름만 보며 예를 하나씩 지어 보는 편이 빠릅니다.

헷갈리는 짝

연관규칙학습과 유형분석이 자주 붙어 나옵니다. 연관규칙학습은 항목끼리 함께 나타나는가를 보고, 유형분석은 대상을 무리로 묶습니다. 묻는 것이 「무엇과 무엇이 같이 팔리나」면 앞쪽이고 「이 사람은 어느 무리인가」면 뒤쪽입니다.

회귀분석과 기계학습도 갈립니다. 회귀분석은 변수 사이의 관계를 식으로 드러내 설명까지 하려는 쪽이고, 기계학습은 설명보다 맞히는 것에 무게를 둡니다. 예문에 「얼마나 영향을 주는가」가 있으면 회귀분석, 「무엇을 추천할까」나 「어느 쪽으로 분류할까」가 있으면 기계학습으로 읽으면 대체로 맞습니다. 유전 알고리즘도 이름 탓에 기계학습과 섞이는데, 이쪽은 데이터로 규칙을 배우는 것이 아니라 가능한 답들을 조금씩 바꿔 가며 가장 나은 것을 골라 가는 최적화 기법입니다.

연습 문제

  1. 빅데이터의 3V에 해당하지 않는 것은?
    ① Volume
    ② Variety
    ③ Veracity
    ④ Velocity
    ③. Veracity는 값을 믿을 수 있는가를 뜻하며 나중에 덧붙은 V입니다. 3V는 Volume·Variety·Velocity입니다.
  2. 다음 설명에 해당하는 빅데이터 정의의 관점은?
    「데이터를 다룰 사람과 그것을 의사결정에 쓰는 조직 문화까지 포함해 정의한다」
    ① 데이터 규모 관점
    ② 처리 기술 관점
    ③ 인재와 조직 관점
    ④ 저장 매체 관점
    ③. 셋 중 가장 넓은 정의입니다. ①은 데이터 자체의 크기만, ②는 거기에 기술까지만 넣습니다. ④는 세 관점에 없는 이름입니다.
  3. 빅데이터가 가져온 변화로 옳지 않은 것은?
    ① 사전처리에서 사후처리로
    ② 표본조사에서 전수조사로
    ③ 상관관계에서 인과관계로
    ④ 질보다 양으로
    ③. 방향이 뒤집혔습니다. 원인을 밝히지 않아도 함께 움직이는 것만 알면 쓸 수 있는 자리가 늘었다는 뜻에서 인과관계에서 상관관계로 갑니다.
  4. 「기저귀를 산 고객이 맥주도 함께 사는지」를 알아보려 한다. 알맞은 테크닉은?
    ① 유형분석
    ② 연관규칙학습
    ③ 감정분석
    ④ 유전 알고리즘
    ②. 항목이 함께 나타나는 규칙을 찾는 기법입니다. ①은 대상을 무리로 묶는 것이고, ④는 조건에 맞는 답을 세대를 거듭해 찾는 최적화 기법입니다.
  5. 활용 기본 테크닉과 예의 짝으로 옳지 않은 것은?
    ① 소셜네트워크 분석 — 관계망에서 영향력이 큰 사람 찾기
    ② 감정분석 — 후기가 긍정인지 부정인지 가르기
    ③ 회귀분석 — 광고비가 매출에 주는 영향 재기
    ④ 유형분석 — 배송 차량의 최적 경로 찾기
    ④. 최적 경로 찾기는 유전 알고리즘 쪽입니다. 유형분석은 대상을 비슷한 무리로 나누는 기법입니다.
  6. 빅데이터의 출현 배경으로 보기 어려운 것은?
    ① 저장 장치 값이 내려가 데이터를 버리지 않고 쌓게 되었다
    ② 값싼 서버를 묶어 쓰는 분산 처리 기술이 자리를 잡았다
    ③ 클라우드가 생겨 장비를 사지 않고 빌려 쓸 수 있게 되었다
    ④ 기업이 수집하는 데이터의 종류를 법으로 넓혔다
    ④. 배경은 수요(고객 행동과 관측 장비가 남기는 기록의 증가)와 공급(저장 비용 하락, 분산 처리, 클라우드) 양쪽의 변화이고, 수집 범위를 넓히는 법 제도는 그 목록에 없습니다.
데이터분석 준전문가 (ADsP) 시험 노트 전체 보기