데이터분석 준전문가 (ADsP) 시험 노트과목 총정리27 MIN
ADsP 3과목 데이터 분석 총정리
3과목 데이터 분석의 계획 주제 열여덟을 차례 그대로 훑는 복습용입니다. R 문법과 출력 읽기, 전처리와 확률·검정, 회귀와 시계열, 마이닝과 모형 평가를 표로 갈라 두고 연습 문제 일곱으로 확인합니다.
3과목 「데이터 분석」은 필기 50문항 중 30문항, 60점입니다. 이 글은 그 범위를 계획 차례대로 한 번에 훑는 복습용입니다. 주제마다 파고드는 노트는 따로 옵니다.
R 자료 구조와 문법
자료 구조는 차원과 자료형으로 갈립니다.
| 구조 | 차원 | 자료형 | 만드는 함수 |
|---|---|---|---|
| 벡터 | 1차원 | 한 가지 | c() |
| 행렬 | 2차원 | 한 가지 | matrix() |
| 배열 | n차원 | 한 가지 | array() |
| 데이터프레임 | 2차원 | 열마다 다름 | data.frame() |
| 리스트 | 1차원 | 무엇이든 | list() |
벡터에 다른 자료형을 섞으면 논리형 → 숫자형 → 문자형 순으로 끌려가는 강제 형 변환이 일어나고
as.numeric()으로 되돌립니다. 인덱싱은 v[2]가 벡터 원소, L[2]가 부분 리스트,
L[[2]]는 그 자리에 든 것 자체이며 df$age는 열입니다. 제어문은 if·for·while,
함수는 f <- function(x) { ... }, 파일은 read.csv()·write.csv(), 패키지는
install.packages()·library()입니다. apply 계열은 반복문을 대신해
apply(m, 1, f)가 행마다, apply(m, 2, f)가 열마다 적용하고 lapply()는 언제나 리스트,
sapply()는 가능하면 벡터로 줄여 돌려주며 tapply()는 그룹으로 나눠 적용합니다.
R 코드와 출력 결과 읽기
str()은 구조와 자료형을, summary()는 숫자형이면 사분위수까지·factor면 수준별 빈도를,
head()는 앞 여섯 행을, table()은 빈도표를 냅니다. factor는 정해진 수준 중 하나를
담는 범주형이라 끝에 Levels: 줄이 붙고 숫자처럼 보여도 산술이 안 됩니다. m[1, ]처럼 한
행만 꺼내면 차원이 떨어지는데 이것이 drop이고 drop = FALSE로 막고, NA가 끼면
mean()이 NA를 내므로 na.rm = TRUE를 붙입니다.
데이터 마트와 전처리
데이터 마트는 한 분석 목적에 맞춰 필요한 항목만 모아 둔 작은 저장소로, 전사 자료를 쌓아 둔 데이터 웨어하우스에서 쓸 부분만 뗀 것입니다.
| 요약변수 | 파생변수 | |
|---|---|---|
| 만드는 법 | 원자료를 집계 | 조건과 의미를 넣어 정의 |
| 예 | 최근 3개월 구매 횟수 | 주말 구매 비율로 매긴 「주말형 고객」 |
패키지는 하는 일로 외웁니다 — reshape의 melt()는 넓은 표를 세로로 녹이고
cast()는 다시 굳히며, plyr의 ddply()는 그룹으로 갈라 함수를 적용하며, sqldf는 SQL
문으로, data.table은 큰 자료를 빠르게 다룹니다. 표는 merge()(키로)·rbind()(행)·
cbind()(열)로 붙입니다.
결측값은 왜 비었는지부터 가릅니다 — MCAR는 다른 변수와 무관한 완전 무작위 결측,
MAR는 관측된 다른 변수로 설명되는 결측, NMAR는 이유가 그 값 자체에 있는 결측입니다.
is.na()는 원소마다, complete.cases()는 행이 온전한지를 냅니다. 채우는 법은 완전분석법(행을
뺀다)·평균대치법(대푯값으로)·단순확률대치법(분포에서 뽑은 값으로)이고, 다중대치법은
대치·분석·결합 세 단계로 여러 벌을 만들어 합칩니다.
이상값 기준은 둘 — 평균에서 표준편차 3배를 넘는지 보는 ESD와 사분위수로 잰 경계 밖인지 보는 규칙이고, 뒤쪽이 상자그림 수염 밖의 점입니다.
이상값이라고 반드시 버리지 않습니다 — 입력 오류면 고치고 실제 값이면 남기며, 이상거래 탐지에서는 그것이 찾는 대상입니다.
표본과 기술통계량
모수는 모집단의 성질을 나타내는 값, 통계량은 표본에서 계산한 값이고 이것으로 모수를 추측하는 것이 추정입니다. 추출은 넷 — 단순랜덤(조건 없이), 계통(번호를 매겨 일정 간격마다), 층화(비슷한 층으로 나눠 층마다), 집락(집단 몇 개를 통째로)입니다. 층화는 나눈 집단 안에서 뽑고 집락은 나눈 집단 자체를 뽑습니다.
척도도 넷 — 명목은 구분만 하고(혈액형), 순서는 순서만 있으며(학점), 구간은 간격이 같으나 절대 영점이 없고(섭씨 온도), 비율은 절대 영점이 있어 배수가 성립합니다(매출액). 앞의 둘이 질적 자료, 뒤의 둘이 양적 자료입니다. 중심은 평균·중앙값·최빈값, 퍼짐은 분산·표준편차·사분위수 범위, 모양은 왜도(오른쪽 꼬리가 길면 양수이고 평균이 중앙값보다 큽니다)와 첨도(뾰족한 정도)로 재고, 히스토그램으로 모양을 상자그림으로 사분위수와 이상값을 봅니다.
확률과 확률분포
가 조건부확률이고 이면 독립입니다. 결과를 보고 원인을 거꾸로 추측하는 것이 베이즈 정리입니다.
확률변수는 사건에 수를 대응시킨 것이고 평균이 기대값 , 흩어짐이 입니다.
| 확률분포 | 쓰는 자리 |
|---|---|
| 이항 | 시행 n번의 성공 횟수. 평균 , 분산 |
| 포아송 | 드물게 나는 사건 수. 평균과 분산이 같다 |
| 정규 | 종 모양. 표준화하면 평균 0·분산 1인 표준정규분포 |
| t | 모분산을 모를 때의 평균 검정. 자유도가 크면 정규에 가깝다 |
| 카이제곱 | 분산 검정과 적합도·독립성 검정 |
| F | 두 분산의 비. 분산분석과 회귀의 F검정 |
중심극한정리는 모집단 모양과 상관없이 표본이 커지면 표본평균의 분포가 정규분포에 가까워진다는 정리이고, 흩어짐은 표준오차 으로 잽니다.
추정과 가설검정
값 하나면 점추정, 구간이면 구간추정이고 신뢰구간 은 신뢰수준을 높이거나 표본이 작으면 넓어집니다. 가설검정은 「차이가 없다」는 귀무가설과 그 반대인 대립가설을 세워 귀무가설을 버릴 증거가 있는지 봅니다.
| 내린 결정 | 귀무가설이 참 | 귀무가설이 거짓 |
|---|---|---|
| 기각한다 | 1종 오류(확률 ) | 옳은 판단(검정력 ) |
| 기각하지 않는다 | 옳은 판단 | 2종 오류(확률 ) |
유의수준은 1종 오류를 얼마까지 감수할지 미리 정한 값이고 그 극단 영역이 기각역입니다. p값은 귀무가설이 맞다고 할 때 관측만큼 극단적인 결과가 나올 확률이라 유의수준보다 작으면 기각하며, 「귀무가설이 참일 확률」로 읽는 보기가 오답으로 자주 나옵니다. 방향까지 주장하면 단측검정, 다르다고만 하면 양측검정이고 같은 자료라도 단측의 p값이 절반입니다.
평균과 범주를 비교하는 검정
t검정은 셋 — 일표본은 한 집단의 평균이 기준값과 같은지, 대응표본은 같은 대상의 전후 차가 0인지, 독립표본은 두 집단의 평균이 같은지를 봅니다. 집단이 셋 이상이면 t검정을 되풀이할수록 1종 오류가 쌓이므로 일원배치 분산분석으로 집단 간 변동을 집단 내 변동으로 나눈 F 통계량을 봅니다.
분산분석표는 요인·자유도·제곱합·평균제곱·F 순으로 읽고, 요인이 둘이면 이원배치라 교호작용도 봅니다. 어느 쌍이 다른지는 사후검정(튜키·던컨)으로 가립니다. 범주형끼리는 하나로 셋을 하는데, 기대분포에 맞는지 보면 적합도, 한 표본에서 두 변수가 무관한지 보면 독립성, 여러 모집단의 분포가 같은지 보면 동질성입니다.
회귀분석
최소제곱법은 잔차 제곱합이 가장 작아지는 직선을 고르고, 기울기는 「설명변수가 1 늘 때 종속변수의 변화량」이며 그 계수가 0인지를 t검정으로 봅니다.
SST는 평균에서 흩어진 전체 변동, SSR은 회귀식이 설명한 몫, SSE는 남은 잔차입니다. 모형 전체는 F검정으로 보고 단순회귀의 결정계수는 상관계수의 제곱입니다. 다중회귀의 계수는 「나머지를 고정했을 때」의 변화량이고, 변수를 더해도 는 줄지 않으므로 수정 결정계수로 비교하며 벌점을 붙인 AIC·BIC는 작을수록 좋습니다. 변수 선택은 전진선택·후진제거·단계적 선택 셋, 잔차의 가정은 선형성·독립성·등분산성·정규성 넷이고 독립성은 더빈-왓슨 통계량이 2에 가까운지로 봅니다. 설명변수끼리 얽혀 계수 추정이 흔들리는 다중공선성은 분산팽창요인으로 봅니다.
는 그 변수를 나머지로 회귀한 결정계수이고 5나 10을 넘으면 변수를 뺍니다.
상관분석과 차원 축소
공분산은 두 변수가 함께 움직이는 정도인데 단위에 따라 값이 달라져, 두 표준편차로 나눠 과 사이로 맞춘 것이 상관계수입니다. 피어슨은 양적 변수의 직선 관계를, 스피어만은 값을 순위로 바꿔 재 순서척도에도 씁니다. 상관계수가 0에서 유의하게 떨어졌는지는 t검정으로 보고, 0에 가까우면 직선 관계가 없다는 뜻일 뿐입니다.
주성분분석은 정보를 가장 많이 담는 새 축을 차례로 찾아 차원을 줄입니다. 축의 방향이 고유벡터, 설명하는 분산이 고유값이고, 몇 개를 남길지는 고유값을 큰 순으로 찍은 스크리 산점도가 꺾이는 자리나 누적기여율로 고릅니다. 변수 뒤에 숨은 공통 요인을 찾는 요인분석은 축이 대등하고, 주성분은 차원 축소라 축에 순서가 있습니다. 다차원척도법은 개체 사이 거리만으로 그것을 가장 잘 살리는 2·3차원 좌표를 찾고, 어긋난 정도인 스트레스 값이 0에 가까울수록 잘 맞습니다.
시계열 분석
정상성은 셋 — 평균과 분산이 일정하고 공분산이 시점이 아니라 시차에만 의존합니다. 평균이 변하면 차분을, 분산이 변하면 로그 변환을 해 정상으로 만듭니다. 분해는 추세·계절·순환·불규칙 넷이고 계절은 주기가 고정된 짧은 반복, 순환은 주기가 들쭉날쭉한 긴 파동입니다. 백색잡음은 평균 0에 분산이 일정하고 상관이 없는 잡음이라 잔차가 백색잡음이면 모형이 잘 맞은 것입니다.
| 모형 | 무엇으로 설명하는가 | 판별 |
|---|---|---|
| AR(p) | 과거의 관측값 | PACF가 p 시점 뒤 끊긴다 |
| MA(q) | 과거의 오차항 | ACF가 q 시점 뒤 끊긴다 |
| ARMA(p, q) | 둘 다 | 둘 다 서서히 줄어든다 |
| ARIMA(p, d, q) | 위에 차분 d를 더한 것 | d번 차분하면 정상이 된다 |
자기상관함수 ACF는 시차마다의 상관을, 부분자기상관함수 PACF는 중간 시차의 영향을 걷어낸 상관을 봅니다. 다듬기만 하는 방법은 최근 몇 개의 평균을 쓰는 이동평균법과 최근 값에 큰 가중치를 두는 지수평활법입니다.
데이터 마이닝의 틀
목적으로 가르면 분류·추정·예측·연관·군집·기술 여섯이고, 앞의 셋은 정답이 붙은 자료로 배우는 지도학습, 연관과 군집은 비지도학습, 기술은 요약입니다. 추진 5단계는 목적 정의 → 데이터 준비 → 가공 → 기법 적용 → 검증입니다. 자료는 훈련용·검증용·평가용으로 나누고, 훈련 자료에만 지나치게 맞아 새 자료에서 성능이 떨어지면 과적합, 아예 못 맞히면 과소적합입니다. 나누는 방법은 한 번 갈라 쓰는 홀드아웃, k조각을 번갈아 검증에 쓰는 k-겹 교차검증(k-fold), 복원추출로 여러 벌 만드는 부트스트랩입니다.
분류 모형
로지스틱 회귀는 성공확률 p 대신 오즈 에 로그를 씌운 로짓을 직선으로 놓습니다.
이 식을 p에 대해 풀면 S자를 그리는 시그모이드 함수가 되고, 계수에 지수를 씌운 이 오즈비라 설명변수가 1 늘면 오즈가 그만큼 곱해집니다. 의사결정나무는 뿌리마디에서 갈라져 끝마디에 답을 다는 모형이고, 자를 자리는 불순도가 가장 많이 줄어드는 곳입니다 — CART는 지니 지수로 이진 분리, C4.5는 엔트로피로 잰 정보 획득비, CHAID는 카이제곱 통계량으로 다지 분리를 씁니다. 더 자를지 멈출지가 정지 규칙, 다 키운 뒤 쓸모없는 가지를 자르는 것이 가지치기입니다. 인공신경망은 입력에 가중치를 곱해 활성화함수를 통과시키는 퍼셉트론을 층으로 쌓고, 오차를 뒤로 흘려 가중치를 고치는 역전파로 배웁니다.
| 기법 | 한 줄 |
|---|---|
| 배깅 | 복원추출 표본으로 여러 모형을 병렬로 만들어 투표 |
| 부스팅 | 틀린 관측값에 가중치를 얹어 순차로 보완 |
| 랜덤 포레스트 | 배깅에 변수까지 무작위로 골라 상관을 낮춘 것 |
| 나이브 베이즈 | 변수끼리 독립이라 가정해 확률을 곱하는 분류 |
| k-최근접이웃 | 가까운 k개의 다수결. 학습 단계가 없다 |
| 서포트 벡터 머신 | 두 집단 사이 여백이 가장 넓은 경계를 찾는다 |
모형 평가
분류 성능은 실제와 예측을 교차한 혼동행렬에서 나옵니다.
| 예측 양성 | 예측 음성 | |
|---|---|---|
| 실제 양성 | TP | FN |
| 실제 음성 | FP | TN |
정분류율은 을 전체로 나눈 값, 1에서 뺀 것이 오분류율입니다.
정밀도는 양성이라 한 것 중, 재현율은 실제 양성 중 맞은 비율이라 분모가 다르고, 둘의 조화평균이 F1 점수입니다. 양성이 드물면 전부 음성이라 해도 정분류율이 높으니 그것만 보면 안 됩니다. ROC 곡선은 기준값을 옮겨 가며 재현율을 세로축에, 1에서 특이도를 뺀 값을 가로축에 찍고, 그 아래 넓이 AUC가 0.5면 찍는 것과 같습니다. 예측 확률 순으로 줄 세워 상위 몇 %에 양성이 몰렸는지 보면 향상도 곡선, 그것을 구간별 표로 정리하면 이익도표입니다.
군집분석
정답 없이 묶으므로 「비슷하다」를 재는 자가 먼저 필요합니다.
| 측도 | 무엇 |
|---|---|
| 유클리드 거리 | 두 점을 잇는 직선 길이 |
| 맨해튼 거리 | 축을 따라 잰 거리의 합 |
| 민코프스키 거리 | 위 둘을 차수 으로 일반화. 1이면 맨해튼, 2면 유클리드 |
| 마할라노비스 거리 | 분산과 상관을 반영해 표준화한 거리 |
| 자카드 계수 | 이진 자료에서 한쪽이라도 1인 것 중 둘 다 1인 비율 |
| 코사인 유사도 | 두 벡터가 이루는 각도. 문서 비교에 쓴다 |
계층적 군집은 가까운 것부터 묶어 덴드로그램을 그리고 자를 높이는 나중에 고릅니다. 군집 사이 거리는 최단(가까운 쌍)·최장(먼 쌍)·평균(모든 쌍)·중심(중심끼리) 연결법으로 재고, 와드연결법은 묶었을 때 오차제곱합이 가장 적게 느는 쌍을 고릅니다. k-평균 군집은 중심 k개를 잡아 각 점을 가까운 중심에 배정하고 중심을 다시 계산하기를 되풀이합니다. 빠르지만 k를 미리 정해야 하고 초기 중심과 이상값에 흔들리며, 잘 나뉘었는지는 실루엣 계수로 봅니다. 혼합분포군집은 자료를 여러 정규분포가 섞인 것으로 보고 EM 알고리즘으로 그 분포를 찾고, 자기조직화지도 SOM은 고차원 자료를 2차원 격자에 옮깁니다.
연관분석
장바구니처럼 함께 일어나는 항목에서 「A를 사면 B도 산다」는 연관규칙을 뽑습니다.
향상도가 1이면 독립, 1보다 크면 양의 관계, 작으면 음의 관계입니다. 항목이 늘면 후보가 폭발하므로 Apriori 알고리즘은 「빈발하지 않은 집합의 상위 집합도 빈발하지 않다」로 후보를 쳐내고, FP-Growth는 트리로 압축해 후보 없이 찾아 더 빠릅니다. 순서까지 따져 「A를 산 뒤 B를 산다」를 찾으면 순차패턴 분석입니다. 조건 없이 규칙이 나오고 계산이 단순한 것이 장점, 품목이 늘면 계산이 급격히 불고 드문 품목은 규칙에 못 오르는 것이 단점입니다.
연습 문제
x <- c(1, 2, NA, 4)일 때mean(x)와sapply(list(1:3, 4:6), sum)이 내는 것은?
① NA, 벡터
② 2.33, 벡터
③ NA, 리스트
④ 2.33, 리스트①. NA가 끼면mean()은 NA를 내고 2.33은na.rm = TRUE를 붙였을 때입니다.sapply()는 가능하면 벡터로 줄이므로 리스트가 필요하면lapply()입니다.유병률 2%인 병에서 걸린 사람이 양성일 확률이 90%, 걸리지 않은 사람이 양성일 확률이 5%입니다. 양성인 사람이 실제로 병에 걸렸을 확률에 가장 가까운 것은?
① 0.02
② 0.27
③ 0.50
④ 0.90②. 양성이 나오는 경로가 과 둘이므로 입니다.세 집단에서 5개씩 15개를 관측했고 집단 간 제곱합이 120, 집단 내 제곱합이 72입니다. 일원배치 분산분석의 F 값은?
① 1.67
② 6
③ 10
④ 20③. 자유도가 2와 12라 평균제곱이 과 이고 입니다. ①은 제곱합끼리 나눈 값, ④는 분자만 제곱합으로 둔 값입니다.회귀제곱합이 180, 잔차제곱합이 60인 단순회귀모형의 결정계수는?
① 0.25
② 0.33
③ 0.75
④ 3③. 총제곱합이 이므로 입니다. ①은 , ②는 , ④는 입니다.어떤 시계열의 ACF는 시차가 늘수록 서서히 줄기만 하는데 PACF는 시차 2 뒤로 끊깁니다. 어느 모형인가?
① AR(2)
② MA(2)
③ ARMA(2, 2)
④ 백색잡음①. PACF가 끊기는 자리가 AR의 차수입니다. ②면 ACF가 끊기고, ③이면 둘 다 서서히 줄며, ④는 어느 시차에서도 상관이 없습니다., , , 인 분류 모형의 정밀도와 특이도는?
① 정밀도 0.60, 특이도 0.75
② 정밀도 0.75, 특이도 0.60
③ 정밀도 0.75, 특이도 0.98
④ 정밀도 0.98, 특이도 0.75③. 와 입니다. 0.60은 재현율 이라 두 자리 어디에도 올 수 없습니다.전체 400건 중 커피가 든 거래 120건, 케이크가 든 거래 80건, 둘 다 든 거래 60건입니다. 규칙 「커피 → 케이크」의 지지도와 향상도는?
① 지지도 0.15, 향상도 0.5
② 지지도 0.15, 향상도 2.5
③ 지지도 0.50, 향상도 2.5
④ 지지도 0.20, 향상도 3②. 지지도 , 신뢰도 , 케이크가 든 비율 라 향상도는 입니다. ③은 신뢰도를 지지도 자리에 쓴 것입니다.

