데이터분석 준전문가 (ADsP)

데이터분석 준전문가 (ADsP) 시험 노트모의고사23 MIN

ADsP 모의고사 1회

실제 시험과 같은 1 : 1 : 3 과목 비중으로 직접 만든 20문항입니다. 계산 여섯 문제와 R 코드 두 문제는 풀이 과정까지 적었고, 답은 문제를 눌러야 펼쳐집니다.

ADsP 출제 범위에 맞춰 직접 만든 20문항입니다. 실제 필기시험은 객관식 50문항이고 과목별로 데이터 이해 10문항, 데이터분석 기획 10문항, 데이터분석 30문항이 나옵니다. 이 한 벌도 같은 1 : 1 : 3 비중을 옮겨 4 · 4 · 12로 나눴고, 계산이 필요한 문제 여섯과 R 코드를 읽는 문제 둘이 들어 있습니다. 답은 문제를 눌러야 펼쳐지니 먼저 풀어 보세요.

한 문항을 5점으로 세면 100점 만점이라 실제 배점과 눈금이 같아집니다. 합격은 총점 60점 이상이면서 어느 과목도 40% 아래로 떨어지지 않는 것이니, 이 벌에서는 12문항이 총점 선이고 1·2과목은 2문항, 3과목은 5문항이 과락선입니다. 3과목은 12문항의 40%가 4.8문항이라 5문항부터 통과입니다.

1과목 데이터의 이해

  1. 어느 카페는 아메리카노를 3,500원에, 길 건너 카페는 3,000원에 팝니다. 다음 중 지혜(wisdom)에 해당하는 진술은?
    ① 두 카페의 아메리카노 가격은 각각 3,500원과 3,000원이다
    ② 길 건너 카페의 아메리카노가 500원 더 싸다
    ③ 아메리카노는 길 건너 카페에서 사야겠다
    ④ 길 건너 카페는 라떼와 차도 더 쌀 것이다
    ④. DIKW 피라미드는 데이터, 정보, 지식, 지혜의 네 층으로 앎의 단계를 나눈 틀입니다. 지혜는 지식에 근본 원리를 더해 관찰하지 않은 상황까지 넓힌 판단이라, 가격을 보지 않은 다른 메뉴로 넘어간 ④가 여기에 해당합니다. ①은 가공 전의 값이라 데이터, ②는 비교해 얻은 의미라 정보, ③은 그 정보로 내린 행동 판단이라 지식입니다.
  2. 다음 중 반정형 데이터로만 묶인 것은?
    ① XML 문서와 웹 서버 접속 로그
    ② 관계형 데이터베이스의 테이블과 스프레드시트
    ③ 동영상 파일과 통화 녹음
    ④ SNS 게시글 본문과 스캔한 계약서 이미지
    ①. 반정형 데이터는 태그나 키처럼 값의 뜻을 알려 주는 구조가 함께 들어 있지만, 행과 열이 미리 정해진 스키마는 없는 데이터입니다. ②는 스키마가 고정된 정형 데이터이고, ③과 ④는 그런 구조 정보가 없는 비정형 데이터입니다.
  3. 다음 중 빅데이터 시대의 위기 요인과 통제 방안을 잘못 연결한 것은?
    ① 사생활 침해 — 정보 제공자에게 동의를 받는 방식에서 정보 사용자에게 책임을 지우는 방식으로 전환
    ② 책임 원칙 훼손 — 예측 결과가 아니라 실제 행동한 결과에 책임을 묻는 원칙 적용
    ③ 데이터 오용 — 알고리즘을 해석하고 피해자의 부당함을 대변하는 전문가 활용
    ④ 데이터양의 증가 — 수집한 데이터의 보관 주기를 짧게 줄여 총량을 억제
    ④. 흔히 꼽는 위기 요인은 사생활 침해, 책임 원칙 훼손, 데이터 오용 셋입니다. 데이터양이 늘어나는 것 자체는 위기 요인이 아니라 빅데이터의 전제 조건입니다. ①~③은 각 요인에 대응하는 통제 방안으로 그대로 짝이 맞습니다.
  4. 다음 중 데이터 사이언티스트의 소프트 스킬에 해당하는 것은?
    ① 분산 컴퓨팅 환경에서 대용량 데이터를 처리하는 능력
    ② 분석 모형의 최적화 이론과 알고리즘에 대한 지식
    ③ 분석 결과를 이해관계자가 납득하도록 전달하는 스토리텔링 능력
    ④ 데이터를 정제하고 변환하는 프로그래밍 능력
    ③. 소프트 스킬은 통찰력, 협업, 전달력처럼 도구로 배울 수 없는 쪽을 가리킵니다. ①·②·④는 이론과 도구를 익혀 얻는 하드 스킬입니다.

2과목 데이터 분석 기획

  1. 무엇을 분석할지도 어떻게 분석할지도 정하지 못한 상태에서, 가진 데이터를 먼저 훑어보며 규칙과 문제를 찾아 나가는 접근 방식은?
    ① 하향식 접근
    ② 상향식 접근
    ③ 폭포수 방법론
    ④ 나선형 방법론
    ②. 상향식 접근은 대상이 정해지지 않은 상태에서 데이터에서 출발해 문제를 발견합니다. ①은 문제가 먼저 주어지고 이를 구조화해 해결책을 찾는 방식이며, ③과 ④는 접근 방식이 아니라 개발 방법론입니다.
  2. 분석 과제를 시급성과 난이도 두 기준으로 나눌 때, 일반적으로 가장 먼저 착수하는 과제는?
    ① 시급성이 현재이고 난이도가 어려운 과제
    ② 시급성이 현재이고 난이도가 쉬운 과제
    ③ 시급성이 미래이고 난이도가 쉬운 과제
    ④ 시급성이 미래이고 난이도가 어려운 과제
    ②. 지금 필요하면서 지금 할 수 있는 것이 가장 먼저입니다. ④는 지금 필요하지도 않고 하기도 어려우므로 가장 나중이고, ①과 ③은 그 사이라 조직의 여력에 따라 순서가 갈립니다.
  3. 전사의 분석 인력을 한 조직에 모아 두고 현업 부서는 필요할 때 분석을 요청하는 형태입니다. 분석 역량을 모으기는 좋지만 현업이 체감하는 우선순위와 어긋나기 쉬운 이 조직 구조는?
    ① 집중 구조
    ② 기능 구조
    ③ 분산 구조
    ④ 매트릭스 구조
    ①. 집중 구조는 별도의 분석 전담 조직이 전사 과제를 모아 수행합니다. ②는 분석 인력이 각 현업 부서 안에 있어 전사 관점이 약해지는 형태, ③은 분석 인력을 현업에 배치하되 전사 조직이 함께 관리하는 형태입니다. ④는 일반 조직 이론의 이름이라 분석 조직 구조 셋에 들어가지 않습니다.
  4. 분석 성숙도 진단에서 어떤 조직을 '확산' 단계로 볼 수 있는 모습은?
    ① 일부 부서가 분석 도구를 들여와 시험해 보고 있다
    ② 담당자가 자기 업무에 분석 결과를 활용하기 시작했다
    ③ 전사 차원에서 분석 조직과 데이터를 함께 관리하며 공유하고 있다
    ④ 분석 결과를 바탕으로 사업 모델 자체를 바꾸고 있다
    ③. 성숙도는 도입, 활용, 확산, 최적화 순으로 올라갑니다. ①은 도입, ②는 활용, ④는 최적화에 해당하고, 확산은 개별 부서를 넘어 전사가 분석을 관리·공유하는 단계입니다.

3과목 데이터 분석

  1. 데이터 마트를 만들 때 쓰는 R 도구에 대한 설명으로 옳지 않은 것은?
    ① reshape 패키지의 melt는 여러 열에 흩어진 값을 변수 이름과 값 두 열로 녹여 긴 형태로 바꾼다
    ② reshape 패키지의 cast는 긴 형태의 데이터를 행과 열로 펼쳐 넓은 형태로 되돌린다
    ③ sqldf 패키지는 데이터프레임을 테이블처럼 두고 SQL 문으로 조회하게 해 준다
    ④ plyr 패키지의 ddply는 데이터를 집단별로 나누지 않고 전체에 함수를 한 번만 적용한다
    ④. plyr은 데이터를 기준 열로 쪼개고, 조각마다 함수를 적용하고, 결과를 다시 합치는 흐름을 한 함수에 담은 패키지입니다. ddply는 데이터프레임을 받아 데이터프레임을 돌려주는 함수라 집단별 계산이 바로 그 쓰임입니다. ①과 ②는 melt와 cast가 서로 반대 방향이라는 설명이라 맞고, ③도 sqldf의 쓰임 그대로입니다.
  2. 어느 콜센터의 하루 응대 건수는 평균 120건, 표준편차 15건입니다. 평균에서 표준편차의 세 배를 벗어난 값을 이상값으로 보는 ESD 방법을 쓸 때, 이상값으로 판정되는 구간은?
    ① 105 미만이거나 135 초과
    ② 90 미만이거나 150 초과
    ③ 75 미만이거나 165 초과
    ④ 115 미만이거나 125 초과
    ③. ESD(Extreme Studentized Deviation)는 평균에서 표준편차의 세 배 떨어진 지점을 경계로 삼는 이상값 검출법입니다. 아래쪽은 120−3×15=75120 - 3 \times 15 = 75, 위쪽은 120+3×15=165120 + 3 \times 15 = 165 이므로 75 미만이거나 165를 넘는 날이 이상값입니다. ①은 표준편차를 한 배만, ②는 두 배만 쓴 것이고, ④는 세 배를 곱하는 대신 셋으로 나눈 것입니다.
  3. 다음 R 코드의 실행 결과는?
    a <- data.frame(id = c(1, 2, 3), x = c(10, 20, 30))
    b <- data.frame(id = c(2, 3, 4), y = c("p", "q", "r"))
    nrow(merge(a, b))
    ① 2
    ② 3
    ③ 4
    ④ 9
    ①. merge는 두 데이터프레임에 공통으로 있는 열을 키로 삼아 붙이고, 옵션을 주지 않으면 양쪽에 모두 있는 키만 남깁니다. 공통 열은 id이고 양쪽에 다 있는 값은 2와 3뿐이라 결과는 2행입니다. ②는 all.x = TRUE로 왼쪽을 다 남겼을 때, ③은 all = TRUE로 양쪽을 다 남겨 id가 1~4가 된 경우, ④는 키를 무시하고 모든 조합을 만들었을 때입니다.
  4. 다음 R 코드의 실행 결과는?
    scores <- c(90, 76, 60, 86)
    mean(scores[scores >= 75])
    ① 78
    ② 84
    ③ 252
    ④ NA
    ②. scores >= 75는 각 원소마다 참·거짓을 담은 논리 벡터를 만들고, 대괄호 안에 넣으면 참인 자리만 남습니다. 남는 값은 90, 76, 86이라 평균은 2523=84\frac{252}{3} = 84 입니다. ①은 걸러내지 않은 네 값의 평균, ③은 평균이 아니라 합, ④는 결측값이 없으므로 나올 수 없습니다.
  5. 다음 중 변수와 척도의 연결이 옳지 않은 것은?
    ① 고객의 혈액형 — 명목척도
    ② 영화 평점(별 1개부터 5개까지) — 순서척도
    ③ 섭씨로 잰 기온 — 비율척도
    ④ 지난달 결제 금액 — 비율척도
    ③. 비율척도는 0이 '없음'을 뜻하는 절대 영점을 가져야 배와 나눗셈이 성립합니다. 섭씨 0도는 온도가 없다는 뜻이 아니라 눈금의 한 지점일 뿐이므로 구간척도입니다. ①은 구분만 하는 값이라 명목, ②는 순서는 있어도 간격이 같지 않아 순서, ④는 0원이 곧 '지출 없음'이라 비율척도가 맞습니다.
  6. 전국 매장 500곳을 수도권·영남·호남·충청 네 지역으로 나눈 뒤, 각 지역이 전체에서 차지하는 매장 수 비율에 맞춰 총 50곳을 무작위로 뽑았습니다. 이 표본추출 방법은?
    ① 단순임의추출
    ② 계통추출
    ③ 층화추출
    ④ 군집추출
    ③. 층화추출은 모집단을 성질이 비슷한 집단으로 나눈 뒤 각 집단 안에서 따로 뽑는 방법입니다. ①은 500곳 전체에서 그냥 50곳을 뽑는 것, ②는 번호를 매겨 일정 간격으로 뽑는 것, ④는 지역 몇 개를 통째로 골라 전수조사하는 것입니다.
  7. 어느 시험의 점수에서 64명을 뽑아 표본평균 82점을 얻었습니다. 모표준편차가 16으로 알려져 있을 때, 모평균에 대한 95% 신뢰구간은? (표준정규분포에서 95%에 해당하는 값은 1.96)
    ① (78.08, 85.92)
    ② (78.71, 85.29)
    ③ (50.64, 113.36)
    ④ (80.00, 84.00)
    ①. 표준오차는 표본평균이 흩어진 정도라 1664=168=2\frac{16}{\sqrt{64}} = \frac{16}{8} = 2 입니다. 신뢰구간은 82±1.96×2=82±3.9282 \pm 1.96 \times 2 = 82 \pm 3.92 이므로 (78.08, 85.92)가 됩니다. ②는 1.96 대신 1.645를 써서 90% 구간이 된 것, ③은 표준오차 자리에 모표준편차 16을 그대로 넣은 것, ④는 계수를 곱하지 않고 표준오차만 더하고 뺀 것입니다.
  8. 어떤 다중회귀 모형의 총제곱합(SST)이 500, 잔차제곱합(SSE)이 125로 나왔습니다. 설명변수 x2x_2 의 분산팽창요인(VIF)은 6.25였습니다. 다음 중 옳지 않은 것은?
    ① 이 모형의 결정계수는 0.75이다
    ② x2x_2 를 나머지 설명변수로 회귀했을 때의 결정계수는 0.84이다
    ③ 설명변수를 더 넣으면 결정계수는 줄지 않으므로, 변수 개수가 다른 모형끼리는 수정된 결정계수로 비교한다
    ④ VIF 값으로 보아 x2x_2 는 다른 설명변수와 관련이 거의 없다
    ④. 분산팽창요인은 어떤 설명변수를 나머지 설명변수로 회귀했을 때의 결정계수 Rj2R_j^2 로 VIF=11−Rj2\text{VIF} = \frac{1}{1 - R_j^2} 처럼 계산합니다. 6.25를 넣으면 Rj2=1−16.25=0.84R_j^2 = 1 - \frac{1}{6.25} = 0.84 라서 x2x_2 의 변동 중 84%가 다른 설명변수로 설명됩니다. 관련이 없기는커녕 흔히 쓰는 기준값 5를 넘겨 다중공선성을 의심할 자리입니다. ①은 1−125500=0.751 - \frac{125}{500} = 0.75 로 맞고, ②는 위 계산 그대로입니다.
  9. 로지스틱 회귀모형이 ln⁡ ⁣(p1−p)=−2+0.5x\ln\!\left(\frac{p}{1-p}\right) = -2 + 0.5x 로 적합되었습니다. 옳은 것은?
    ① xx 가 1 늘면 오즈가 0.5배가 되고, x=4x = 4 일 때 예측 확률은 0.5이다
    ② xx 가 1 늘면 오즈가 e0.5e^{0.5} 배가 되고, x=4x = 4 일 때 예측 확률은 0.5이다
    ③ xx 가 1 늘면 오즈가 e0.5e^{0.5} 배가 되고, x=4x = 4 일 때 예측 확률은 0이다
    ④ xx 가 1 늘면 확률이 0.5만큼 커지고, x=4x = 4 일 때 예측 확률은 1이다
    ②. 오즈는 사건이 일어날 확률을 일어나지 않을 확률로 나눈 값이고, 로지스틱 회귀는 그 로그값을 직선으로 놓습니다. 계수 0.5는 로그 오즈의 증가분이므로 오즈 자체는 e0.5e^{0.5} 배가 됩니다. x=4x = 4 를 넣으면 −2+0.5×4=0-2 + 0.5 \times 4 = 0 이라 오즈는 e0=1e^{0} = 1, 곧 p=1−pp = 1 - p 이므로 확률은 0.5입니다. ①은 계수를 그대로 배수로 읽은 것, ③과 ④는 로그 오즈 0을 확률 0이나 1로 잘못 옮긴 것입니다.
  10. 다음 중 옳지 않은 설명은?
    ① 의사결정나무는 나눈 뒤의 지니 지수나 엔트로피 지수가 작아지는 방향으로 가지를 친다
    ② 가지치기는 나무가 지나치게 자라 학습 데이터에만 맞아 버리는 것을 줄이려는 작업이다
    ③ k-평균 군집은 군집 개수를 먼저 정해야 하고, 처음 잡은 중심점에 따라 결과가 달라질 수 있다
    ④ 계층적 군집도 군집 개수를 미리 정해 두어야 하며 덴드로그램으로 나타낼 수 없다
    ④. 계층적 군집은 가까운 것끼리 차례로 묶어 나가는 과정을 나무 모양 그림인 덴드로그램으로 남기고, 그 나무를 어느 높이에서 자를지 나중에 골라 군집 개수를 정합니다. 개수를 먼저 정해야 하는 쪽은 k-평균입니다. ①의 지니 지수는 한 노드에 범주가 섞인 정도를 재는 값이고, ②와 ③도 옳은 설명입니다.
  11. 전체 거래 1,000건 가운데 우유가 든 거래가 400건, 시리얼이 든 거래가 250건, 둘 다 든 거래가 150건입니다. 규칙 '우유 → 시리얼'의 향상도는?
    ① 0.15
    ② 0.375
    ③ 0.6
    ④ 1.5
    ④. 지지도는 1501000=0.15\frac{150}{1000} = 0.15, 신뢰도는 우유를 산 사람 중 시리얼도 산 비율이라 150400=0.375\frac{150}{400} = 0.375, 시리얼의 기대신뢰도는 2501000=0.25\frac{250}{1000} = 0.25 입니다. 향상도는 신뢰도를 기대신뢰도로 나눈 0.3750.25=1.5\frac{0.375}{0.25} = 1.5 이고, 1보다 크므로 두 품목은 서로 도움이 되는 관계입니다. ①은 지지도, ②는 신뢰도, ③은 방향을 뒤집은 '시리얼 → 우유'의 신뢰도 150250\frac{150}{250} 입니다.
  12. 이탈 예측 모형을 고객 1,000명에게 적용했습니다. 실제로 이탈한 100명 중 80명을 이탈로 맞혔고, 이탈하지 않은 900명 중 40명을 이탈로 잘못 예측했습니다. 옳지 않은 것은?
    ① 정확도는 0.94이다
    ② 정밀도는 약 0.67이다
    ③ 재현율은 0.8이다
    ④ ROC 곡선은 가로축에 정밀도를, 세로축에 재현율을 놓고 그리며 곡선 아래 넓이가 0에 가까울수록 좋은 모형이다
    ④. ROC 곡선은 가로축에 거짓 양성 비율을, 세로축에 재현율을 놓고 임계값을 옮겨 가며 그린 곡선이고, 아래 넓이인 AUC가 1에 가까울수록 좋습니다. ①은 맞힌 940명을 전체로 나눈 80+8601000=0.94\frac{80 + 860}{1000} = 0.94, ②는 이탈이라 예측한 120명 중 맞힌 비율인 80120≈0.667\frac{80}{120} \approx 0.667, ③은 실제 이탈자 중 잡아낸 비율인 80100=0.8\frac{80}{100} = 0.8 로 모두 맞습니다.
데이터분석 준전문가 (ADsP) 시험 노트 전체 보기