데이터분석 준전문가 (ADsP) 시험 노트모의고사23 MIN
ADsP 모의고사 2회
실제 필기의 20% · 20% · 60% 비중을 그대로 옮겨 1과목 4문항 · 2과목 4문항 · 3과목 12문항으로 짠 한 벌입니다. 1회와 겹치는 문제는 없고 계산·코드 읽기 문항은 풀이까지 적었습니다.
ADsP 출제 범위에 맞춰 직접 만든 20문항입니다. 실제 필기가 객관식 50문항을 1과목 10 · 2과목 10 · 3과목 30으로 내므로 그 비중을 그대로 옮겨 4 · 4 · 12로 짰습니다. 1회와 겹치는 문제는 없고, 계산과 코드 읽기가 필요한 문항은 풀이 과정까지 적었습니다. 답은 문제를 눌러야 펼쳐지니 먼저 풀어 보세요.
실제 시험은 총점 60점 이상이 합격이고 한 과목이라도 그 과목 배점의 40% 미만이면 과락입니다. 이 한 벌로 옮기면 20문항 중 12문항이 총점 기준이고, 과목별로는 1·2과목에서 각각 2문항, 3과목에서 5문항을 맞혀야 과락을 면합니다.
1과목 데이터의 이해
20년 경력의 정비 기사가 소리만 듣고 고장 부위를 짚던 요령을 점검 절차서로 정리해 신입 교육에 썼습니다. 이 활동에 해당하는 지식 전환 방식은?
① 공통화
② 표출화
③ 연결화
④ 내면화②. 암묵지는 몸에 익어 말로 옮기기 어려운 지식이고 형식지는 문서나 매뉴얼처럼 밖으로 드러난 지식입니다. 암묵지를 형식지로 바꾸는 것이 표출화라 절차서로 옮긴 이 사례가 여기입니다. ①은 암묵지를 암묵지로, ③은 형식지를 형식지로 옮기는 것이고, ④는 형식지를 익혀 자기 암묵지로 삼는 것입니다.데이터베이스의 특성에 대한 설명으로 옳지 않은 것은?
① 통합된 데이터 — 같은 내용의 데이터가 중복되지 않도록 모아 둔 것이다
② 변화되는 데이터 — 한 번 저장한 값은 바뀌지 않고 처음 상태를 그대로 유지한다
③ 저장된 데이터 — 컴퓨터가 접근할 수 있는 저장 매체에 들어 있다
④ 공용 데이터 — 여러 사용자가 서로 다른 목적으로 함께 이용한다②. '변화되는 데이터'는 값이 고정된다는 뜻이 아니라 그 반대입니다. 삽입·삭제·갱신을 거치며 내용이 계속 달라지되 그때그때가 하나의 정확한 상태로 유지된다는 뜻입니다.전사 데이터 웨어하우스에 모인 데이터 가운데 마케팅 부서가 쓰는 고객·캠페인 영역만 따로 떼어 구성한 저장소는?
① 데이터 마트
② 데이터 레이크
③ ODS
④ 데이터 웨어하우스①. 데이터 마트는 특정 부서나 주제에 필요한 부분만 잘라 놓은 작은 데이터 웨어하우스입니다. ②는 가공하지 않은 원본을 형식 구분 없이 모아 두는 곳, ③은 운영 시스템의 데이터를 통합해 잠시 두는 중간 저장소, ④는 전사 범위라 다릅니다.빅데이터가 가져온 변화에 대한 설명으로 옳지 않은 것은?
① 필요한 것만 미리 골라 두던 방식에서 일단 모아 두고 쓰임새를 나중에 찾는 쪽으로 옮겨 갔다
② 일부를 뽑아 조사하던 방식에서 데이터 전체를 다루는 쪽으로 옮겨 갔다
③ 원인과 결과를 밝히기가 쉬워져 상관관계에 기댄 분석은 더 이상 쓰이지 않는다
④ 값 하나하나의 정확성보다 양이 주는 힘 쪽으로 무게가 옮겨 갔다③. 흔히 꼽는 변화는 사전 처리에서 사후 처리로, 표본조사에서 전수조사로, 질에서 양으로, 인과관계에서 상관관계로 넷입니다. 인과를 밝히는 일은 여전히 어렵고 비용이 커서, 함께 움직이는 것을 보고 먼저 대응하는 상관관계 분석이 오히려 늘었습니다.
2과목 데이터 분석 기획
하향식 접근으로 과제를 발굴하는 중입니다. 「추려 둔 과제마다 쓸 데이터가 실제로 있는지, 지금 역량으로 감당되는지, 들인 비용만큼 값이 나오는지를 따져 착수 여부를 가른다」는 활동은 어느 단계인가?
① 문제 탐색(Problem Discovery)
② 문제 정의(Problem Definition)
③ 해결방안 탐색(Solution Search)
④ 타당성 평가(Feasibility Study)④. 하향식은 네 단계입니다. 풀 수 있는지 따지지 않고 후보를 빠짐없이 늘어놓는 문제 탐색, 비즈니스 문제를 데이터 문제로 옮겨 적는 문제 정의, 분석 역량과 기존 시스템 활용 여부로 방법을 가르는 해결방안 탐색, 그리고 경제적 타당성과 데이터·기술적 타당성을 재는 타당성 평가입니다. 데이터가 있는지·역량이 되는지·값이 나오는지는 마지막 단계의 질문이라 ④입니다. ①에서 후보를 거르면 정작 풀어야 할 과제가 먼저 지워집니다.다음 중 분석 거버넌스 체계의 구성 요소로 보기 어려운 것은?
① 분석 기획과 과제 관리를 맡는 조직
② 과제 발굴에서 관리까지 이어지는 프로세스
③ 개별 분석가가 개인적으로 선호하는 통계 패키지의 종류
④ 분석 결과를 공유하는 IT 시스템과 관리 대상 데이터③. 분석 거버넌스는 분석을 조직 차원에서 지속하기 위한 관리 체계로, 조직·프로세스·시스템·데이터와 인력 교육 및 문화를 함께 다룹니다. 어떤 패키지를 쓰는지는 담당자의 선택일 뿐 전사 관리 대상이 아닙니다.문제 정의가 뚜렷하지 않고 쓸 만한 데이터가 있는지도 확실하지 않아, 작게 만들어 보여 주며 요구사항을 다듬기로 했습니다. 이 접근의 설명으로 옳지 않은 것은?
① 사용자가 원하는 바를 미리 말로 다 정의하기 어려울 때 쓴다
② 데이터가 실제로 쓸 만한지 시행착오를 거쳐 확인할 수 있다
③ 결과를 먼저 보여 주므로 요구사항을 구체화하는 데 도움이 된다
④ 요구사항이 처음부터 명확하고 변경이 거의 없는 과제에 가장 알맞다④. 프로토타이핑은 일단 만들어 보여 주고 반응을 받아 고쳐 나가는 접근이라, 요구사항이 확정되어 바뀌지 않는 과제에서는 쓸 이유가 없습니다. 그런 과제는 앞 단계를 확정하고 순서대로 내려가는 폭포수 방식이 어울립니다.다음 중 분석 과제를 관리할 때 고려할 주요 영역으로 보기 어려운 것은?
① 분석에 쓸 데이터의 양
② 분석 담당자가 소속된 부서의 조직도상 위치
③ 정형과 비정형이 섞여 있는 정도인 데이터 복잡도
④ 결과를 만들어 내야 하는 속도②. 분석 과제 관리에서 흔히 꼽는 영역은 데이터 양, 데이터 복잡도, 속도, 분석 복잡도, 정확도와 정밀도 다섯입니다. 담당자의 소속은 조직 설계의 문제이지 과제 자체의 관리 항목이 아닙니다.
3과목 데이터 분석
다음 R 코드의 실행 결과는?
① 3 7 11m <- matrix(1:6, nrow = 2) apply(m, 1, sum)
② 9 12
③ 21
④ 1 2②.matrix는 값을 열 방향으로 채우므로 1행은 1, 3, 5이고 2행은 2, 4, 6입니다.apply의 두 번째 인자는 함수를 적용할 방향으로 1이면 행, 2면 열입니다. 여기서는 행별 합이라 와 가 나옵니다. ①은 열별 합, ③은 전체 합, ④는 1열의 값입니다.고객 데이터 마트를 만들면서 거래 기록에서 고객별 월 구매 건수를 세어 한 칸으로 넣고, 생년월일을 20대·30대 같은 연령대로 바꿔 또 한 칸으로 넣었습니다. 두 변수를 바르게 짝지은 것은?
① 둘 다 요약변수
② 둘 다 파생변수
③ 구매 건수는 요약변수, 연령대는 파생변수
④ 구매 건수는 파생변수, 연령대는 요약변수③. 요약변수는 원 데이터를 고객처럼 어떤 단위로 묶어 합계·평균·건수로 집계한 값이라 여러 분석에 그대로 재활용됩니다. 파생변수는 분석가가 조건이나 계산 규칙을 정해 새로 만든 값이라 그 규칙에 주관이 들어갑니다. 구매 건수는 거래를 고객 단위로 센 집계이고, 연령대는 생년월일을 어느 폭으로 끊을지 사람이 정한 것입니다.R에서
x <- c(4, NA, 8, NA, 10)을 만들었습니다. 옳지 않은 것은?
①is.na(x)는 길이가 5인 논리 벡터를 돌려준다
②mean(x)는 결측을 빼고 계산해 약 7.33을 돌려준다
③mean(x, na.rm = TRUE)의 값은 약 7.33이다
④ 결측 두 자리를 그 평균값으로 채우면 다섯 값의 평균은 그대로지만 표준편차는 작아진다②.mean은 결측이 하나라도 섞이면 NA를 돌려주고, 빼고 계산하려면na.rm = TRUE를 붙여야 합니다. 남는 값이 4, 8, 10이므로 이라 ③이 맞습니다. ④처럼 채우면 채운 값이 정확히 평균 자리에 놓여 평균은 그대로지만 흩어짐은 줄어, 표준편차가 3.06에서 2.16으로 내려갑니다. 평균 대체가 분산을 실제보다 작게 만든다는 것이 이 방법의 약점입니다.어떤 변수의 제1사분위수가 20, 제3사분위수가 44입니다. 상자그림에서 수염 밖에 점으로 찍히는 이상값의 경계는?
① 20 미만 또는 44 초과
② 8 미만 또는 56 초과
③ 미만 또는 80 초과
④ 미만 또는 116 초과③. 사분위수 범위는 제3사분위수에서 제1사분위수를 뺀 값이라 여기서는 입니다. 상자그림은 이 값의 1.5배를 위아래로 뻗은 과 을 경계로 삼습니다. ①은 사분위수 자체, ②는 0.5배를 쓴 것, ④는 3배를 쓴 것입니다.부품 무게가 평균 60g, 표준편차 12g인 공정에서 36개를 무작위로 뽑았을 때 표본평균이 64g 이상일 확률은? (표준정규분포에서 , )
① 0.0228
② 0.1587
③ 0.3707
④ 0.4772①. 중심극한정리는 표본 크기가 충분히 크면 표본평균의 분포가 정규분포에 가까워진다는 성질이고, 이때 표본평균의 표준편차는 입니다. 여기서는 이므로 이고, 확률은 입니다. ③은 12를 그대로 넣어 으로 본 것, ④는 0과 2 사이의 넓이입니다.어느 공장에서 상자의 불량 여부를 검사합니다. 귀무가설이 '이 상자는 정상이다'일 때, 정상인 상자를 불량이라고 판정한 잘못에 대한 설명으로 옳은 것은?
① 1종 오류이며, 이 오류를 저지를 확률의 상한을 미리 정해 둔 값이 유의수준이다
② 1종 오류이며, 이 오류의 확률을 1에서 뺀 값을 검정력이라 한다
③ 2종 오류이며, 이 오류를 저지를 확률의 상한을 미리 정해 둔 값이 유의수준이다
④ 2종 오류이며, 표본 크기를 늘릴수록 이 오류의 확률은 반드시 커진다①. 참인 귀무가설을 기각하는 잘못이 1종 오류이고 그 확률을 로 씁니다. 유의수준은 이 를 얼마까지 감수할지 미리 정해 둔 값입니다. 거짓인 귀무가설을 기각하지 못하는 잘못은 2종 오류로 확률이 이고, 검정력 는 이쪽에서 나옵니다.두 변수 와 의 공분산이 24이고 의 표준편차가 6, 의 표준편차가 8입니다. 옳은 것은?
① 상관계수는 0.5이고 가 의 원인임을 뜻한다
② 상관계수는 3이고 두 변수는 매우 강한 양의 관계다
③ 상관계수는 0.5이고 의 단위를 미터에서 센티미터로 바꾸면 값이 100배가 된다
④ 상관계수는 0.5이고 단순선형회귀로 적합하면 결정계수는 0.25가 된다④. 상관계수는 공분산을 두 변수의 표준편차로 나눈 값이라 입니다. 설명변수가 하나인 단순선형회귀에서는 결정계수가 상관계수의 제곱이므로 입니다. ①은 상관을 인과로 읽은 것, ②는 표준편차 하나로만 나눈 값이며 상관계수는 과 1을 벗어날 수 없습니다. ③은 상관계수가 단위에 영향받지 않는다는 점을 놓쳤습니다.변수 다섯 개를 주성분분석했더니 고유값이 3.2, 1.3, 0.3, 0.15, 0.05로 나왔습니다. 제2주성분까지의 누적 기여율은?
① 26%
② 64%
③ 71%
④ 90%④. 고유값은 그 주성분이 설명하는 분산의 크기라, 전체 합 로 나눈 것이 기여율입니다. 앞 둘의 합 4.5를 5로 나누면 90%입니다. ①은 제2주성분만, ②는 제1주성분만 센 것이고, ③은 두 고유값 안에서 첫 번째가 차지하는 비중 입니다.시계열 분석에 대한 설명으로 옳지 않은 것은?
① 정상 시계열은 시점에 관계없이 평균과 분산이 일정하고, 공분산은 시차에만 의존한다
② 추세가 있는 시계열은 차분으로, 시간이 갈수록 분산이 커지는 시계열은 로그 변환으로 정상화한다
③ ARIMA(1, 1, 0) 모형은 원 시계열을 한 번 차분한 뒤 AR(1) 모형을 적합한 것과 같다
④ 계절성이 뚜렷한 시계열은 주기가 일정하므로 이미 정상 시계열이며 별도 변환이 필요 없다④. 정상성은 시간이 흘러도 통계적 성질이 그대로라는 뜻입니다. 계절성이 있으면 여름과 겨울의 평균이 다르므로 정상이 아니고, 보통 계절 차분으로 걷어냅니다. ③의 ARIMA 에서 가운데 가 차분 횟수라 이면 한 번 차분한 뒤 자기회귀 모형을 적합하는 것과 같습니다.계층적 군집에서 군집 와 가 있고 점 사이 거리가 , , , 입니다. 평균연결법으로 잰 두 군집 사이 거리는?
① 3
② 8
③ 5.5
④ 22③. 평균연결법은 두 군집에서 점을 하나씩 짝지어 잰 모든 거리의 평균을 군집 사이 거리로 봅니다. 짝이 넷이므로 입니다. ①은 가장 가까운 짝을 쓰는 최단연결법, ②는 가장 먼 짝을 쓰는 최장연결법의 값이고, ④는 평균을 내지 않고 합만 구한 것입니다.전체 거래 2,000건 가운데 빵이 든 거래가 600건, 잼이 든 거래가 300건, 둘 다 든 거래가 240건입니다. 규칙 '빵 → 잼'의 지지도는?
① 0.4
② 0.8
③ 2.67
④ 0.12④. 지지도는 전체 거래 가운데 두 품목이 함께 든 거래의 비율이라 입니다. ①은 빵을 산 사람 중 잼도 산 비율인 신뢰도 , ②는 방향을 뒤집은 '잼 → 빵'의 신뢰도 , ③은 잼의 기대신뢰도 로 신뢰도를 나눈 향상도입니다. 세 지표는 분모가 각각 전체 거래, 앞 품목 거래, 기대신뢰도로 다릅니다.데이터 300개로 5-겹 교차검증을 수행합니다. 옳은 것은?
① 한 번에 검증에 쓰는 데이터는 60개이고 모형은 한 번만 학습한다
② 한 번에 검증에 쓰는 데이터는 240개이고 모형은 다섯 번 학습한다
③ 한 번에 검증에 쓰는 데이터는 60개이고 모형은 모두 다섯 번 학습한다
④ 데이터를 다섯 조각으로 나누되 같은 조각을 학습과 검증에 동시에 쓴다③. k-겹 교차검증은 데이터를 조각으로 나눠 한 조각을 검증에, 나머지를 학습에 쓰는 일을 조각을 바꿔 가며 번 되풀이하고 성능을 평균 냅니다. 여기서는 한 조각이 개이므로 검증에 60개, 학습에 240개를 쓰고 학습은 다섯 번 일어납니다. ①은 되풀이를 빠뜨렸고, ②는 학습과 검증의 크기를 바꿔 놓았으며, ④는 같은 데이터를 둘에 함께 쓰면 성능이 부풀려지므로 교차검증의 전제를 깹니다.

