자격증
Databricks

해외해외 벤더 자격Databricks

Databricks ML Associate

Databricks Certified Machine Learning Associate

난이도
응시자격은 없지만 실무 6개월과 파이썬 경험을 권장합니다.
취업
어소시에이트 등급이고 국내 고객사가 늘어 데이터 직군에서 통합니다.
공식 페이지에서 일정·접수 확인

개요

Databricks에서 기본적인 머신러닝 작업을 수행할 수 있는지를 재는 시험이다. 공식 설명에 따르면 AutoML·Unity Catalog·MLflow 일부 기능 같은 Databricks의 머신러닝 기능을 이해하고 쓸 수 있는지, 데이터를 탐색하고 피처 엔지니어링을 할 수 있는지를 본다. 여기에 더해 학습·튜닝·평가와 모델 선택을 통한 모델 구축, 그리고 모델 배포 능력까지 평가한다. 시험의 머신러닝 코드는 전부 Python이며, 머신러닝에 국한되지 않는 워크플로나 데이터 조작 코드는 SQL로 제시될 수 있다.

Databricks를 배우는 만 18세 이상 개인이 대상이며, 공식 FAQ는 잠재 고객·고객·파트너·Databricks 임직원을 함께 든다. 권장 경험은 시험 가이드에 적힌 머신러닝 작업을 6개월 이상 직접 해 본 것이다.

과목

과목비중다루는 것
Databricks Machine Learning38%
  • MLOps 전략의 모범 사례
  • ML 런타임의 장점
  • AutoML이 모델·피처 선택을 돕는 방식과 모델 개발 과정에 주는 이점
  • 피처 스토어 테이블을 워크스페이스 수준이 아니라 Unity Catalog 계정 수준에 만들 때의 이점
  • Unity Catalog에 피처 스토어 테이블 만들기·데이터 쓰기·그 피처로 모델 학습·스코어링
  • 온라인/오프라인 피처 테이블의 차이
  • MLflow Client API로 최적 실행 찾기
  • 지표·아티팩트·모델 수동 로깅
  • MLflow UI에서 확인 가능한 정보
  • MLflow Client API로 Unity Catalog 레지스트리에 모델 등록
  • 워크스페이스 레지스트리 대신 Unity Catalog 레지스트리에 등록할 때의 이점
  • 코드 승격과 모델 승격의 선택
  • 모델 태그 설정·삭제
  • 별칭으로 challenger를 champion으로 승격
ML Workflows19%
  • 웹페이지 배점표의 이름은 ML Workflows지만
  • 같은 페이지가 링크하는 공식 시험 가이드(2025-03-01판)의 2번 섹션 제목은 Data Processing이다. 내용은 Spark DataFrame의 .summary()·dbutils 요약 통계
  • 표준편차·IQR 기반 이상치 제거
  • 범주형·연속형 피처 시각화
  • 범주형끼리 또는 연속형끼리 적절한 방법으로 비교
  • 평균·중앙값·최빈값 대치의 비교와 실제 대치
  • 원-핫 인코딩 적용과 그것이 적절한 모델·데이터와 그렇지 않은 경우 구분
  • 로그 스케일 변환이 적절한 상황
Model Development31%
  • 시나리오에 맞는 알고리즘 선택
  • 학습 데이터 불균형 완화 방법
  • estimator와 transformer 비교
  • 학습 파이프라인 구성
  • Hyperopt의 fmin으로 하이퍼파라미터 튜닝
  • 랜덤·그리드·베이지안 탐색
  • 단일 노드 모델의 튜닝 병렬화
  • 교차 검증과 train-validation 분할의 장단점 및 교차 검증 수행
  • 그리드 탐색·교차 검증 시 학습되는 모델 수 계산
  • 분류 지표(F1·Log Loss·ROC/AUC)와 회귀 지표(RMSE·MAE·R제곱)
  • 목적에 맞는 지표 선택
  • 로그 변환 변수의 지수 복원 필요성
  • 모델 복잡도와 편향-분산 트레이드오프
Model Deployment12%
  • 배치·실시간·스트리밍 서빙 방식의 차이와 장점
  • 커스텀 모델을 모델 엔드포인트에 배포
  • pandas로 배치 추론
  • Delta Live Tables에서의 스트리밍 추론
  • 실시간 추론용 모델 배포와 질의
  • 실시간 추론을 위해 엔드포인트 간에 데이터 분할(가이드 원문 'Split data between endpoints for realtime interference' — 원문의 interference는 inference의 오타)

시험 정보

치르는 방식

시행 주기시행처가 회차나 접수 기간을 못 박아 둔 문장이 공식 페이지 어디에도 없다.공식 안내가 밝히는 것은 예약 방식뿐이다 — 시험은 Kryterion이 시행하고("Databricks Certification exams are delivered via Kryterion"), 응시자는 시험 페이지의 등록 링크(webassessor.com/databricks)로 Webassessor 계정을 만들어 등록한다.응시 방식은 "Delivery Method: Online or test center"로, 온라인 프록터와 시험센터 중에 고른다.일정 변경은 Webassessor에 로그인해서 하며, 온라인 프록터 시험은 예약한 시험 시각보다 24시간 넘게 앞서, 시험센터 시험은 72시간 넘게 앞서 변경해야 한다("you must reschedule your exam more than 24 hours before your scheduled exam time" / "more than 72 hours").그 시점을 지나서 변경하면 변경 수수료가 붙는다.불합격하면 14일 뒤에 다시 등록해 응시할 수 있고 횟수 제한은 없으나 응시 사이마다 14일을 두어야 하며, 응시할 때마다 같은 응시료를 낸다.회차가 따로 없으므로 실제 응시 가능한 날짜·시간은 공식 예약 페이지(webassessor.com/databricks)에서 확인한다.
형식채점 문항 48개, 제한 시간 90분.참고 자료 반입 불가(Test aides: None allowed).온라인 프록터 또는 시험센터 중 선택하는 감독형 시험이다(Type: Proctored certification).문항 유형은 두 문서의 표기가 조금 다르다 — 시험 페이지는 "Question types: Multiple choice"만 적고, 시험 가이드는 "48 scored multiple-choice or multiple-selection questions"로 복수 선택을 함께 든다.통계 수집용 비채점 문항이 섞여 나올 수 있으며 그만큼 시간이 추가로 배정되고 점수에는 영향이 없다.합격 기준 점수는 통계 분석으로 정하고 문항이 바뀌면 함께 바뀌기 때문에 Databricks가 공개하지 않는다(공식 FAQ).시험 직후 비공식 결과를 바로 알려 주고, 합격이면 프록터 녹화를 검토한 뒤 credentials.databricks.com에 디지털 배지가 게시되며 Accredible에서 공유용 배지 메일이 온다.언어는 영어·일본어·포르투갈어(BR)·한국어.

응시 조건

응시자격없음.시험 가이드는 "Prerequisite: None required"로 적고 교육 수강과 6개월 이상의 실무 경험을 강하게 권장한다.공식 FAQ도 교육은 권장일 뿐 필수가 아니라고 못 박는다.권장 준비 항목은 강사 인솔 과정 Machine Learning with Databricks, Databricks Academy 자기주도 과정(Data Preparation for Machine Learning, Machine Learning Model Deployment, Machine Learning Model Development, Machine Learning Ops), Python과 scikit-learn·SparkML 활용 능력, Unity Catalog와 Delta Live Tables 같은 데이터 관리 기능 이해, Databricks 문서의 머신러닝 주요 주제 숙지다.공식 연습 시험은 제공하지 않는다.
응시료미화 200달러.공식 FAQ가 "All Databricks Certification exams cost 200 USD"라고 적어 모든 Databricks 인증 시험이 같은 금액이며, 재응시도 매번 같은 금액을 낸다.무료 재응시는 어떤 시험에도 없고 재응시 바우처도 발급하지 않는다.바우처 코드가 있으면 결제 화면(exam checkout page)에서 입력한 뒤 Submit, Check Out 순으로 진행한다.

환불 비율을 못 박은 공식 문장이 없다. 시행사 Kryterion은 온라인 24시간 전·시험센터 72시간 전까지 취소하면 「Kryterion 수수료가 붙지 않는다」고만 하고 취소 규정은 시험 주관사 페이지를 보라고 넘기며, 주관사 Databricks 약관은 온라인·시험센터를 가리지 않고 72시간 미만 통보로는 변경도 취소도 할 수 없다고만 적는다.

자격 유지

유효기간2년.자격은 취득일로부터 2년간 유효하고("valid for two years from the date it is awarded"), 디지털 배지도 발급 2년 뒤 만료된다.만료 전에 미리 안내를 받는다.갱신하려면 그 시점에 운영 중인 현행 시험 전체를 다시 치러야 한다("take the full current live exam").부분 갱신이나 갱신 전용 시험을 안내한 문장은 없다.

시험 노트

8 / 30편개념 8/25 · 모의고사 0/5

개념 정리8 / 25

  1. 01ML 런타임과 워크스페이스 구조개념17 MIN

    Databricks Runtime for ML이 표준 런타임에 무엇을 더 얹는지, 단일 노드와 멀티 노드를 언제 갈라 쓰는지, 노트북에서 Git 폴더와 Jobs로 이어지는 작업 흐름을 정리합니다.

  2. 02Unity Catalog와 데이터 거버넌스개념14 MIN

    catalog.schema.table 3단 이름이 어디서 나오는지, 워크스페이스 수준과 계정 수준이 어떻게 다른지, Delta Lake와 Delta Live Tables·권한·계보가 각각 무엇을 맡는지 정리합니다.

  3. 03Spark DataFrame 요약 통계와 시각화개념13 MIN

    describe와 summary가 무엇을 다르게 내놓는지, dbutils.data.summarize가 그 위에 무엇을 더하는지, 그리고 피처 조합마다 어떤 그림과 어떤 수치로 관계를 보는지 정리합니다.

  4. 04표준편차와 IQR로 이상치 걸러내기개념14 MIN

    평균 ± k×표준편차와 IQR 1.5배 울타리가 같은 데이터에서 서로 다른 답을 내는 이유를 숫자로 짚고, approxQuantile과 filter로 실제로 걸러내는 코드까지 정리합니다.

  5. 05평균·중앙값·최빈값으로 결측값 대치개념15 MIN

    평균·중앙값·최빈값 대치가 치우친 분포에서 서로 다른 값을 채우는 이유를 숫자로 보고, Spark ML Imputer와 결측 표시 열, 분할 뒤에 fit해야 하는 까닭까지 정리합니다.

  6. 06원-핫 인코딩과 로그 스케일 변환개념15 MIN

    StringIndexer와 OneHotEncoder를 이어 붙였을 때 벡터가 어떤 모양으로 나오는지, 원-핫이 맞는 모델과 안 맞는 모델, 오른쪽 꼬리를 누르는 로그 변환과 log1p까지 숫자로 정리합니다.

  7. 07Unity Catalog 피처 스토어 테이블개념13 MIN

    FeatureEngineeringClient.create_table로 피처 테이블을 만들고, 기존 Delta 테이블을 기본 키로 등록하고, write_table의 merge가 행을 어떻게 바꾸는지와 FeatureStoreClient에서 달라진 점을 정리합니다.

  8. 08피처 테이블로 모델 학습하고 스코어링하기개념13 MIN

    FeatureLookup과 create_training_set으로 학습 데이터를 만들고, log_model로 피처 스펙을 모델에 싣고, score_batch가 키만 받아 피처를 찾아 붙이는 흐름과 시점 조회를 정리합니다.

  9. 09온라인 피처 테이블과 오프라인 피처 테이블예정Databricks Machine Learning (38%)
  10. 10시나리오별 알고리즘 선택과 클래스 불균형예정Model Development (31%)
  11. 11Spark ML 파이프라인과 추정기·변환기예정Model Development (31%)
  12. 12분류 지표 — F1·Log Loss·ROC/AUC예정Model Development (31%)
  13. 13회귀 지표와 로그 변환 되돌리기예정Model Development (31%)
  14. 14교차 검증과 train-validation 분할예정Model Development (31%)
  15. 15편향-분산 트레이드오프와 모델 복잡도예정Model Development (31%)
  16. 16그리드·랜덤·베이지안 탐색 비교예정Model Development (31%)
  17. 17MLflow로 지표·파라미터·아티팩트 로깅예정Databricks Machine Learning (38%)
  18. 18MLflow Client API로 최적 실행 찾기예정Databricks Machine Learning (38%)
  19. 19Hyperopt fmin으로 튜닝 병렬화예정Model Development (31%)
  20. 20AutoML로 베이스라인 모델 만들기예정Databricks Machine Learning (38%)
  21. 21모델 레지스트리 등록과 태그예정Databricks Machine Learning (38%)
  22. 22챔피언 별칭 승격과 코드·모델 승격예정Databricks Machine Learning (38%)
  23. 23배치·스트리밍·실시간 서빙 비교예정Model Deployment (12%)
  24. 24pandas 배치 추론과 스트리밍 추론예정Model Deployment (12%)
  25. 25Model Serving 엔드포인트 배포와 질의예정Model Deployment (12%)

모의고사0 / 5

개념을 다 쓴 뒤에 차례로 붙습니다.

  1. 01모의고사 1회예정
  2. 02모의고사 2회예정
  3. 03모의고사 3회예정
  4. 04모의고사 4회예정
  5. 05모의고사 5회예정

관련 있는 우리 글

시험을 겨냥해 쓴 글은 아니지만 같은 개념을 다룹니다. 과목이 막힐 때 곁에 두고 읽습니다.

알아 둘 것

  • 시행은 Kryterion이 맡고 등록은 Webassessor(webassessor.com/databricks)에서 한다.
  • 시험 자체의 공식 명칭은 'Databricks Certified Machine Learning Associate'인데, 인증 목록 페이지에서는 'ML Engineer' 직무 트랙의 Associate 등급으로 묶여 있고 취득 후 받는 배지 이름은 'Databricks Certified Machine Learning Engineer Associate'다(근거: credentials.databricks.com/group/371215의 제목과 h1).
  • 상위 등급으로 Databricks Certified Machine Learning Professional이 있다.
  • 공식 문서 두 곳이 어긋난다. 2번 출제 영역 이름은 시험 페이지가 'ML Workflows', 가이드 PDF가 'Data Processing'이다 — 세부 목표 목록은 가이드에만 있어 내용은 가이드를 따랐다. 응시 방식은 가이드가 'Online Proctored', 페이지가 'Online or test center'인데, FAQ의 시험센터 72시간 변경 규칙을 근거로 페이지를 따랐다.
  • 시험 가이드는 2025-03-01 기준 현행판이며 시험 2주 전에 최신판을 다시 확인하라고 안내한다. 공식 FAQ는 앞으로 시험 버전이 항상 하나만 운영되고 가이드가 출제 범위의 기준 문서라고 적는다.
  • 공식 연습 시험은 제공하지 않는다. 연습 시험이 실제 시험과 같은 수준의 엄밀함으로 만들어지지 않아 결과가 오해를 부른다는 이유다.

난이도와 취업 별은 시행처가 준 값이 아니라 위에 적은 근거로 매긴 값입니다. 공식 페이지는 2026-09-22에 확인했습니다. 시험 제도는 개편이 잦으니 접수 전에 시행처 안내를 한 번 더 보세요.