Build your ultimate AI agent
코스 설명
실무 규모의 데이터를 다룰 준비가 되셨나요? 이 강의에서는 Databricks의 Spark SQL과 PySpark를 활용해 대용량 데이터셋을 변환하는 방법을 배웁니다. 데이터를 정제하고 구조화하는 방법, 최적화된 조인으로 집계를 수행하는 방법, 그리고 고급 분석을 위한 윈도우 함수 적용 방법을 학습합니다. 또한 내결함성 체크포인트를 활용한 파일 기반 스트리밍을 설정하고 결과를 Delta 테이블로 저장하는 방법도 다룹니다. 강의를 마치면 Databricks Workflows와 Lakeflow Declarative Pipelines를 활용해 다단계 프로덕션 파이프라인을 직접 구성할 수 있게 됩니다.
사전 요구 사항
커리큘럼
코스 개요
1
데이터 로드 및 구조화
이 챕터에서는 Databricks 노트북 사용법, CSV 데이터를 Spark DataFrame으로 로드하는 방법, 그리고 PySpark와 SQL을 활용해 데이터를 구조화하는 방법을 배웁니다.
2
데이터 정제 및 최적화
명시적 스키마를 정의하고 데이터 정제 파이프라인을 구축하는 방법, 그리고 브로드캐스트 조인으로 쿼리 성능을 최적화하는 방법을 학습합니다.
3
분석 및 프로덕션 파이프라인
윈도우 함수로 누적 합계와 순위를 계산하는 방법, 스트리밍 파이프라인을 구축하는 방법, 그리고 프로덕션 워크플로를 배포하는 방법을 배웁니다.
Databricks에서 Spark SQL로 데이터 변환하기
코스
완료

