강의
Python에서 Spark SQL 입문
고급기술 수준
업데이트됨 2026. 3.
SparkData Manipulation4시간15 동영상52 연습 문제4,200 XP20,502성취 증명서
무료 계정 만들기
Google에서 계속 진행더 많은 옵션 보기또는
수천 개 기업의 학습자들이 사랑하는
팀을 교육하시나요?
비즈니스용으로 체험해 보세요강의 설명
선수 조건
Python ToolboxPostgreSQL Summary Stats and Window FunctionsIntroduction to PySpark1
PySpark SQL
이 장에서는 Spark에서 SQL 테이블을 생성하고 쿼리하는 방법을 배웁니다. Spark SQL은 SQL의 표현력을 Spark로 가져옵니다. 또한 Spark에서 SQL 윈도 함수를 사용하는 방법도 학습합니다. 윈도 함수는 현재 행과 관련된 여러 행을 가로질러 계산을 수행합니다. 이는 조인과 전통적 집계만으로 표현하기 어려운 결과를 훨씬 쉽게 만들어 줍니다. 우리는 윈도 함수를 사용해 누적 합, 누적 차이 등 기본 SQL만으로 구현하기 까다로운 연산을 수행해 보겠습니다.
2
자연어 처리에 윈도 함수 SQL 활용하기
이 장에서는 자연어 텍스트를 로드한 다음, 이동 윈도 분석을 적용해 빈번한 단어 시퀀스를 찾습니다.
3
캐싱, 로깅, 그리고 Spark UI
앞선 장들에서 윈도 함수 SQL의 표현력을 익혔습니다. 이제 이 표현력을 제대로 활용하려면 DataFrame과 SQL 테이블을 올바르게 캐시하는 방법을 이해하는 것이 중요합니다. 또한 애플리케이션을 평가하는 방법도 알아야 합니다. 이를 Spark UI로 수행하는 방법을 배웁니다. 아울러 Spark에서의 로깅 모범 사례도 살펴봅니다. Spark SQL은 쿼리 성능 문제를 튜닝하는 데 유용한 또 다른 도구인 쿼리 실행 계획을 제공합니다. 실행 계획을 사용해 DataFrame의 소스와 변환 과정을 평가하는 방법을 배우게 됩니다.
4
텍스트 분류
앞선 장에서는 원시 텍스트를 로드하고 토크나이즈하며 단어 시퀀스를 추출하는 도구를 익혔습니다. 이는 분석에 매우 유용할 뿐 아니라 Machine Learning에도 활용할 수 있습니다. 이제 로지스틱 회귀를 사용해 텍스트를 분류하면서 배운 내용을 하나로 연결합니다. 이 장을 마치면 원시 자연어 텍스트 데이터를 로드해 텍스트 분류기를 학습하는 데까지 활용해 보게 됩니다.
Python에서 Spark SQL 입문
강의 완료
19백만 명 이상의 학습자와 함께 Python에서 Spark SQL 입문을(를) 시작하세요!
무료 계정 만들기
Google에서 계속 진행더 많은 옵션 보기또는
DataCamp for Mobile을 통해 데이터 분석 능력을 향상시키세요.
모바일 강좌와 매일 5분 코딩 챌린지를 통해 이동 중에도 학습 효과를 높이세요.