Chuyển đến nội dung chính

Lộ trình

Dữ liệu lớn với PySpark

Nắm vững cách xử lý dữ liệu lớn và tận dụng hiệu quả với Apache Spark thông qua giao diện lập trình ứng dụng PySpark.

  • Python
  • Nhập và làm sạch dữ liệu
  • 25 hr
  • 10,154

Tạo tài khoản miễn phí của bạn

Tiếp tục với Google
hoặc
Bằng cách tiếp tục, bạn chấp nhận Điều khoản sử dụng, Chính sách quyền riêng tư và việc dữ liệu của bạn được lưu trữ tại Hoa Kỳ.

Được yêu thích bởi người học tại hàng nghìn công ty

Đào tạo một nhóm?Dùng thử cho Doanh nghiệp

Mô tả track

Dữ liệu lớn với PySpark

Nâng cao kỹ năng xử lý dữ liệu của quý vị bằng cách thành thạo Apache Spark. Sử dụng API Spark Python, PySpark, quý vị sẽ tận dụng tính toán song song với các tập dữ liệu lớn và chuẩn bị cho việc học máy hiệu suất cao. Từ việc làm sạch dữ liệu đến tạo tính năng và triển khai các mô hình học máy, quý vị sẽ thực hiện các quy trình làm việc từ đầu đến cuối bằng Spark. Chương trình kết thúc bằng việc xây dựng một hệ thống đề xuất sử dụng bộ dữ liệu MovieLens phổ biến và bộ dữ liệu Million Songs.

Yêu cầu tiên quyết

Không có điều kiện tiên quyết cho track này

Phát triển kỹ năng dữ liệu của bạn với DataCamp for Mobile

Tiến bộ mọi lúc mọi nơi với các khóa học di động và thử thách lập trình 5 phút mỗi ngày của chúng tôi.