Chuyển đến nội dung chính
Trang chủSpark

Khóa học

Machine Learning với PySpark

Nâng caoTrình độ kỹ năng
Đã cập nhật tháng 11, 2025
Học cách dự đoán từ dữ liệu với Apache Spark, dùng cây quyết định, hồi quy logistic, hồi quy tuyến tính, ensemble và pipeline.
Bắt Đầu Khóa Học Miễn Phí
SparkMachine Learning
4 gio
16 video
56 Bài tập
4,550 XP
29,770
Giấy chứng nhận Thành tích

Tạo Tài Khoản Miễn Phí

Tiếp tục với GoogleHiển thị thêm tùy chọn

hoặc


Bằng cách tiếp tục, bạn chấp nhận Điều khoản sử dụng, Chính sách bảo mật và việc dữ liệu của bạn được lưu trữ tại Hoa Kỳ.

Được người học tại hàng ngàn công ty yêu thích

Group

Đào tạo một đội ngũ?

Dùng thử cho Doanh nghiệp

Mô tả khóa học

Học cách sử dụng Apache Spark cho học máy

Spark là một công cụ mạnh mẽ, đa năng để làm việc với Big Data. Spark xử lý minh bạch việc phân phối các tác vụ tính toán trên một cụm. Điều này có nghĩa là các thao tác diễn ra nhanh chóng, đồng thời cũng giúp bạn tập trung vào phân tích thay vì phải lo lắng về các chi tiết kỹ thuật. Trong khóa học này, bạn sẽ học cách đưa dữ liệu vào Spark rồi đi sâu vào ba thuật toán học máy cốt lõi của Spark: Hồi quy tuyến tính, hồi quy logistic/bộ phân loại, và tạo pipeline.

Xây dựng và Kiểm thử Cây Quyết định

Xây dựng cây quyết định của riêng bạn là một cách tuyệt vời để bắt đầu khám phá các mô hình học máy. Bạn sẽ sử dụng một thuật toán gọi là ‘Recursive Partitioning’ để chia dữ liệu thành hai lớp và tìm một biến dự báo trong dữ liệu của bạn tạo ra phép chia giàu thông tin nhất giữa hai lớp, rồi lặp lại hành động này với các nút tiếp theo. Sau đó, bạn có thể sử dụng cây quyết định của mình để đưa ra dự đoán với dữ liệu mới.

Làm chủ Hồi quy Logistic và Hồi quy Tuyến tính trong PySpark

Hồi quy logistic và hồi quy tuyến tính là những kỹ thuật học máy thiết yếu được PySpark hỗ trợ. Bạn sẽ học cách xây dựng và đánh giá các mô hình hồi quy logistic, trước khi chuyển sang tạo các mô hình hồi quy tuyến tính để giúp bạn tinh chỉnh các biến dự báo của mình chỉ còn những lựa chọn phù hợp nhất.

Đến cuối khóa học, bạn sẽ tự tin áp dụng kiến thức học máy mới học được, nhờ các nhiệm vụ thực hành và bộ dữ liệu luyện tập được tìm thấy xuyên suốt khóa học.

Điều kiện tiên quyết

Supervised Learning with scikit-learnIntroduction to PySpark
1

Giới thiệu

Spark là một framework để làm việc với Big Data. Trong chương này, bạn sẽ tìm hiểu bối cảnh về Spark và Machine Learning. Sau đó, bạn sẽ biết cách kết nối tới Spark bằng Python và tải dữ liệu CSV.
Bắt Đầu Chương
2

Phân loại

Giờ bạn đã quen với việc đưa dữ liệu vào Spark, chúng ta sẽ chuyển sang xây dựng hai loại mô hình phân loại: Decision Trees và Logistic Regression. Bạn cũng sẽ tìm hiểu một vài cách tiếp cận để chuẩn bị dữ liệu.
Bắt Đầu Chương
Machine Learning với PySpark
Hoàn
Thành

Nhận Giấy Chứng Nhận Hoàn Thành

Thêm chứng chỉ này vào hồ sơ LinkedIn, CV hoặc sơ yếu lý lịch của ban
Chia sẻ trên mạng xã hội và trong đánh giá hiệu suất của ban
Đăng ký ngay

Tham gia cùng hơn 19 triệu học viên và bắt đầu Machine Learning với PySpark ngay hôm nay!

Tạo Tài Khoản Miễn Phí

Tiếp tục với GoogleHiển thị thêm tùy chọn

hoặc


Bằng cách tiếp tục, bạn chấp nhận Điều khoản sử dụng, Chính sách bảo mật và việc dữ liệu của bạn được lưu trữ tại Hoa Kỳ.

Phát triển kỹ năng dữ liệu với DataCamp cho thiết bị di động

Tiến bộ mọi lúc mọi nơi với các khóa học cho thiết bị di động và thử thách lập trình 5 phút hằng ngày.