Khóa học
Machine Learning với PySpark
Nâng caoTrình độ kỹ năng
Đã cập nhật tháng 11, 2025
SparkMachine Learning4 gio16 video56 Bài tập4,550 XP29,770Giấy chứng nhận Thành tích
Tạo Tài Khoản Miễn Phí
Tiếp tục với GoogleHiển thị thêm tùy chọnhoặc
Bằng cách tiếp tục, bạn chấp nhận Điều khoản sử dụng, Chính sách bảo mật và việc dữ liệu của bạn được lưu trữ tại Hoa Kỳ.
Được người học tại hàng ngàn công ty yêu thích
Đào tạo một đội ngũ?
Dùng thử cho Doanh nghiệpMô tả khóa học
Học cách sử dụng Apache Spark cho học máy
Spark là một công cụ mạnh mẽ, đa năng để làm việc với Big Data. Spark xử lý minh bạch việc phân phối các tác vụ tính toán trên một cụm. Điều này có nghĩa là các thao tác diễn ra nhanh chóng, đồng thời cũng giúp bạn tập trung vào phân tích thay vì phải lo lắng về các chi tiết kỹ thuật. Trong khóa học này, bạn sẽ học cách đưa dữ liệu vào Spark rồi đi sâu vào ba thuật toán học máy cốt lõi của Spark: Hồi quy tuyến tính, hồi quy logistic/bộ phân loại, và tạo pipeline.Xây dựng và Kiểm thử Cây Quyết định
Xây dựng cây quyết định của riêng bạn là một cách tuyệt vời để bắt đầu khám phá các mô hình học máy. Bạn sẽ sử dụng một thuật toán gọi là ‘Recursive Partitioning’ để chia dữ liệu thành hai lớp và tìm một biến dự báo trong dữ liệu của bạn tạo ra phép chia giàu thông tin nhất giữa hai lớp, rồi lặp lại hành động này với các nút tiếp theo. Sau đó, bạn có thể sử dụng cây quyết định của mình để đưa ra dự đoán với dữ liệu mới.Làm chủ Hồi quy Logistic và Hồi quy Tuyến tính trong PySpark
Hồi quy logistic và hồi quy tuyến tính là những kỹ thuật học máy thiết yếu được PySpark hỗ trợ. Bạn sẽ học cách xây dựng và đánh giá các mô hình hồi quy logistic, trước khi chuyển sang tạo các mô hình hồi quy tuyến tính để giúp bạn tinh chỉnh các biến dự báo của mình chỉ còn những lựa chọn phù hợp nhất.Đến cuối khóa học, bạn sẽ tự tin áp dụng kiến thức học máy mới học được, nhờ các nhiệm vụ thực hành và bộ dữ liệu luyện tập được tìm thấy xuyên suốt khóa học.
Điều kiện tiên quyết
Supervised Learning with scikit-learnIntroduction to PySpark1
Giới thiệu
Spark là một framework để làm việc với Big Data. Trong chương này, bạn sẽ tìm hiểu bối cảnh về Spark và Machine Learning. Sau đó, bạn sẽ biết cách kết nối tới Spark bằng Python và tải dữ liệu CSV.
2
Phân loại
Giờ bạn đã quen với việc đưa dữ liệu vào Spark, chúng ta sẽ chuyển sang xây dựng hai loại mô hình phân loại: Decision Trees và Logistic Regression. Bạn cũng sẽ tìm hiểu một vài cách tiếp cận để chuẩn bị dữ liệu.
3
Hồi quy
Tiếp theo, bạn sẽ học cách tạo các mô hình Linear Regression. Bạn cũng sẽ biết cách tăng cường dữ liệu bằng cách xây dựng các biến dự báo mới cũng như một cách tiếp cận vững chắc để chỉ chọn những biến dự báo liên quan nhất.
4
Ensembles & Pipelines
Cuối cùng, bạn sẽ học cách làm cho mô hình hiệu quả hơn. Bạn sẽ biết cách dùng pipelines để giúp mã rõ ràng và dễ bảo trì hơn. Sau đó, bạn sẽ dùng cross-validation để kiểm tra mô hình tốt hơn và chọn tham số phù hợp. Cuối cùng, bạn sẽ thực hành với hai loại mô hình ensemble.
Machine Learning với PySpark
Hoàn Thành
Nhận Giấy Chứng Nhận Hoàn Thành
Thêm chứng chỉ này vào hồ sơ LinkedIn, CV hoặc sơ yếu lý lịch của banChia sẻ trên mạng xã hội và trong đánh giá hiệu suất của banĐăng ký ngay
Tham gia cùng hơn 19 triệu học viên và bắt đầu Machine Learning với PySpark ngay hôm nay!
Tạo Tài Khoản Miễn Phí
Tiếp tục với GoogleHiển thị thêm tùy chọnhoặc
Bằng cách tiếp tục, bạn chấp nhận Điều khoản sử dụng, Chính sách bảo mật và việc dữ liệu của bạn được lưu trữ tại Hoa Kỳ.
Phát triển kỹ năng dữ liệu với DataCamp cho thiết bị di động
Tiến bộ mọi lúc mọi nơi với các khóa học cho thiết bị di động và thử thách lập trình 5 phút hằng ngày.