Chuyển đến nội dung chính

Khóa học

Machine Learning với PySpark

Nâng cao4 giờ

Học cách dự đoán từ dữ liệu với Apache Spark, dùng cây quyết định, hồi quy logistic, hồi quy tuyến tính, ensemble và pipeline.

Python4 giờ16 video56 bài tập4,550 XP29,838Giấy chứng nhận thành tích

Tạo tài khoản miễn phí

Tiếp tục với Google
hoặc
Bằng việc tiếp tục, ban chấp nhận Điều khoản sử dụng, của chúng tôi Chính sách bảo mật và rằng dữ liệu của bạn được lưu trữ tại Hoa Kỳ.

Được người học tại hàng nghìn công ty yêu thích

Đào tạo đội ngũ?

Dùng thử cho Doanh nghiệp

Mô tả khóa học

Học cách sử dụng Apache Spark cho học máy

Spark là một công cụ mạnh mẽ, đa năng để làm việc với Big Data. Spark xử lý minh bạch việc phân phối các tác vụ tính toán trên một cụm. Điều này có nghĩa là các thao tác diễn ra nhanh chóng, đồng thời cũng giúp bạn tập trung vào phân tích thay vì phải lo lắng về các chi tiết kỹ thuật. Trong khóa học này, bạn sẽ học cách đưa dữ liệu vào Spark rồi đi sâu vào ba thuật toán học máy cốt lõi của Spark: Hồi quy tuyến tính, hồi quy logistic/bộ phân loại, và tạo pipeline.

Xây dựng và Kiểm thử Cây Quyết định

Xây dựng cây quyết định của riêng bạn là một cách tuyệt vời để bắt đầu khám phá các mô hình học máy. Bạn sẽ sử dụng một thuật toán gọi là ‘Recursive Partitioning’ để chia dữ liệu thành hai lớp và tìm một biến dự báo trong dữ liệu của bạn tạo ra phép chia giàu thông tin nhất giữa hai lớp, rồi lặp lại hành động này với các nút tiếp theo. Sau đó, bạn có thể sử dụng cây quyết định của mình để đưa ra dự đoán với dữ liệu mới.

Làm chủ Hồi quy Logistic và Hồi quy Tuyến tính trong PySpark

Hồi quy logistic và hồi quy tuyến tính là những kỹ thuật học máy thiết yếu được PySpark hỗ trợ. Bạn sẽ học cách xây dựng và đánh giá các mô hình hồi quy logistic, trước khi chuyển sang tạo các mô hình hồi quy tuyến tính để giúp bạn tinh chỉnh các biến dự báo của mình chỉ còn những lựa chọn phù hợp nhất.

Đến cuối khóa học, bạn sẽ tự tin áp dụng kiến thức học máy mới học được, nhờ các nhiệm vụ thực hành và bộ dữ liệu luyện tập được tìm thấy xuyên suốt khóa học.

Yêu cầu tiên quyết

Chương trình học

Đề cương khóa học

1

Giới thiệu

Spark là một framework để làm việc với Big Data. Trong chương này, bạn sẽ tìm hiểu bối cảnh về Spark và Machine Learning. Sau đó, bạn sẽ biết cách kết nối tới Spark bằng Python và tải dữ liệu CSV.
Bắt đầu chương

Machine Learning với PySpark

Hoàn
thành khóa học

Nhận Chứng nhận Hoàn thành

Đăng ký ngay

Phát triển kỹ năng dữ liệu với DataCamp for Mobile

Tiến bộ mọi lúc mọi nơi với các khóa học di động và thử thách lập trình 5 phút hàng ngày.