Build your ultimate AI agent
Mô tả khóa học
Bạn đã từng gặp một trang web hiển thị rất nhiều dữ liệu như thống kê, đánh giá sản phẩm hoặc giá cả theo định dạng không sẵn sàng cho việc phân tích dữ liệu chưa? Thông thường, các cơ quan và nhà cung cấp dữ liệu khác công bố dữ liệu của họ trong các bảng được định dạng gọn gàng. Tuy nhiên, không phải trang nào cũng có nút tải xuống — nhưng đừng lo. Trong khóa học này, bạn sẽ học cách thu thập và tải dữ liệu từ bất kỳ trang web nào bằng R một cách hiệu quả. Bạn sẽ học cách tự động hóa việc thu thập và phân tích Wikipedia bằng các gói rvest và httr. Qua các bài tập thực hành, bạn cũng sẽ mở rộng hiểu biết về HTML và CSS — những khối xây dựng của trang web — đồng thời giúp quy trình thu thập dữ liệu của bạn ít lỗi hơn và hiệu quả hơn.
Yêu cầu tiên quyết
Chương trình học
Đề cương khóa học
1
Giới thiệu về HTML và Web Scraping
Trong chương này, bạn sẽ được giới thiệu về Hyper Text Markup Language (HTML), một ngôn ngữ khai báo dùng để cấu trúc các trang web hiện đại. Sử dụng thư viện rvest, bạn sẽ học cách truy vấn các phần tử HTML đơn giản và thu thập bảng đầu tiên của mình.
- Giới thiệu về HTML50 XP
- Đọc HTML100 XP
- Cẩn thận lỗi cú pháp!50 XP
- Điều hướng HTML50 XP
- Chọn tất cả phần tử con của một danh sách100 XP
- Phân tích (parse) siêu liên kết thành một data frame100 XP
- Thu thập bảng đầu tiên của bạn50 XP
- Thứ tự đúng của các phần tử bảng100 XP
- Chuyển một bảng thành data frame với html_table()100 XP
2
Điều hướng và chọn với CSS
Cascading Style Sheets (CSS) mô tả cách các phần tử HTML được hiển thị trên trang web, bao gồm màu sắc, phông chữ và bố cục tổng thể. Trong chương này, bạn sẽ học vì sao bộ chọn (selector) và bộ kết hợp (combinator) của CSS là thành phần then chốt cho web scraping.
3
Lựa chọn nâng cao với XPATH
Các bộ chọn CSS bạn đã biết ở chương trước rất mạnh nhưng cũng có giới hạn. Ví dụ, khi bạn muốn chọn các nút dựa trên thuộc tính của phần tử con cháu của chúng. Lúc này XPath sẽ cứu nguy! Với ngôn ngữ truy vấn này, bạn có thể điều hướng và thu thập dữ liệu ngay cả từ HTML rối rắm nhất.
4
Thực hành tốt khi Web Scraping
Giờ bạn đã biết cách trích xuất nội dung từ các trang web, đã đến lúc nhìn “hậu trường”. Trong chương cuối, bạn sẽ học vì sao các yêu cầu HTTP là nền tảng của mọi hành động scraping và cách tùy chỉnh chúng để tuân thủ các thực hành tốt nhất trong web scraping.
R
Web Scraping bằng R
Hoàn
thành khóa học

