Build your ultimate AI agent
课程介绍
您是否遇到过这样的网站:展示了大量统计数据、产品评价或价格信息,但并不便于直接用于数据分析?不少机构和数据提供方会以整齐的表格发布数据。然而,并非所有网站都提供下载按钮。别担心!在本课程中,您将学习如何使用 R 高效地从任意网站收集并下载数据。您将学习如何借助 rvest 和 httr 包自动抓取并解析 Wikipedia。通过动手练习,您还会加深对 HTML 和 CSS(网页的构建基石)的理解,从而让数据采集流程更稳健、更高效。
先修要求
课程大纲
课程大纲
1
HTML 与网页抓取入门
在本章中,您将认识超文本标记语言(HTML),这是一种用于构建现代网站的声明式语言。借助 rvest 库,您将学习如何查询简单的 HTML 元素,并完成第一个表格的抓取。
2
使用 CSS 进行导航与选择
层叠样式表(CSS)用于描述网页上 HTML 元素的展示方式,包括颜色、字体和整体布局。在本章中,您将了解为何 CSS 选择器与连接符是网页抓取的关键工具。
3
用 XPATH 进行高级选择
上一章介绍的 CSS 选择器功能强大,但也有局限。例如,若您希望根据后代节点的属性来选择节点时,就需要借助 XPath。使用这种查询语言,您可以在复杂甚至糟糕的 HTML 结构中也能自如导航与抓取。
4
抓取的最佳实践
既然您已经会从网页中提取内容,是时候看看"幕后"了。在最后一章中,您将学习为何 HTTP 请求是每一次抓取操作的基础,以及如何自定义请求以遵循网页抓取的最佳实践。
R
R 语言网页抓取
课程完成

