Build your ultimate AI agent
课程介绍
构建能够从互联网检索并解析信息的工具,一直以来都是数据科学多个领域的重要能力。本课程将带您学习如何浏览并解析 HTML 代码,并构建自动抓取网站的工具。虽然课程主要使用功能强大的 Python 库 scrapy 进行爬取,但您在本课中学到的许多技巧也适用于其他常见的 Python 库,例如 BeautifulSoup 和 Selenium。完成本课程后,您将对 HTML 结构形成清晰的心智模型,能够构建工具来解析 HTML 代码并提取所需信息,并创建简单的 scrapy 爬虫,以规模化抓取网页。
先修要求
课程大纲
课程大纲
1
HTML 入门
学习 HTML 的结构。我们先说明为什么网页爬取是您数据科学工具箱中的有价值补充,然后介绍 HTML 的基础知识。章节最后将简要介绍用于在 HTML 代码中导航元素的 XPath 表示法。
2
XPath 与选择器
利用 XPath 语法探索 scrapy 选择器。这两个概念将帮助您逐步掌握抓取 HTML 文档。
3
CSS 定位器、链式选择与响应
学习 CSS 定位器语法,并尝试将 CSS 定位器与 XPath 进行链式组合。我们还将介绍 Response 对象。它的行为与 Selector 相似,但提供了额外工具,帮助我们将爬取扩展到多个网站。
4
爬虫
学习使用 scrapy 创建网络爬虫。这些 scrapy 爬虫会跨多页在网页间跳转,按照前几章所学的方法自动跟随链接抓取每一页。
Python Web 爬取
课程完成

