跳至主要内容

课程

Python Web 爬取

中级4 小时

学习使用 Python 库 scrapy 从互联网检索并解析信息。

Python4 小时17 个视频56 个练习4,500 XP94,080成就证明

创建您的免费账户

继续使用 Google
继续即表示您接受我们的 使用条款,我们的 隐私政策 ,并且您的数据存储在美国。

深受数千家公司学习者的喜爱

要培训团队?

试用企业版

课程简介

构建能够从互联网检索并解析信息的工具,一直以来都是数据科学多个领域的重要能力。本课程将带您学习如何浏览并解析 HTML 代码,并构建自动抓取网站的工具。虽然课程主要使用功能强大的 Python 库 scrapy 进行爬取,但您在本课中学到的许多技巧也适用于其他常见的 Python 库,例如 BeautifulSoup 和 Selenium。完成本课程后,您将对 HTML 结构形成清晰的心智模型,能够构建工具来解析 HTML 代码并提取所需信息,并创建简单的 scrapy 爬虫,以规模化抓取网页。

先修要求

课程体系

课程大纲

1

HTML 入门

学习 HTML 的结构。我们先说明为什么网页爬取是您数据科学工具箱中的有价值补充,然后介绍 HTML 的基础知识。章节最后将简要介绍用于在 HTML 代码中导航元素的 XPath 表示法。
开始本章
3

CSS 定位器、链式选择与响应

Python Web 爬取

课程已完成

获得成就证明

立即报名

通过 DataCamp 移动版提升您的数据技能

借助我们的移动课程和每日 5 分钟编程挑战,随时随地取得进步。