Accéder au contenu principal

Cours

Web Scraping en Python

Intermédiaire4 h

Apprenez à récupérer et à analyser des informations provenant d'internet à l'aide de la bibliothèque Python scrapy.

Python4 h17 vidéos56 exercices4,500 XP93,505Attestation de réussite

Créez votre compte gratuit

Continuer avec Google
ou
En continuant, vous acceptez nos Conditions d’utilisation, notre notre Politique de confidentialité et que vos données sont stockées aux États-Unis.

Plébiscité par des apprenants dans des milliers d’entreprises

Description du cours

La capacité à construire des outils capables de récupérer et d'analyser des informations stockées sur l'internet a été et continue d'être précieuse dans de nombreux domaines de la science des données. Dans ce cours, vous apprendrez à naviguer et à analyser le code html, et à construire des outils pour explorer automatiquement les sites web. Bien que notre scraping soit réalisé à l'aide de la bibliothèque polyvalente Python scrapy, de nombreuses techniques que vous apprenez dans ce cours peuvent également être appliquées à d'autres bibliothèques Python populaires, notamment BeautifulSoup et Selenium. A l'issue de ce cours, vous disposerez d'un modèle mental solide de la structure html, vous serez capable de construire des outils pour analyser le code html et accéder aux informations souhaitées, et de créer un spider scrapy simple pour explorer le web à grande échelle.

Prérequis

Programme de formation

Plan du cours

1

Débuter en HTML

Apprenez la structure de HTML. Nous commencerons par expliquer pourquoi le web scraping peut être un complément précieux à votre boîte à outils de science des données, puis nous nous pencherons sur les bases de HTML. Nous terminons ce chapitre par une brève introduction à la notation XPath, qui est utilisée pour naviguer dans les éléments du code HTML.
Commencer le chapitre
3

CSS Localisateurs, chaînage et réponses

Apprenez la syntaxe du localisateur CSS et commencez à jouer avec l'idée d'enchaîner des localisateurs CSS avec XPath. Nous présentons également les objets Response, qui se comportent comme des sélecteurs mais nous donnent des outils supplémentaires pour mobiliser nos efforts de scraping sur plusieurs sites web.
Commencer le chapitre
4

Araignées

Apprenez à créer des robots d'indexation avec scrapy. Ces spiders scrapy parcourront le web à travers de multiples pages, en suivant les liens pour scraper chacune de ces pages automatiquement selon les procédures que nous avons apprises dans les chapitres précédents.
Commencer le chapitre

Web Scraping en Python

Cours
terminé

Obtenir un certificat d'achèvement

S’inscrire maintenant

Apprenez où que vous soyez avec l'application DataCamp

Même en déplacement, suivez quotidiennement nos cours mobiles et nos défis de codage de 5 minutes.