Accéder au contenu principal

Cours

Web Scraping en Python

Intermédiaire4 h

Apprenez à récupérer et à analyser des informations provenant d'internet à l'aide de la bibliothèque Python scrapy.

Python4 h17 vidéos56 exercices4,500 XP94,080Attestation de réussite

Créez votre compte gratuit

Continuer avec Google
ou
En continuant, vous acceptez notre conditions d'utilisation, nos politique de confidentialité et que vos données soient stockées aux États-Unis.

Plébiscité par les apprenants de milliers d'entreprises

Vous formez une équipe ?

Essayer pour les entreprises

Description du cours

La capacité à construire des outils capables de récupérer et d'analyser des informations stockées sur l'internet a été et continue d'être précieuse dans de nombreux domaines de la science des données. Dans ce cours, vous apprendrez à naviguer et à analyser le code html, et à construire des outils pour explorer automatiquement les sites web. Bien que notre scraping soit réalisé à l'aide de la bibliothèque polyvalente Python scrapy, de nombreuses techniques que vous apprenez dans ce cours peuvent également être appliquées à d'autres bibliothèques Python populaires, notamment BeautifulSoup et Selenium. A l'issue de ce cours, vous disposerez d'un modèle mental solide de la structure html, vous serez capable de construire des outils pour analyser le code html et accéder aux informations souhaitées, et de créer un spider scrapy simple pour explorer le web à grande échelle.

Prérequis

Programme de formation

Plan du cours

1

Débuter en HTML

Apprenez la structure de HTML. Nous commencerons par expliquer pourquoi le web scraping peut être un complément précieux à votre boîte à outils de science des données, puis nous nous pencherons sur les bases de HTML. Nous terminons ce chapitre par une brève introduction à la notation XPath, qui est utilisée pour naviguer dans les éléments du code HTML.
Commencer le chapitre
3

CSS Localisateurs, chaînage et réponses

Apprenez la syntaxe du localisateur CSS et commencez à jouer avec l'idée d'enchaîner des localisateurs CSS avec XPath. Nous présentons également les objets Response, qui se comportent comme des sélecteurs mais nous donnent des outils supplémentaires pour mobiliser nos efforts de scraping sur plusieurs sites web.
Commencer le chapitre
4

Araignées

Apprenez à créer des robots d'indexation avec scrapy. Ces spiders scrapy parcourront le web à travers de multiples pages, en suivant les liens pour scraper chacune de ces pages automatiquement selon les procédures que nous avons apprises dans les chapitres précédents.
Commencer le chapitre

Web Scraping en Python

Cours
terminé

Obtenez un certificat de réussite

S'inscrire maintenant

Développez vos compétences en données avec DataCamp for Mobile

Progressez où que vous soyez grâce à nos cours mobiles et à nos défis de code quotidiens de 5 minutes.