Build your ultimate AI agent
Description du cours
Vous êtes déjà tombé sur un site web qui affiche beaucoup de données — statistiques, avis produits, prix — dans un format peu adapté à l’analyse de données ? Il arrive que des organismes et autres producteurs publient leurs données dans des tableaux bien structurés. Mais tous ces sites n’offrent pas un bouton de téléchargement. Pas de panique : dans ce cours, vous apprendrez à collecter et télécharger efficacement des données depuis n’importe quel site avec R. Vous verrez comment automatiser le scraping et l’analyse de pages Wikipédia avec les packages rvest et httr. À travers des exercices pratiques, vous consoliderez aussi votre compréhension de HTML et CSS, les briques de base des pages web, pour rendre vos workflows de collecte plus fiables et plus efficaces.
Prérequis
Programme de formation
Plan du cours
1
Introduction à HTML et au web scraping
Dans ce chapitre, vous découvrirez le HyperText Markup Language (HTML), un langage déclaratif utilisé pour structurer les sites web modernes. Avec la bibliothèque rvest, vous apprendrez à interroger des éléments HTML simples et à extraire votre premier tableau.
- Introduction au HTML50 XP
- Lire du HTML100 XP
- Attention aux erreurs de syntaxe !50 XP
- Naviguer dans le HTML50 XP
- Sélectionner tous les enfants d’une liste100 XP
- Analyser des hyperliens dans un data frame100 XP
- Récupérez votre premier tableau50 XP
- Le bon ordre des éléments d’un tableau100 XP
- Transformer un tableau en data frame avec html_table()100 XP
2
Navigation et sélection avec CSS
Les feuilles de style en cascade (CSS) décrivent la façon dont les éléments HTML s’affichent sur une page web : couleurs, polices, mise en page générale. Dans ce chapitre, vous verrez pourquoi les sélecteurs et combinateurs CSS sont essentiels pour le web scraping.
3
Sélection avancée avec XPATH
Les sélecteurs CSS que vous avez découverts au chapitre précédent sont puissants, mais ils ont des limites, par exemple lorsque vous souhaitez sélectionner des nœuds en fonction des propriétés de leurs descendants. XPath vient à la rescousse ! Grâce à ce langage de requête, vous pouvez naviguer et extraire même le HTML le plus récalcitrant.
4
Bonnes pratiques de scraping
Maintenant que vous savez extraire du contenu de pages web, passons dans les coulisses. Dans ce dernier chapitre, vous verrez pourquoi les requêtes HTTP sont à la base de toute opération de scraping et comment les personnaliser pour respecter les bonnes pratiques en web scraping.
R
Web scraping en R
Cours
terminé

