700+ courses, half price
Descrizione del corso
Ti è mai capitato di trovare un sito pieno di dati—statistiche, recensioni di prodotti o prezzi—ma in un formato poco adatto all’analisi? Spesso enti e altri fornitori pubblicano i dati in tabelle ben formattate. Tuttavia, non tutti questi siti includono un pulsante di download: niente panico. In questo corso imparerai a raccogliere e scaricare in modo efficiente dati da qualsiasi sito web usando R. Vedrai come automatizzare lo scraping e il parsing di Wikipedia con i pacchetti rvest e httr. Con esercizi pratici, approfondirai anche HTML e CSS, i mattoni delle pagine web, rendendo i tuoi flussi di raccolta dati meno soggetti a errori e più efficienti.
Prerequisiti
Programma
Struttura del corso
1
Introduzione a HTML e al web scraping
In questo capitolo conoscerai l’Hyper Text Markup Language (HTML), un linguaggio dichiarativo usato per strutturare i siti web moderni. Con la libreria rvest imparerai a interrogare semplici elementi HTML e a eseguire lo scraping della tua prima tabella.
- Introduzione a HTML50 XP
- Leggere HTML100 XP
- Attenzione agli errori di sintassi!50 XP
- Navigare nell'HTML50 XP
- Seleziona tutti i figli di una lista100 XP
- Analizza gli hyperlink in un data frame100 XP
- Estrai la tua prima tabella50 XP
- L'ordine corretto degli elementi di una tabella100 XP
- Trasforma una tabella in un data frame con html_table()100 XP
2
Navigazione e selezione con CSS
I Cascading Style Sheets (CSS) descrivono come gli elementi HTML vengono visualizzati in una pagina web, inclusi colori, font e layout generale. In questo capitolo scoprirai perché i selettori e i combinatori CSS sono ingredienti fondamentali per il web scraping.
3
Selezioni avanzate con XPATH
I selettori CSS che hai visto nel capitolo precedente sono potenti, ma hanno dei limiti. Per esempio, quando vuoi selezionare nodi in base alle proprietà dei loro discendenti. Entra in gioco XPath! Con questo linguaggio di query puoi navigare ed estrarre anche l’HTML più ostico.
4
Best practice per lo scraping
Ora che sai come estrarre contenuti dalle pagine web, è il momento di guardare dietro le quinte. In questo capitolo finale imparerai perché le richieste HTTP sono la base di ogni operazione di scraping e come personalizzarle per rispettare le best practice del web scraping.
R
Web scraping in R
Corso
completato

