Build your ultimate AI agent
Descrierea cursului
Ai întâlnit vreodată un site web care afișează statistici, recenzii de produse sau prețuri într-un format nepotrivit pentru analiză? Autoritățile și furnizorii de date publică adesea informații în tabele bine formatate, dar nu toate site-urile oferă un buton de descărcare. Nu te îngrijora! În acest curs, vei învăța cum să colectezi și să descarci eficient date de pe orice site web folosind R. Vei automatiza extragerea și procesarea datelor de pe Wikipedia cu ajutorul pachetelor rvest și httr. Prin exerciții practice, îți vei aprofunda înțelegerea HTML și CSS – elementele de bază ale paginilor web – și vei crea fluxuri de lucru pentru colectarea datelor mai fiabile și mai eficiente.
Cerințe prealabile
Curriculum
Structura cursului
1
Introducere în HTML și Web Scraping
În acest capitol, vei face cunoștință cu HyperText Markup Language (HTML), un limbaj declarativ folosit pentru a structura site-urile web moderne. Folosind biblioteca rvest, vei învăța cum să interoghezi elemente HTML simple și să extragi primul tău tabel.
- Introducere în HTML50 XP
- Citește HTML100 XP
- Atenție la erorile de sintaxă!50 XP
- Navigarea în HTML50 XP
- Selectează toți copiii unei liste100 XP
- Parsează hyperlinkuri într-un data frame100 XP
- Extrage primul tău tabel50 XP
- Ordinea corectă a elementelor dintr-un tabel100 XP
- Transformă un tabel într-un data frame cu html_table()100 XP
2
Navigare și selecție cu CSS
Cascading Style Sheets (CSS) descriu modul în care elementele HTML sunt afișate pe o pagină web, inclusiv culorile, fonturile și aspectul general. În acest capitol, vei înțelege de ce selectorii și combinatorii CSS sunt esențiali în web scraping.
3
Selecție avansată cu XPATH
Selectorii CSS pe care i-ai învățat în capitolul anterior sunt puternici, dar au limitările lor – de exemplu, nu pot selecta noduri pe baza proprietăților descendenților lor. Aici intervine XPath! Cu acest limbaj de interogare, poți naviga și extrage date chiar și din cel mai complex HTML.
4
Bune practici în Web Scraping
Acum că știi cum să extragi conținut din pagini web, e momentul să privești în culise. În acest ultim capitol, vei învăța de ce cererile HTTP stau la baza oricărei acțiuni de scraping și cum pot fi personalizate pentru a respecta bunele practici în web scraping.
R
Web Scraping în R
Curs
finalizat

