Sari la conținutul principal

Curs

Introducere în Spark SQL în Python

Avansat4 h

Învață să manipulezi date și să creezi seturi de caracteristici pentru machine learning în Spark folosind SQL în Python.

Python4 h{count, plural, one {# video} few {# videoclipuri} other {# de videoclipuri}}{count, plural, one {# exercițiu} few {# exerciții} other {# de exerciții}}4,200 XP20,601Declarație de finalizare

Creează-ți contul gratuit

Continuă cu Google
sau
Continuând, accepți Termeni de utilizare, al nostru Politica de confidențialitate și că datele tale sunt stocate în SUA.

Iubit de cursanți din mii de companii

Instruiești o echipă?

Încearcă pentru business

Descrierea cursului

Învață Spark SQL

Dacă ești familiarizat cu SQL și ai auzit lucruri grozave despre Apache Spark, acest curs este pentru tine. Apache Spark este un framework de calcul pentru procesarea big data, iar Spark SQL este o componentă a Apache Spark. Acest curs de patru ore îți va arăta cum să duci Spark la un nou nivel de utilitate, folosind funcții SQL avansate, precum funcțiile de fereastră.

Pe parcursul a patru capitole, vei folosi Spark SQL pentru a analiza date de tip serie temporală, a extrage cele mai frecvente cuvinte dintr-un document text, a crea seturi de caracteristici din text în limbaj natural și a le folosi pentru a prezice ultimul cuvânt dintr-o propoziție folosind regresia logistică.

Descoperă utilizările Spark SQL

Vei începe prin a crea și a interoga un tabel SQL în Spark, precum și prin a învăța cum să folosești funcțiile de fereastră SQL pentru a realiza sume cumulative, diferențe cumulative și alte operațiuni.

În continuare, vei explora cum să folosești funcția window în Spark SQL pentru procesarea limbajului natural, inclusiv utilizarea unei analize cu fereastră mobilă pentru a identifica secvențe comune de cuvinte.

În capitolul 3, vei învăța cum să folosești interfața SQL Spark UI pentru a face cache în mod corect pentru DataFrame-uri și tabele SQL înainte de a explora cele mai bune practici pentru logging în Spark.

În cele din urmă, folosești toate abilitățile învățate până acum pentru a încărca și a tokeniza textul brut înainte de a extrage secvențe de cuvinte. Apoi vei folosi regresia logistică pentru a clasifica textul, folosind date brute de limbaj natural pentru a antrena un clasificator de text.

Obțineți o introducere completă în Spark SQL

La finalul cursului, vei avea o înțelegere solidă a Spark SQL și vei înțelege cum Spark combină puterea calculului distribuit cu ușurința de utilizare a Python și SQL.

Cerințe prealabile

Curriculum

Structura cursului

1

PySpark SQL

În acest capitol vei învăța cum să creezi și să interoghezi un tabel SQL în Spark. Spark SQL aduce expresivitatea SQL în Spark. Vei învăța, de asemenea, cum să folosești funcțiile de fereastră SQL în Spark. Funcțiile de fereastră efectuează calcule pe rânduri aflate în relație cu rândul curent. Acestea simplifică semnificativ obținerea unor rezultate care sunt dificil de exprimat folosind doar join-uri și agregări tradiționale. Vom folosi funcții de fereastră pentru a calcula sume cumulative, diferențe cumulative și alte operații dificil de realizat în SQL de bază.
Începe capitolul
3

Cache, logare și interfața Spark UI

În capitolele anterioare ai învățat cum să folosești expresivitatea funcțiilor de fereastră SQL. Această expresivitate face acum important să înțelegi cum să stochezi corect în cache DataFrames și tabele SQL. Este, de asemenea, important să știi cum să evaluezi aplicația. Vei învăța să faci asta folosind interfața Spark UI. Vei învăța și o bună practică pentru logare în Spark. Spark SQL aduce cu sine un instrument util pentru optimizarea performanței interogărilor: planul de execuție a interogărilor. Vei învăța cum să folosești planul de execuție pentru a evalua proveniența unui DataFrame.
Începe capitolul
4

Clasificarea textului

Capitolele anterioare ți-au oferit instrumentele necesare pentru a încărca text brut, a-l tokeniza și a extrage secvențe de cuvinte. Acest lucru este deja foarte util pentru analiză, dar și pentru învățarea automată. Ceea ce ai învățat se reunește acum prin utilizarea regresiei logistice pentru clasificarea textului. La finalul acestui capitol, vei fi încărcat date brute de text în limbaj natural și le vei fi folosit pentru a antrena un clasificator de text.
Începe capitolul

Introducere în Spark SQL în Python

Curs
finalizat

Obține Declarația de Realizare

Înscrie-te acum

Dezvoltă-ți competențele în date cu DataCamp pentru mobil

Progresează oricând cu cursurile noastre mobile și provocările zilnice de programare de 5 minute.

Introducere în Spark SQL în Python | DataCamp