Hoppa till huvudinnehållet

Kurs

Maskininlärning med PySpark

Avancerad4 tim

Förbättra dina prediktioner med Apache Spark: beslutsträd, logistisk regression, linjär regression, ensembler och pipelines.

Python4 tim16 videor56 övningar4,550 XP30,088Prestationsintyg

Skapa ditt gratiskonto

Fortsätt med Google
eller
Genom att fortsätta godkänner du vår användarvillkor, våra integritetspolicy och att dina uppgifter lagras i USA.

Uppskattad av lärande på tusentals företag

Utbildar du ett team?

Prova för företag

Kursbeskrivning

Lär dig använda Apache Spark för maskininlärning

Spark är ett kraftfullt och mångsidigt verktyg för att arbeta med Big Data. Spark hanterar smidigt fördelningen av beräkningsuppgifter över ett kluster. Detta innebär att operationerna går snabbt, men det gör också att du kan fokusera på analysen istället för att oroa dig för tekniska detaljer. I den här kursen lär du dig hur du får in data i Spark och sedan fördjupar du dig i de tre grundläggande algoritmerna för Spark Machine Learning: Linjär regression, logistisk regression/klassificerare och att skapa pipelines.

Bygg och testa besluts­träd

Att bygga egna besluts­träd är ett utmärkt sätt att börja utforska maskininlärnings­modeller. Du kommer att använda en algoritm som kallas "Recursive Partitioning" för att dela upp data i två klasser och hitta en prediktor i din data som ger den mest informativa uppdelningen av de två klasserna, och sedan upprepa detta för ytterligare noder. Du kan sedan använda ditt besluts­träd för att göra förutsägelser med ny data.

Bli expert på logistisk och linjär regression i PySpark

Logistisk och linjär regression är viktiga tekniker inom maskininlärning som stöds av PySpark. Du kommer att lära dig att bygga och utvärdera logistiska regressionsmodeller, innan du går vidare till att skapa linjära regressionsmodeller för att hjälpa dig att förfina dina prediktorer till endast de mest relevanta alternativen.

I slutet av kursen kommer du att känna dig säker på att använda dina nya kunskaper inom machine learning, tack vare praktiska uppgifter och övningsdata som finns genom hela kursen.

Förkunskapskrav

Kursplan

Kursöversikt

1

Introduktion

Spark är ett ramverk för att arbeta med Big Data. I det här kapitlet får du en bakgrund till Spark och maskininlärning. Du lär dig sedan hur du ansluter till Spark med Python och läser in CSV-data.
Starta kapitel

Maskininlärning med PySpark

Kurs
slutförd

Tjäna ett prestationsbevis

Registrera dig nu

Utveckla dina datafärdigheter med DataCamp for Mobile

Gör framsteg på språng med våra mobilkurser och dagliga femminuters kodningsutmaningar.