Hoppa till huvudinnehållet

Kurs

Grunderna i Big Data med PySpark

Avancerad4 tim

Lär dig grunderna i att arbeta med big data med PySpark.

Python4 tim16 videor55 övningar4,600 XP65,822Intyg om fullgjord kurs

Skapa ditt kostnadsfria konto

Fortsätt med Google
eller
Genom att fortsätta godkänner du våra Användarvillkor, vår Integritetspolicy och att dina data lagras i USA.

Älskad av elever på tusentals företag

Utbildar ett team?

Prova för företag

Kursbeskrivning

Big Data har diskuterats flitigt de senaste åren och har nu blivit en självklar del av många företags vardag. Men vad är egentligen Big Data? Den här kursen går igenom grunderna i Big Data via PySpark. Spark är ett ramverk för klusterdatorer som är optimerat för Big Data och erbjuder en generell plattform för databearbetning. Med Spark kan du köra program upp till 100 gånger snabbare i minnet, eller 10 gånger snabbare på disk, jämfört med Hadoop. Du använder PySpark – ett Python-paket för Spark-programmering – tillsammans med kraftfulla bibliotek på hög nivå som SparkSQL och MLlib (för maskininlärning). Du utforskar William Shakespeares verk, analyserar FIFA 2018-data och utför klustring på genomiska datamängder. När du är klar med kursen har du fått en djupgående förståelse för PySpark och hur det används för allmän Big Data-analys.

Förkunskapskrav

Kursplan

Kursöversikt

1

Introduktion till Big Data-analys med Spark

Det här kapitlet introducerar Big Data och ger en översikt över de koncept och ramverk som används för att bearbeta Big Data. Du får förstå varför Apache Spark anses vara det bästa ramverket för Big Data.
Starta kapitel
4

Maskininlärning med PySpark MLlib

Grunderna i Big Data med PySpark

Kurs
slutförd

Tjäna intyg om genomförande

Registrera dig nu

Utveckla dina datakunskaper med DataCamp för mobil

Ta dig framåt var du än är med våra mobilkurser och dagliga 5-minuterskodningsutmaningar.