Build your ultimate AI agent
Kursbeskrivning
I den här kursen lär du dig tekniker för att extrahera användbar information från text och omvandla den till ett format som lämpar sig för maskininlärningsmodeller. Mer specifikt lär du dig om POS-taggning, namngiven enhetsigenkänning, läsbarhetspoäng, n-gram- och tf-idf-modeller samt hur du implementerar dem med scikit-learn och spaCy. Du lär dig också att beräkna hur lika två dokument är varandra. Under kursens gång förutsäger du sentiment i filmrecensioner och bygger rekommendationssystem för filmer och TED Talks. När du är klar med kursen kan du utvinna viktiga särdrag ur valfri text och lösa några av de mest utmanande problemen inom datavetenskap!
Förkunskapskrav
Kursplan
Kursöversikt
1
Grundläggande särdrag och läsbarhetspoäng
Lär dig beräkna grundläggande särdrag som antal ord, antal tecken, genomsnittlig ordlängd och antal specialtecken (till exempel Twitter-hashtaggar och omnämnanden). Du lär dig också att beräkna läsbarhetspoäng och avgöra hur mycket utbildning som krävs för att förstå en text.
- Introduktion till NLP-särdragsextraktion50 XP
- Dataformat för ML-algoritmer50 XP
- One-hot-kodning100 XP
- Grundläggande särdragsextraktion50 XP
- Antal tecken i ryska tweets100 XP
- Ordantal i TED-föreläsningar100 XP
- Hashtags och omnämnanden i ryska tweets100 XP
- Läsbarhetstest50 XP
- Läsbarhet för 'The Myth of Sisyphus'100 XP
- Läsbarhet i olika publikationer100 XP
2
Textförbehandling, POS-taggning och NER
I det här kapitlet lär du dig om tokenisering och lemmatisering. Du lär dig sedan att utföra textrensning, ordklasstaggning och namngiven enhetsigenkänning med biblioteket spaCy. När du behärskar dessa koncept går du vidare och gör Gettysburgtalets text maskinvänlig, analyserar substantivanvändning i falska nyheter och identifierar personer som nämns i en artikel från TechCrunch.
3
N-gram-modeller
Lär dig om n-gram-modellering och använd det för att utföra sentimentanalys på filmrecensioner.
4
TF-IDF och likhetspoäng
Lär dig beräkna tf-idf-vikter och kosinuslikhet mellan två vektorer. Du använder dessa koncept för att bygga ett rekommendationssystem för filmer och ett för TED Talks. Avslutningsvis lär du dig om ordinbäddningar och använder ordvektorer för att beräkna likheter mellan olika låtar av Pink Floyd.
Funktionsutveckling för NLP i Python
Kurs
slutförd

