Build your ultimate AI agent
Descrierea cursului
În acest curs, vei învăța tehnici care îți vor permite să extragi informații utile din text și să le procesezi într-un format potrivit pentru aplicarea modelelor de ML. Mai concret, vei învăța despre etichetarea POS, recunoașterea entităților denumite, scorurile de lizibilitate, modelele n-gram și tf-idf, și cum să le implementezi folosind scikit-learn și spaCy. Vei învăța, de asemenea, să calculezi gradul de similaritate dintre două documente. Pe parcurs, vei prezice sentimentul recenziilor de filme și vei construi sisteme de recomandare pentru filme și TED Talk-uri. La finalul cursului, vei fi capabil să extragi caracteristici esențiale din orice text și să rezolvi unele dintre cele mai dificile probleme din domeniul științei datelor!
Cerințe prealabile
Curriculum
Structura cursului
1
Caracteristici de bază și scoruri de lizibilitate
Învață să calculezi caracteristici de bază precum numărul de cuvinte, numărul de caractere, lungimea medie a cuvintelor și numărul de caractere speciale (cum ar fi hashtag-urile și mențiunile de pe Twitter). Vei învăța, de asemenea, să calculezi scoruri de lizibilitate și să determini nivelul de educație necesar pentru a înțelege un text.
- Introducere în ingineria caracteristicilor pentru NLP50 XP
- Formatul datelor pentru algoritmii de ML50 XP
- Codificarea one-hot100 XP
- Extragerea caracteristicilor de bază50 XP
- Numărul de caractere al tweet-urilor rusești100 XP
- Numărul de cuvinte din discursurile TED100 XP
- Hashtag-uri și mențiuni în tweet-uri rusești100 XP
- Teste de lizibilitate50 XP
- Lizibilitatea eseului *Mitul lui Sisif*100 XP
- Lizibilitatea diferitelor publicații100 XP
2
Preprocesarea textului, etichetarea POS și NER
În acest capitol, vei învăța despre tokenizare și lematizare. Vei descoperi apoi cum să realizezi curățarea textului, etichetarea părților de vorbire și recunoașterea entităților denumite folosind biblioteca spaCy. După ce stăpânești aceste concepte, vei pregăti discursul de la Gettysburg pentru procesare automată, vei analiza utilizarea substantivelor în știrile false și vei identifica persoanele menționate într-un articol TechCrunch.
3
Modele N-Gram
Învață despre modelarea n-gram și folosește-o pentru a realiza analiza sentimentelor pe recenzii de filme.
4
TF-IDF și scoruri de similaritate
Învață să calculezi ponderi tf-idf și scorul de similaritate cosinus dintre doi vectori. Vei folosi aceste concepte pentru a construi un sistem de recomandare de filme și unul de TED Talk-uri. La final, vei explora și reprezentările vectoriale ale cuvintelor (word embeddings) și vei calcula similaritatea dintre diverse melodii ale formației Pink Floyd.
Ingineria caracteristicilor pentru NLP în Python
Curs
finalizat

