After doing these courses, I feel confident creating professional visualizations and dashboards
Descrierea cursului
Ca orice curs de fundamente, Introducere în Prelucrarea Limbajului Natural în R este conceput să îți ofere instrumentele necesare pentru a începe să analizezi text. Prelucrarea limbajului natural (NLP) este un domeniu în continuă creștere în știința datelor, cu progrese remarcabile în ultimul deceniu. Acest curs acoperă elementele de bază ale acestor subiecte și te pregătește să îți extinzi capacitățile de analiză. Vom explora expresii regulate, modelare tematică, recunoașterea entităților denumite și multe altele, cu exemple concrete care îți pot servi ca punct de plecare pentru analizele viitoare.
Cerințe prealabile
Curriculum
Structura cursului
1
Fundamente esențiale
Capitolul 1 al cursului Introducere în Prelucrarea Limbajului Natural te pregătește să rulezi prima ta analiză pe text. Vei explora expresiile regulate și tokenizarea – două dintre cele mai frecvente componente ale majorității sarcinilor de analiză. Cu expresii regulate poți căuta orice tipar îți imaginezi, iar cu tokenizarea poți pregăti și curăța textul pentru analize mai sofisticate. Acest capitol este esențial pentru a aborda tehnicile pe care le vei învăța în capitolele următoare.
- Bazele expresiilor regulate50 XP
- Exersarea sintaxei cu grep100 XP
- Explorarea funcțiilor pentru expresii regulate.100 XP
- Tokenizare50 XP
- Funcțiile din tidytext50 XP
- Tokenizare: propoziții100 XP
- Noțiuni de bază despre curățarea textului50 XP
- Preprocesarea textului: eliminarea cuvintelor de oprire100 XP
- Preprocesarea textului: Stemming100 XP
2
Reprezentări ale textului
În acest capitol, vei învăța cele mai comune și studiate metode de analiză a textului. Vei vedea cum se creează un corpus de text, cum se extinde o reprezentare bag-of-words într-o matrice TFIDF și cum se folosesc metrici de similaritate cosinus pentru a determina cât de asemănătoare sunt două texte. Îți consolidezi astfel bazele pentru practicarea NLP, înainte de a trece la aplicații în capitolele 3 și 4.
3
Aplicații: Clasificare și modelare tematică
Capitolul 3 se concentrează pe două abordări frecvente în analiza textului: modelarea pentru clasificare și modelarea tematică. Dacă lucrezi la proiecte de analiză a textului, vei folosi cu siguranță una sau ambele metode. Acest capitol te învață cum să aplici ambele tehnici și îți oferă perspective practice despre cum să le abordezi eficient.
4
Tehnici avansate
În capitolul 4 acoperim două tehnici de bază din prelucrarea limbajului natural: analiza sentimentelor și reprezentările vectoriale ale cuvintelor (word embeddings). Acestea sunt tehnici esențiale pentru oricine învață fundamentele analizei textului. În plus, vei face o scurtă incursiune în BERT, etichetarea morfosintactică și recunoașterea entităților denumite. Deoarece în acest curs sunt acoperite aproape 15 tehnici de analiză diferite, capitolul 4 se încheie cu o recapitulare a tuturor metodelor pe care le-ai învățat.
R
Introducere în Prelucrarea Limbajului Natural în R
Curs
finalizat

