Build your ultimate AI agent
Opis kursu
W tym kursie poznasz techniki pozwalające wyodrębniać przydatne informacje z tekstu i przekształcać je do postaci odpowiedniej dla modeli uczenia maszynowego. Nauczysz się między innymi oznaczania części mowy, rozpoznawania jednostek nazewniczych, wskaźników czytelności, modeli n-gramów i tf-idf oraz sposobów ich implementacji przy użyciu scikit-learn i spaCy. Dowiesz się też, jak mierzyć podobieństwo między dokumentami. W trakcie kursu przewidzisz wydźwięk recenzji filmowych oraz zbudujesz systemy rekomendacji filmów i wykładów TED. Po ukończeniu kursu będziesz potrafić tworzyć kluczowe cechy z dowolnego tekstu i rozwiązywać jedne z najtrudniejszych problemów w dziedzinie nauki o danych!
Wymagania wstępne
Program kursu
Plan kursu
1
Podstawowe cechy i wskaźniki czytelności
Naucz się obliczać podstawowe cechy tekstu, takie jak liczba słów, liczba znaków, średnia długość słowa czy liczba znaków specjalnych (np. hashtagów i wzmianek na Twitterze). Poznasz też sposoby obliczania wskaźników czytelności i oceniania, jakiego poziomu wykształcenia wymaga zrozumienie danego tekstu.
- Wprowadzenie do inżynierii cech w NLP50 XP
- Format danych dla algorytmów uczenia maszynowego50 XP
- Kodowanie one-hot100 XP
- Podstawowa ekstrakcja cech50 XP
- Liczba znaków w rosyjskich tweetach100 XP
- Liczba słów w przemówieniach TED100 XP
- Hashtagi i wzmianki w rosyjskich tweetach100 XP
- Testy czytelności50 XP
- Czytelność eseju *Mit Syzyfa*100 XP
- Czytelność różnych publikacji100 XP
2
Przetwarzanie tekstu, oznaczanie części mowy i NER
W tym rozdziale poznasz tokenizację i lematyzację. Następnie nauczysz się oczyszczać tekst, oznaczać części mowy oraz rozpoznawać jednostki nazewnicze przy użyciu biblioteki spaCy. Po opanowaniu tych zagadnień przystąpisz do przetworzenia przemówienia gettysburskiego na postać przyjazną dla maszyn, przeanalizujesz użycie rzeczowników w fałszywych wiadomościach i zidentyfikujesz osoby wymienione w artykule TechCrunch.
3
Modele n-gramów
Poznaj modelowanie n-gramów i wykorzystaj je do analizy wydźwięku recenzji filmowych.
4
TF-IDF i miary podobieństwa
Naucz się obliczać wagi tf-idf oraz miarę podobieństwa cosinusowego między dwoma wektorami. Wykorzystasz te pojęcia do zbudowania systemu rekomendacji filmów i wykładów TED. Na koniec poznasz reprezentacje wektorowe słów i użyjesz ich do obliczania podobieństwa między różnymi piosenkami Pink Floyd.
Inżynieria cech dla NLP w Pythonie
Kurs
ukończony

