Перейти до основного вмісту

Курс

Інженерія ознак для NLP у Python

Середній4 год

Навчіться методів вилучати корисну інформацію з тексту та обробляти її у формат, придатний для машинного навчання.

Python4 год15 відео52 вправ4,200 XP29,424Свідоцтво про досягнення

Створіть безкоштовний обліковий запис

Продовжити через Google
або
Продовжуючи, ви приймаєте наші Умови використання, наш Політика конфіденційності і що ваші дані зберігаються в США.

Улюблений учнями у тисячах компаній

Навчаєте команду?

Спробувати для бізнесу

Опис курсу

У цьому курсі ви вивчите прийоми, що дають змогу видобувати корисну інформацію з тексту та перетворювати її у формат, придатний для застосування моделей ML. Зокрема, ви ознайомитеся з POS-розміткою, розпізнаванням іменованих сутностей, індексами читабельності, моделями n-gram та tf-idf і тим, як реалізувати їх у scikit-learn і spaCy. Ви також навчитеся обчислювати, наскільки подібні два документи між собою. У процесі ви передбачатимете тональність відгуків на фільми та створите рекомендаційні системи для фільмів і виступів TED. Після курсу ви зможете конструювати ключові ознаки з будь-якого тексту та розв'язувати одні з найскладніших задач у науці про дані!

Попередні вимоги

Навчальний план

Зміст курсу

1

Базові ознаки та індекси читабельності

Навчіться обчислювати базові ознаки, зокрема кількість слів, кількість символів, середню довжину слова та кількість спеціальних символів (наприклад, гештегів і згадок у Twitter). Також ви навчитеся рахувати індекси читабельності та визначати рівень освіти, потрібний, щоб зрозуміти текст.
Почати розділ
2

Попередня обробка тексту, POS-розмітка та NER

У цьому розділі ви дізнаєтеся про токенізацію та лематизацію. Далі ви навчитеся виконувати очищення тексту, розмітку частин мови та розпізнавання іменованих сутностей за допомогою бібліотеки spaCy. Засвоївши ці поняття, ви зробите промову в Геттісбурзі зручною для обробки машиною, проаналізуєте вживання іменників у фейкових новинах і визначите людей, згаданих у статті TechCrunch.
Почати розділ
4

TF-IDF і метрики подібності

Навчіться обчислювати ваги tf-idf і косинусну подібність між двома векторами. Ви застосуєте ці підходи, щоб створити рекомендаційні системи для фільмів і виступів TED. Нарешті, ви також дізнаєтеся про векторні подання слів (word embeddings) і, використовуючи вектори слів, обчислите подібність між різними піснями Pink Floyd.
Почати розділ

Інженерія ознак для NLP у Python

Курс
завершено

Отримайте сертифікат про досягнення

Зараєструватися

Розвивайте навички роботи з даними з DataCamp для мобільних

Навчайтеся будь-де з нашими мобільними курсами та щоденними 5-хвилинними завданнями з кодування.

Інженерія ознак для NLP у Python | DataCamp