Build your ultimate AI agent
Описание курса
В этом курсе вы освоите техники извлечения полезной информации из текста и её преобразования в формат, пригодный для применения моделей машинного обучения. В частности, вы изучите POS-теггинг, распознавание именованных сущностей, показатели читаемости, модели n-грамм и tf-idf, а также научитесь реализовывать их с помощью scikit-learn и spaCy. Помимо этого, вы узнаете, как вычислить степень сходства двух документов между собой. В процессе обучения вы будете предсказывать тональность рецензий на фильмы и создавать рекомендательные системы для фильмов и лекций TED. По завершении курса вы сможете извлекать ключевые признаки из любого текста и решать одни из самых сложных задач в области Data Science!
Предварительные требования
Программа
Структура курса
1
Базовые признаки и показатели читаемости
Научитесь вычислять базовые признаки: количество слов, количество символов, среднюю длину слова и количество специальных символов (например, хэштегов и упоминаний в Twitter). Вы также освоите вычисление показателей читаемости и определение уровня образования, необходимого для понимания текста.
- Введение в разработку признаков для NLP50 XP
- Формат данных для алгоритмов машинного обучения50 XP
- Унитарное кодирование100 XP
- Извлечение базовых признаков50 XP
- Подсчёт символов в российских твитах100 XP
- Подсчёт слов в выступлениях TED100 XP
- Хэштеги и упоминания в российских твитах100 XP
- Тесты на читаемость50 XP
- Читаемость «Мифа о Сизифе»100 XP
- Читабельность различных изданий100 XP
2
Предобработка текста, POS-теггинг и распознавание именованных сущностей
В этой главе вы познакомитесь с токенизацией и лемматизацией, а затем научитесь выполнять очистку текста, частеречную разметку и распознавание именованных сущностей с помощью библиотеки spaCy. Освоив эти концепции, вы подготовите текст Геттисбергской речи для машинной обработки, проанализируете употребление существительных в фейковых новостях и определите людей, упомянутых в статье TechCrunch.
3
Модели N-грамм
Изучите модели n-грамм и примените их для анализа тональности рецензий на фильмы.
4
TF-IDF и показатели сходства
Научитесь вычислять веса tf-idf и косинусное сходство между двумя векторами. С помощью этих концепций вы создадите рекомендательную систему для фильмов и лекций TED. В завершение вы познакомитесь с векторными представлениями слов и используете их для вычисления сходства между различными песнями Pink Floyd.
Конструирование признаков для NLP на Python
Курс
завершён

