Перейти к основному контенту

Курс

Конструирование признаков для NLP на Python

Средний4 ч

Изучите методы извлечения полезной информации из текста и преобразования её в формат, подходящий для машинного обучения.

Python4 ч{count, plural, one {# видео} few {# видео} many {# видео} other {# видео}}{count, plural, one {# упражнение} few {# упражнения} many {# упражнений} other {# упражнения}}4,200 XP29,424Заявление об успешном завершении

Создайте бесплатный аккаунт

Продолжить с Google
или
Продолжая, вы принимаете наши Условия использования, наш Политика конфиденциальности и что ваши данные хранятся в США.

Любимый инструмент учащихся тысяч компаний

Обучаете команду?

Попробовать для бизнеса

Описание курса

В этом курсе вы освоите техники извлечения полезной информации из текста и её преобразования в формат, пригодный для применения моделей машинного обучения. В частности, вы изучите POS-теггинг, распознавание именованных сущностей, показатели читаемости, модели n-грамм и tf-idf, а также научитесь реализовывать их с помощью scikit-learn и spaCy. Помимо этого, вы узнаете, как вычислить степень сходства двух документов между собой. В процессе обучения вы будете предсказывать тональность рецензий на фильмы и создавать рекомендательные системы для фильмов и лекций TED. По завершении курса вы сможете извлекать ключевые признаки из любого текста и решать одни из самых сложных задач в области Data Science!

Предварительные требования

Программа

Структура курса

1

Базовые признаки и показатели читаемости

Научитесь вычислять базовые признаки: количество слов, количество символов, среднюю длину слова и количество специальных символов (например, хэштегов и упоминаний в Twitter). Вы также освоите вычисление показателей читаемости и определение уровня образования, необходимого для понимания текста.
Начать главу
2

Предобработка текста, POS-теггинг и распознавание именованных сущностей

В этой главе вы познакомитесь с токенизацией и лемматизацией, а затем научитесь выполнять очистку текста, частеречную разметку и распознавание именованных сущностей с помощью библиотеки spaCy. Освоив эти концепции, вы подготовите текст Геттисбергской речи для машинной обработки, проанализируете употребление существительных в фейковых новостях и определите людей, упомянутых в статье TechCrunch.
Начать главу
4

TF-IDF и показатели сходства

Научитесь вычислять веса tf-idf и косинусное сходство между двумя векторами. С помощью этих концепций вы создадите рекомендательную систему для фильмов и лекций TED. В завершение вы познакомитесь с векторными представлениями слов и используете их для вычисления сходства между различными песнями Pink Floyd.
Начать главу

Конструирование признаков для NLP на Python

Курс
завершён

Получить справку об окончании курса

Записаться

Развивайте навыки работы с данными с DataCamp для мобильных устройств

Продолжайте учиться в любом месте с мобильными курсами и ежедневными 5-минутными практическими заданиями.

Конструирование признаков для NLP на Python | DataCamp