Build your ultimate AI agent
Описание курса
От социальных сетей до отзывов о товарах — текст становится всё более важным типом данных в самых разных областях, включая маркетинговую аналитику. Во многих случаях текст вытесняет другие виды неструктурированных данных: он дешевле в получении и всегда актуален. Чтобы в полной мере использовать возможности текстовых данных, нужно уметь работать с ними: осмысливать, очищать, обобщать и строить модели. В этом курсе вы познакомитесь с современными инструментами подхода tidy, которые позволяют быстро и удобно приступить к анализу текста. Вы научитесь обрабатывать и визуализировать текст, проводить анализ тональности, а также строить и интерпретировать тематические модели.
Предварительные требования
Программа
Структура курса
1
Обработка текста
Текст — это неструктурированные данные, поэтому перед анализом их необходимо привести в нужный формат. В этой главе вы научитесь добавлять структуру к тексту: разбивать его на токены, очищать и работать с ним как с категориальными данными.
2
Визуализация текста
Подсчёт слов — это хорошо, но визуализация — ещё лучше. В этой главе вы узнаете, как применить знания о ggplot2 к текстовым данным в формате tidy.
3
Анализ тональности
Частотный анализ и визуализации дают представление о содержании текста, но возможности на этом не заканчиваются. В этой главе мы выйдем за рамки подсчёта слов и займёмся анализом тональности — эмоциональной окраски текста.
4
Тематическое моделирование
В заключительной главе мы выйдем за рамки подсчёта слов и займёмся поиском скрытых тем в коллекции документов. Для этого мы воспользуемся стандартной тематической моделью — латентным распределением Дирихле.
R
Введение в анализ текста на R
Курс
завершён

