Build your ultimate AI agent
Описание курса
Изучите распознавание речи и обработку устной речи на Python
Мы учимся говорить задолго до того, как учимся читать. Даже в цифровую эпоху нашим основным способом общения остаётся речь. Обработка устной речи на Python поможет вам загружать, преобразовывать и расшифровывать аудиофайлы. Вы начнёте с того, что увидите, как выглядит необработанный аудиосигнал в Python, а затем перейдёте к изучению популярных библиотек и разберёте пример бизнес-кейса.Используйте Python SpeechRecognition и PyDub для транскрибации аудиофайлов
У Python есть ряд популярных библиотек, которые помогают обрабатывать устную речь. SpeechRecognition предлагает вам простой способ интеграции с API преобразования речи в текст, а PyDub помогает программно изменять атрибуты аудиофайлов, чтобы подготовить их к транскрибации. Каждая из этих библиотек подробно рассматривается в отдельной главе, давая вам возможность применить теорию на практике и закрепить свои знания.Практикуйте транскрибацию речи в рамках проекта курса
Заключительная глава этого курса дает вам возможность объединить все, чему вы научились, создав прототип системы обработки речи для вымышленной технологической компании. Вы создадите систему, которая преобразует аудио телефонных звонков в текст, а затем выполняет анализ тональности для оценки телефонных звонков в службу поддержки клиентов.К концу этого курса у вас будут как знания, так и практический опыт, чтобы применять полученные навыки в своей работе или личных проектах.
Предварительные требования
Программа
Структура курса
1
Введение в обработку устной речи на Python
Аудиофайлы существенно отличаются от большинства других типов данных. Прежде чем начать с ними работать, необходима предварительная обработка. В этой главе вы освоите первые шаги в работе с речевыми файлами: преобразуете два разных аудиофайла в звуковые волны и сравните их визуально.
- Введение в аудиоданные в Python50 XP
- Правильная единица частоты50 XP
- Импорт аудиофайла с помощью Python100 XP
- Преобразование байтов звуковой волны в целые числа50 XP
- Правильный тип данных50 XP
- Из байтов в целые числа100 XP
- Определение временны́х меток100 XP
- Визуализация звуковых волн50 XP
- Сохраняем согласованность50 XP
- Обработка аудиоданных с помощью Python100 XP
2
Использование библиотеки SpeechRecognition в Python
Распознавание речи до сих пор далеко от совершенства. Тем не менее библиотека SpeechRecognition предоставляет удобный способ взаимодействия со многими API преобразования речи в текст. В этом разделе вы научитесь использовать библиотеку SpeechRecognition, чтобы легко конвертировать устную речь из аудиофайлов в текст.
3
Работа с аудиофайлами с помощью PyDub
Аудиофайлы бывают самых разных форматов, размеров и конфигураций. К счастью, библиотека PyDub от Джеймса Роберта предоставляет инструменты для программного изменения различных параметров аудиофайлов: частоты кадров, числа каналов, формата файла и не только. В этой главе вы научитесь использовать эту полезную библиотеку, чтобы привести все ваши аудиофайлы к нужному виду перед транскрибированием.
4
Обработка текста, полученного из устной речи
В этой главе вы объедините всё изученное и создадите прототип системы обработки речи для технологической компании Acme Studios. Сначала вы транскрибируете фрагменты аудиозаписей звонков в службу поддержки. Затем на основе полученного текста выполните анализ тональности с помощью NLTK, распознавание именованных сущностей с помощью spaCy и классификацию текста с помощью scikit-learn.
Обработка устной речи на Python
Курс
завершён

