Build your ultimate AI agent
课程介绍
使用 Python 学习语音识别和口语语言处理
我们学会说话,远早于学会阅读。 即使在数字时代,我们主要的交流方式仍然是语言。 Python中的语音处理将帮助你加载、转换和转录音频文件。 你将首先了解原始音频在 Python 中的样子,然后继续探索常用库,并通过一个商业应用案例进行实践。使用 Python SpeechRecognition 和 PyDub 转录音频文件
Python 有许多流行的库,可以帮助你处理口语。 SpeechRecognition 为您提供了一种轻松集成语音转文本 API 的方式,而 PyDub 则帮助您以编程方式修改音频文件属性,使其为转录做好准备。 这些库都在深入的章节中进行了讲解,让你有机会将理论付诸实践,巩固所学知识。通过课程内项目实践语音转录
本课程的最后一章将为你提供一个机会,通过为一家虚构的科技公司构建一个语音处理概念验证,将你所学的一切融会贯通。 你将构建一个系统,将电话通话音频转录为文本,然后进行情感分析,以审查客户支持电话通话。在本课程结束时,你将同时掌握相关知识和动手实践经验,能够将所学应用到工作或个人项目中。
先修要求
课程大纲
课程大纲
1
Python 语音语言处理入门
音频文件与大多数其他类型的数据不同。在开始处理之前,通常需要预处理。本章将带您完成处理语音文件的第一步:把两种不同的音频文件转换为声波,并对它们进行可视化比较。
2
使用 Python SpeechRecognition 库
语音识别尚不完美,但 SpeechRecognition 库提供了与多种语音转文本 API 交互的简便方式。在本章中,您将学习如何使用 SpeechRecognition 库,轻松将音频文件中的口语转换为文本。
3
用 PyDub 处理音频文件
并非所有音频文件都具有相同的结构、大小或格式。幸运的是,James Robert 开发的 PyDub 库提供了工具,您可以通过编程方式更改音频文件的各种属性,例如帧率、声道数、文件格式等。在本章中,您将学习如何使用这个实用的库,确保所有音频文件都具备适合转写的正确形态。
4
处理语音转写得到的文本
本章中,您将把所学内容整合起来,为一家科技公司 Acme Studios 构建一个语音处理概念验证项目。您将先把客户支持电话的音频片段转写为文本,然后基于转写结果使用 NLTK 进行情感分析、使用 spaCy 进行命名实体识别,并使用 scikit-learn 进行文本分类。
Python 语音语言处理
课程完成

