Build your ultimate AI agent
课程介绍
据估计,超过 70% 的可用商业信息是非结构化的,往往以文本数据的形式存在。文本挖掘提供了一系列技术,帮助我们从非结构化数据中提炼可操作的洞见。本课程将使用 bag-of-words 方法带您入门文本挖掘。前三章介绍分析与可视化文本数据的核心主题。最后一章通过一个真实案例,带您综合运用所学,从两家大型科技公司的员工评价中提取洞见。
先修要求
课程大纲
课程大纲
1
从 Bag-of-Words 入门文本挖掘
本章将带您学习使用 bag-of-words 方法分析文本数据的基础知识。
- 什么是文本挖掘?50 经验值
- 理解文本挖掘50 经验值
- 快速体验文本挖掘100 经验值
- 入门50 经验值
- 加载一些文本100 经验值
- 将向量转换为 VCorpus 对象(1)100 经验值
- 将向量转换为 VCorpus 对象(2)100 经验值
- 从数据框创建 VCorpus100 经验值
- 清洗与预处理文本50 经验值
- tm 中常见的清洗函数100 经验值
- 使用 qdap 清理文本100 经验值
- 关于停用词的一切100 经验值
- 词干提取与词干还原入门100 经验值
- 对句子进行词干提取与词干还原100 经验值
- 将预处理步骤应用到语料库100 经验值
- TDM 与 DTM50 经验值
- 理解 TDM 和 DTM50 经验值
- 构建文档-词项矩阵100 经验值
- 创建一个 term-document 矩阵100 经验值
2
词云与更多有趣的可视化
本章将教您以既信息丰富又具有吸引力的方式可视化文本数据。
3
拓展您的文本挖掘技能
本章将进一步介绍基于 bag of words 方法的基础文本挖掘技术。
4
科技巨头的人才之战
本章通过一个 HR 分析的文本挖掘案例把所有内容串联起来。
R
使用 R 的 Bag-of-Words 进行文本挖掘
课程完成

