Build your ultimate AI agent
课程介绍
在本课程中,您将学习如何从文本中提取有用信息,并将其加工为适合应用 ML 模型的格式。具体而言,您将学习词性标注(POS)、命名实体识别(NER)、可读性评分、n-gram 与 tf-idf 模型,以及如何使用 scikit-learn 和 spaCy 来实现它们。您还将学习如何计算两篇文档之间的相似度。在此过程中,您将预测电影评论的情感,并构建电影和 TED 演讲的推荐器。完成课程后,您将能够从任何文本中构建关键特征,解决数据科学中一些最具挑战性的问题!
先修要求
课程大纲
课程大纲
1
基础特征与可读性评分
学习计算基础特征,如单词数、字符数、平均词长,以及特殊字符数量(例如 Twitter 话题标签与提及)。您还将学习计算可读性评分,并判断理解一段文本所需的受教育程度。
2
文本预处理、POS 标注与 NER
在本章中,您将学习分词和词形还原。随后,您将学习如何使用 spaCy 库进行文本清洗、词性标注和命名实体识别。掌握这些概念后,您将把《葛底斯堡演说》转换为机器可处理的格式,分析虚假新闻中的名词用法,并识别 TechCrunch 文章中提到的人物。
3
N-Gram 模型
学习 n-gram 建模,并将其用于对电影评论进行情感分析。
4
TF-IDF 与相似度评分
学习如何计算 tf-idf 权重以及两向量之间的余弦相似度。您将利用这些概念构建电影和 TED 演讲的推荐器。最后,您还将学习词嵌入,并使用词向量表示来计算多首 Pink Floyd 歌曲之间的相似度。
Python 中的 NLP 特征工程
课程完成

