跳至主要内容

课程

Python 中的 NLP 特征工程

中级4 小时

学习从文本中提取有用信息,并将其处理成适合机器学习的格式。

Python4 小时15 个视频52 个练习4,200 XP29,645成就证明

创建您的免费账户

继续使用 Google
继续即表示您接受我们的 使用条款,我们的 隐私政策 ,并且您的数据存储在美国。

深受数千家公司学习者的喜爱

要培训团队?

试用企业版

课程简介

在本课程中,您将学习如何从文本中提取有用信息,并将其加工为适合应用 ML 模型的格式。具体而言,您将学习词性标注(POS)、命名实体识别(NER)、可读性评分、n-gram 与 tf-idf 模型,以及如何使用 scikit-learn 和 spaCy 来实现它们。您还将学习如何计算两篇文档之间的相似度。在此过程中,您将预测电影评论的情感,并构建电影和 TED 演讲的推荐器。完成课程后,您将能够从任何文本中构建关键特征,解决数据科学中一些最具挑战性的问题!

先修要求

课程体系

课程大纲

1

基础特征与可读性评分

学习计算基础特征,如单词数、字符数、平均词长,以及特殊字符数量(例如 Twitter 话题标签与提及)。您还将学习计算可读性评分,并判断理解一段文本所需的受教育程度。
开始本章
2

文本预处理、POS 标注与 NER

在本章中,您将学习分词和词形还原。随后,您将学习如何使用 spaCy 库进行文本清洗、词性标注和命名实体识别。掌握这些概念后,您将把《葛底斯堡演说》转换为机器可处理的格式,分析虚假新闻中的名词用法,并识别 TechCrunch 文章中提到的人物。
开始本章

Python 中的 NLP 特征工程

课程已完成

获得成就证明

立即报名

通过 DataCamp 移动版提升您的数据技能

借助我们的移动课程和每日 5 分钟编程挑战,随时随地取得进步。