Build your ultimate AI agent
课程介绍
高维数据集往往让人无从下手。通常,您会先对新数据集进行可视化探索,但当维度过多时,传统方法就显得力不从心。幸运的是,有专为高维数据设计的可视化技术,本课程将为您介绍这些方法。完成初步探索后,您常会发现许多特征几乎不包含信息,要么没有方差,要么与其他特征重复。您将学习如何识别并从数据集中删除这些特征,从而将注意力集中在信息量更高的特征上。下一步,您可能会基于这些特征构建模型,但结果可能发现,有些特征对您要预测的目标并无影响。您也将学习如何识别并删除这些无关特征,以实现降维,从而降低复杂度。最后,您将学习如何通过特征提取技术计算相互不相关的主成分,自动为您完成降维。
先修要求
课程大纲
课程大纲
1
高维数据探索
您将首先了解降维的概念,以及其重要性与适用场景。您会学习特征选择与特征提取的区别,并将两种技术用于数据探索。章节最后将介绍 t-SNE,这是一种强大的特征提取方法,可用于可视化高维数据集。
2
特征选择 I——基于特征信息的选择
在特征选择的两个章节中的第一章,您将学习维度灾难,以及降维如何帮助您应对这一问题。您会接触多种技术来检测并移除对数据集增益很小的特征。原因可能包括方差很小、缺失值过多,或与其他特征高度相关。
3
特征选择 II——基于模型准确度的选择
在特征选择的第二章中,您将学习如何借助模型来找出对预测特定目标特征最重要的特征。在本章最后一节中,您将综合多个不同模型的建议,来决定哪些特征值得保留。
4
特征提取
本章将深入讲解最常用的降维算法——主成分分析(PCA)。您将建立对该算法为何强大、如何发挥作用的直观理解,并将其用于数据探索以及建模流水线中的数据预处理。最后,您将以一个有趣的图像压缩用例收尾。
Python 中的降维
课程完成

