Build your ultimate AI agent
课程介绍
你是否曾经处理过特征数量多得令人不知所措的数据集?你真的需要所有那些功能吗?哪些是最重要的?在本课程中,您将学习降维技术,这些技术将帮助您简化数据以及您用数据构建的模型,同时保留原始数据中的信息并保持良好的预测性能。
我们生活在信息时代——一个信息过载的时代。 从数据中提取关键信息的能力是一项极具市场价值的技能。 模型在减少的数据上训练更快。 在生产环境中,更小的模型意味着更快的响应时间。 或许最重要的是,更小的数据和模型通常更容易理解。 降维是数据科学中的奥卡姆剃刀。
特征选择与特征提取的区别!使用 R,您将学习如何识别并移除信息量低或冗余的特征,保留信息量最大的特征。 这就是特征选择。 您还将学习如何将特征组合提取为包含最大信息的压缩组件。 这就是特征提取!
但最重要的是,借助 R 的新 tidymodel 包,你将使用真实世界数据构建特征更少、却不会显著牺牲性能的模型。
为什么学习降维?
我们生活在信息时代——一个信息过载的时代。 从数据中提取关键信息的能力是一项极具市场价值的技能。 模型在减少的数据上训练更快。 在生产环境中,更小的模型意味着更快的响应时间。 或许最重要的是,更小的数据和模型通常更容易理解。 降维是数据科学中的奥卡姆剃刀。
你将在这门课程中学到什么?
特征选择与特征提取的区别!使用 R,您将学习如何识别并移除信息量低或冗余的特征,保留信息量最大的特征。 这就是特征选择。 您还将学习如何将特征组合提取为包含最大信息的压缩组件。 这就是特征提取!
但最重要的是,借助 R 的新 tidymodel 包,你将使用真实世界数据构建特征更少、却不会显著牺牲性能的模型。
先修要求
课程大纲
课程大纲
1
降维基础
准备好简化大型数据集吧!您将学习信息的概念、如何评估特征重要性,并练习识别低信息量特征。学完本章,您将理解特征选择与特征提取——这两类降维方法之间的区别。
2
面向特征重要性的特征选择
学习如何通过缺失值比例、方差和相关性来识别信息丰富与信息稀缺的特征。随后,您将了解如何构建 tidymodels 的 recipes,利用这些信息指标来进行特征选择。
3
面向模型性能的特征选择
第 3 章将介绍无监督与有监督特征选择方法的区别。您将回顾如何使用 tidymodels 的 workflows 来构建模型。接着,您将通过 lasso 回归与随机森林模型执行有监督特征选择。
4
特征提取与模型性能
在最后一章,您将通过理解主成分如何从不同特征中提取并组合最重要的信息,来建立对特征提取的直观认识。随后学习并应用三类特征提取方法——主成分分析(PCA)、t-SNE 和 UMAP。了解如何在 tidymodels 的建模流程中,将这些特征提取方法作为预处理步骤使用。
R
R 中的降维
课程完成

