Build your ultimate AI agent
课程介绍
缺失数据无处不在。用适当的方法填充缺失值称为填补(imputation)。如果您希望做出更准确的预测并在众人中脱颖而出,掌握正确的填补方法至关重要。在本课程中,您将学习如何使用可视化和统计检验识别缺失数据模式,以及如何利用一系列统计与机器学习模型对数据进行填补。您还将提升决策能力,帮助您在具体情境下选择最合适的填补方法。最后,您将学会在推断与预测中纳入来自填补的不确定性,从而使结果更稳健、更可靠。
先修要求
课程大纲
课程大纲
1
缺失数据的问题
在本章中,您将了解为什么在分析数据集时,缺失数据可能带来风险。我们将介绍三种缺失机制,并讲解如何使用统计检验与可视化工具识别它们。
2
基于供体的填补方法
了解填补方法的分类体系,并学习三种基于供体的技术:均值填补、热甲板(hot-deck)填补和 k-近邻(k-Nearest-Neighbors)填补。您将深入其原理,理解这些方法如何工作,并学习如何将它们应用到真实的热带天气数据集。过程中,您还会掌握一些实用技巧,帮助这些方法更好地解决您的问题。
3
基于模型的填补方法
现在是时候学习如何使用统计与机器学习模型(如线性回归、逻辑回归与随机森林)来填补缺失数据了。本章将探讨这些模型如何进行预测,并据此从条件分布中抽取填补值。这一点很重要,因为它能确保您的填补结果更加多样且合理,更接近真实数据。
4
来自填补的不确定性
填补得到的数值并非板上钉钉。它们只是估计,而估计总伴随不确定性。在最后一章中,您将了解如何使用自助法(bootstrapping)与基于链式方程的多重填补(借助 mice 包),把填补不确定性纳入模型与分析,使其更可靠、更稳健。
R
R 中的缺失值填补处理
课程完成

