Build your ultimate AI agent
课程介绍
在真实世界的数据分析中,缺失数据几乎不可避免。它可能出现在意想不到的位置,增加分析理解的难度。在本课程中,您将学习使用 tidyverse 工具和 naniar R 包来可视化缺失值。您将整理缺失值,使其可用于分析,并探索缺失值以发现数据中的偏倚。最后,您还将揭示其他潜在的缺失模式。您还会学习如何使用插补模型来"填补空白",以及如何基于插补后的数据集进行可视化、评估和决策。
先修要求
课程大纲
课程大纲
1
为什么要关注缺失数据?
第 1 章将向您介绍缺失数据,说明什么是缺失值、它们在 R 中的行为、如何检测它们以及如何计数。随后,我们介绍缺失数据的汇总方法,以及如何在个案、变量层面汇总缺失情况,并在数据中的不同分组内进行探索。最后,我们讨论缺失数据的可视化,如何为整个数据集以及各变量、各个案和其他汇总生成概览式可视化,并学习如何在不同分组间进行比较与探索。
2
整理与清洗缺失值
在第 2 章中,您将学习如何识别诸如 "missing" 或 "N/A" 之类隐藏的缺失值,并将它们替换为 `NA`。您将学习如何高效处理隐式缺失值——即未被显式列出、但可推断为缺失的值。我们还将讨论如何探索缺失数据的依赖性,介绍完全随机缺失(MCAR)、随机缺失(MAR)、非随机缺失(MNAR),以及这些情形对您的数据分析意味着什么。
3
检验缺失之间的关系
在本章中,您将学习处理缺失数据的工作流程。我们将介绍特殊的数据结构:shadow 矩阵与 nabular 数据,并演示如何在探索缺失数据的工作流程中使用它们,从而将缺失性的汇总结果与原始数据中的取值对应起来。您将学习如何使用 ggplot 来探索和可视化:当其他变量出现缺失时,某个变量的取值如何变化。最后,您将学习如何可视化两个变量之间的缺失情况,以及为何与如何在散点图中展示缺失。
4
把点连起来(插补)
本章将讲解如何填补数据中的缺失值,即插补。您将学习如何进行插补与跟踪缺失值,并了解插补的优缺点,以便将插补数据与原始取值进行可视化、探索与评估。您将学习如何使用、评估并比较不同的插补模型,并探索不同插补模型如何影响您基于模型得出的推断。
R
在 R 中处理缺失数据
课程完成

