Build your ultimate AI agent
课程介绍
作为一名数据科学家,您经常需要处理非数值型数据,例如职位名称、问卷回答或人口统计信息。R 提供了用于表示此类数据的特殊类型——因子(factor)。本课程将帮助您使用 tidyverse 中的 forcats 包熟练掌握因子的用法。我们还将使用其他 tidyverse 包,包括 ggplot2、dplyr、stringr 和 tidyr,并采用真实世界数据集,如 fivethirtyeight 的航班数据集和 Kaggle 的 State of Data Science and ML Survey。完成本课程后,您将能够识别并操作因子变量,快速高效地可视化数据,并有效传达结果。准备好开始分类吧!
先修要求
课程大纲
课程大纲
1
因子变量入门
在本章中,您将全面了解因子。您会区分分类变量与有序变量,了解 R 如何表示它们,并学习如何检查因子以获取水平的数量和名称。最后,您将了解 tidyverse 包 forcats 如何通过按频率快速重排序变量来改进您的可视化。
2
操作因子变量
您将继续深入学习 forcats 包,掌握如何更改水平的顺序与名称,甚至将多个水平合并。
3
创建因子变量
在熟练掌握 forcats 之后,您将扩展到其余 tidyverse,学习并复习 dplyr、tidyr 和 stringr 的函数。您还将使用 ggplot2 优化图形,例如将坐标轴改为百分比刻度、调整文本布局等。
4
航班礼仪案例研究
在最后一章中,您将综合应用所学完成一个案例研究。您将进一步练习字符串处理与数据汇总,并复现一幅可发布水准的 538 风格图表。
R
Tidyverse 中的分类数据
课程完成

