Build your ultimate AI agent
课程介绍
数据集往往比可用的 RAM 更大,这会给 R 程序员带来问题,因为默认情况下所有变量都存储在内存中。您将学习直接从磁盘处理、探索和分析数据的工具。您还将实践 split-apply-combine 方法,并学习如何使用 bigmemory 和 iotools 包编写可扩展的代码。在本课程中,您将使用美国联邦住房金融局(Federal Housing Finance Agency)的数据,这是一个公开的数据集,记录了 2009-2015 年间由联邦国民抵押贷款协会(Fannie Mae)和联邦住房贷款抵押公司(Freddie Mac)持有或证券化的所有按揭贷款。
先修要求
课程大纲
课程大纲
1
处理日益庞大的数据集
本章将说明当数据集大于可用 RAM 时,为什么需要采用新技术。我们会展示使用 R 基础函数导入和导出数据可能很慢,以及一些简单的改进方法。最后,我们将介绍 bigmemory 包。
2
使用 bigmemory 进行数据处理与分析
在您已经有了一些使用 bigmemory 的经验后,我们将讲解一些基础的数据探索与分析技术。特别是,我们将学习如何创建汇总表,并实现 split-apply-combine 方法。
3
使用 iotools
我们将使用 iotools 包来处理数值与字符串数据,并介绍分块(chunk-wise)处理的概念。
4
案例研究:住房数据的初步分析
在前面的章节中,我们介绍了住房数据,并展示了如何处理与单机可用 RAM 相当甚至更大的数据。本章将对数据做一次初步分析,比较不同时期的各类趋势。
R
R 的可扩展数据处理
课程完成

