Après avoir suivi ces cours, je me sens confiant dans la création de visualisations et de tableaux de bord professionnels.
Description du cours
Les jeux de données dépassent souvent la RAM disponible, ce qui pose problème aux programmeurs R, car par défaut toutes les variables sont stockées en mémoire. Vous allez apprendre des outils pour traiter, explorer et analyser les données directement depuis le disque. Vous mettrez également en œuvre l’approche « split-apply-combine » et verrez comment écrire du code évolutif avec les packages bigmemory et iotools. Dans ce cours, vous utiliserez les données de la Federal Housing Finance Agency, un jeu de données public répertoriant tous les prêts hypothécaires détenus ou titrisés par la Federal National Mortgage Association (Fannie Mae) et la Federal Home Loan Mortgage Corporation (Freddie Mac) de 2009 à 2015.
Prérequis
Programme de formation
Plan du cours
1
Travailler avec des jeux de données de plus en plus volumineux
Dans ce chapitre, nous expliquons pourquoi il est nécessaire d’adopter de nouvelles techniques lorsque les jeux de données sont plus volumineux que la RAM disponible. Nous montrons que l’import et l’export de données avec les fonctions de base de R peuvent être lents, et présentons quelques moyens simples d’y remédier. Enfin, nous introduisons le package bigmemory.
- Qu’est-ce que le traitement de données à l’échelle ?50 XP
- Pourquoi votre code est-il lent ?50 XP
- Comment le temps de traitement varie-t-il selon la taille des données ?100 XP
- Manipuler des objets « out-of-core » avec le projet bigmemory50 XP
- Lecture d’un objet big.matrix100 XP
- Attacher un objet big.matrix100 XP
- Créer des tableaux avec des objets big.matrix100 XP
- Résumé des données avec bigsummary100 XP
- Références vs. copies50 XP
- Copier des matrices et des big matrices100 XP
2
Traitement et analyse des données avec bigmemory
Maintenant que vous avez un peu d’expérience avec bigmemory, nous allons passer en revue des techniques simples d’exploration et d’analyse de données. En particulier, nous verrons comment créer des tableaux et mettre en œuvre l’approche split-apply-combine.
3
Utiliser iotools
Nous utiliserons le package iotools, capable de traiter des données numériques comme textuelles, et introduirons le concept de traitement par blocs (chunk-wise processing).
4
Étude de cas : analyse préliminaire des données immobilières
Dans les chapitres précédents, nous avons présenté les données immobilières et montré comment calculer avec des données dont la taille est comparable ou supérieure à la quantité de RAM d’une seule machine. Dans ce chapitre, nous réaliserons une analyse préliminaire des données en comparant différentes tendances au fil du temps.
R
Traitement de données à grande échelle en R
Cours
terminé

