Build your ultimate AI agent
Descripción del curso
Superar problemas comunes de datos como eliminar duplicados en R
Se suele decir que los científicos de datos dedican el 80% de su tiempo a limpiar y manipular los datos y sólo el 20% a analizarlos. El tiempo dedicado a la limpieza es vital, ya que analizar datos sucios puede llevarte a sacar conclusiones inexactas.En este curso, aprenderás una serie de técnicas que te ayudarán a limpiar los datos sucios utilizando R. Empezarás convirtiendo los tipos de datos, aplicando restricciones de rango y tratando los duplicados totales y parciales para evitar el doble recuento.
Profundiza en los retos de los datos avanzados
Una vez que hayas practicado el trabajo con problemas comunes de datos, pasarás a retos más avanzados, como garantizar la coherencia de las mediciones y tratar los datos que faltan. Después de cada nuevo concepto, tendrás la oportunidad de completar un ejercicio práctico para consolidar tus conocimientos y aumentar tu experiencia.Aprende a utilizar la vinculación de registros durante la limpieza de datos
La vinculación de registros se utiliza para fusionar conjuntos de datos cuando los valores tienen problemas, como errores tipográficos o grafías diferentes. Explorarás esta útil técnica en el último capítulo y practicarás su aplicación utilizándola para unir dos conjuntos de datos de reseñas de restaurantes en un único conjunto de datos.Requisitos previos
Programa de formación
Contenido del curso
1
Problemas de datos comunes
En este capítulo, aprenderás a resolver algunos de los problemas más comunes de datos sucios. Convertirás tipos de datos, aplicarás restricciones de rango para eliminar puntos de datos futuros y quitarás datos duplicados para evitar dobles conteos.
- Restricciones de tipo de datos50 XP
- Tipos de datos comunes100 XP
- Convertir tipos de datos100 XP
- Recortar cadenas100 XP
- Restricciones de rango50 XP
- Restricciones de duración del viaje100 XP
- Regreso al futuro100 XP
- Restricciones de unicidad50 XP
- Duplicados completos100 XP
- Eliminar duplicados parciales100 XP
- Agregar duplicados parciales100 XP
2
Datos categóricos y de texto
Los datos categóricos y de texto suelen ser de las partes más desordenadas de un conjunto de datos por su naturaleza no estructurada. En este capítulo, aprenderás a corregir inconsistencias de espacios en blanco y mayúsculas en las etiquetas de categorías, a combinar varias categorías en una y a reformatear cadenas para mantener la coherencia.
3
Problemas de datos avanzados
En este capítulo, profundizarás en problemas de limpieza de datos más avanzados, como asegurarte de que todos los pesos estén en kilogramos en lugar de libras. Además, adquirirás habilidades clave para verificar que los valores se han añadido correctamente y que los valores ausentes no afecten negativamente a tus análisis.
4
Record Linkage
El record linkage es una técnica potente para fusionar varios conjuntos de datos cuando los valores tienen erratas u ortografías distintas. En este capítulo, aprenderás a vincular registros calculando la similitud entre cadenas; después usarás estas nuevas habilidades para unir dos conjuntos de datos de reseñas de restaurantes en un único conjunto maestro limpio.
R
Limpieza de datos en R
Curso
completado

