
Cuando se trata de almacenar big data, las dos opciones más populares son los data lakes y los data warehouses. Los data warehouses se usan para analizar datos estructurados y archivados, mientras que los data lakes almacenan big data de todo tipo de estructuras.
En este post, vamos a desglosar las diferencias entre ambos. La siguiente tabla resume sus diferencias en cinco categorías.
| Data lake | Data warehouse | |
|---|---|---|
| Tipo de datos | Datos no estructurados y estructurados de diversas fuentes de datos de la empresa | Datos históricos estructurados para encajar en un esquema de base de datos relacional |
| Propósito | Almacenamiento de big data rentable | Analítica para la toma de decisiones de negocio |
| Usuarios | Científicos de datos e ingenieros de datos | Analistas de datos y analistas de negocio |
| Tareas | Almacenamiento de datos y analítica de big data, como deep learning y analítica en tiempo real | Consultas generalmente de solo lectura para agregar y resumir datos |
| Tamaño | Almacena todos los datos que podrían usarse —¡puede llegar a petabytes! | Solo almacena los datos relevantes para el análisis |
Tipo de datos
Limpiar datos es una habilidad clave en datos porque, de forma natural, los datos llegan desordenados e imperfectos. A los datos en bruto que no se han limpiado se les llama datos no estructurados; constituyen la mayor parte de los datos del mundo, como fotos, chats o archivos PDF. Los datos no estructurados que se han limpiado para ajustarse a un esquema, organizados en tablas y definidos por tipos de datos y relaciones, se denominan datos estructurados. Esta es la diferencia fundamental entre lakes y warehouses.
Los data lakes almacenan datos de una gran variedad de fuentes como dispositivos IoT, flujos en tiempo real de redes sociales, datos de usuarios y transacciones de aplicaciones web. A veces estos datos están estructurados, pero a menudo llegan bastante desordenados porque se ingieren directamente desde la fuente. Los data warehouses, en cambio, contienen datos históricos que se han limpiado para encajar en un esquema relacional.
Propósito
Los data lakes se utilizan para almacenar, de forma rentable, grandes volúmenes de datos procedentes de muchas fuentes. Permitir datos de cualquier estructura reduce el coste porque los datos son más flexibles y escalables al no tener que ajustarse a un esquema concreto. Sin embargo, los datos estructurados son más fáciles de analizar porque están más limpios y comparten un esquema uniforme para consultar. Al restringir los datos a un esquema, los data warehouses son muy eficientes para analizar datos históricos y apoyar decisiones concretas.
Verás que los data lakes y los data warehouses se complementan dentro de un flujo de trabajo de datos. Los datos que se ingieren en la empresa se almacenan de inmediato en un data lake. Si surge una pregunta de negocio específica, se extrae del lake la parte de datos relevante, se limpia y se exporta a un data warehouse.
Usuarios
Los data lakes y los data warehouses son útiles para perfiles distintos. Los analistas de datos y de negocio suelen trabajar en data warehouses que contienen datos claramente pertinentes y ya procesados para su trabajo. Los data warehouses requieren un menor nivel de programación y conocimientos de ciencia de datos para su uso.
Los data lakes los configuran y mantienen los ingenieros de datos, que los integran en las canalizaciones de datos. Los científicos de datos trabajan más de cerca con los data lakes, ya que contienen datos con mayor amplitud y más actuales.
Tareas
Los ingenieros de datos usan los data lakes para almacenar los datos entrantes. Pero los data lakes no se limitan al almacenamiento. Recuerda: los datos no estructurados son más flexibles y escalables, algo que a menudo es mejor para la analítica de big data. La analítica de big data puede ejecutarse sobre data lakes con servicios como Apache Spark y Hadoop. Esto es especialmente cierto en deep learning, que requiere escalar a medida que aumenta la cantidad de datos de entrenamiento.
Los data warehouses suelen configurarse como de solo lectura para los analistas, que principalmente leen y agregan datos para obtener insights. Como los datos ya están limpios y son de archivo, normalmente no hace falta insertar ni actualizar datos.
Tamaño
No debería sorprender que los data lakes sean mucho más grandes, porque conservan todos los datos que podrían ser relevantes para la empresa. A menudo alcanzan el orden de los petabytes —¡eso son 1.000 terabytes! Los data warehouses son mucho más selectivos con los datos que almacenan.
Conclusión
Cuando tengas que elegir entre un data lake o un data warehouse, revisa estas categorías y decide cuál encaja mejor con tu caso de uso. Si te interesa profundizar en sus diferencias o aprender a diseñar data warehouses, echa un vistazo a nuestro curso de Database Design.
No olvides que, a veces, necesitas una combinación de ambas soluciones de almacenamiento. Esto es especialmente cierto al construir canalizaciones de datos. Puedes verlo en acción en nuestros cursos Introduction to Data Engineering y Building Data Engineering Pipelines in Python.

