
La ingeniería de datos sigue siendo una prioridad para las empresas y, en 2021, veremos avances interesantes en el ámbito de la infraestructura de datos. En un webinar reciente, Maksim Percherskiy, Data Engineer en The World Bank y ex Chief Data Officer de la ciudad de San Diego, destacó tres tendencias clave a seguir: las plataformas de orquestación de datos, los motores de descubrimiento de datos y los data lakehouses.
Plataformas de orquestación de datos
Aunque las plataformas de orquestación llevan años utilizándose para gestionar sistemas y software, la orquestación de datos es un concepto relativamente nuevo que abstrae el acceso a los datos entre sistemas de almacenamiento, los virtualiza y los pone a disposición de aplicaciones basadas en datos. Las plataformas de orquestación de datos ayudan a las empresas a ser más data-driven al combinar datos aislados de múltiples ubicaciones de almacenamiento y hacerlos utilizables. Algunos ejemplos son Apache Airflow, Prefect, Luigi y Stitch, compatibles con enfoques modernos de software como el control de versiones, DevOps y la integración continua.
El curso de DataCamp Introduction to Airflow in Python es un gran punto de partida para aprender a implementar y programar ETL y flujos de trabajo de ingeniería de datos de forma sencilla y repetible.
Motores de descubrimiento de datos
A medida que crece el volumen de datos, es lógico que las empresas inviertan más tiempo en ayudar a sus equipos a encontrar los datos que necesitan, documentarlos y reducir retrabajos. Motores de descubrimiento como Amundsen de Lyft y Databook de Uber buscan mejorar la productividad de los usuarios de datos ofreciendo una interfaz de búsqueda. Estas herramientas se apoyan en metadatos, que impulsan la productividad y el cumplimiento normativo al permitir que la infraestructura de datos escale conforme crecen las empresas. El objetivo del data discovery es hacer que los datos sean más FAIR: localizables, accesibles, interoperables y reutilizables.

Data lakehouse
Existen casos de uso distintos para los data lakes frente a data warehouses. Cada uno está diseñado con fines y perfiles de usuario diferentes. Por ejemplo, los data warehouses suelen ser utilizados por analistas para generar inteligencia de negocio: contienen archivos planos que han sido procesados específicamente para su trabajo. En cambio, los data lakes los configuran y mantienen los data engineers, que los integran en las canalizaciones de datos. Los data scientists trabajan más de cerca con los data lakes porque contienen datos de mayor amplitud y más actualizados.
Los data lakehouses son exactamente eso: una combinación de data lakes y data warehouses. Plataformas como Snowflake y Delta Lake de Databricks han creado soluciones que ofrecen una única fuente de verdad para los datos, uniendo las ventajas de ambos. Los data lakehouses incorporan en los data lakes las estructuras y capacidades de gestión propias de los data warehouses, que suelen ser más rentables para el almacenamiento. Al mismo tiempo, conservan el esquema y el versionado de los datos. Con los data lakehouses, los data scientists podrán abordar tanto machine learning como business intelligence.

Fuente: Databricks
Estas tres tendencias serán clave para que las empresas escalen su infraestructura de datos en 2021. Son útiles tanto para compañías nativas de datos como para aquellas que todavía luchan por integrar los datos de forma sostenible en sus flujos de trabajo. Descubre más sobre los retos a los que se enfrentan las grandes organizaciones para operacionalizar sus datos y ser realmente data-driven.


