Debido a la gran demanda, DataCamp se está preparando para crear un itinerario de aprendizaje en ingeniería de datos. Como ocurre con muchos términos del universo, cada vez mayor, de la ciencia de datos, hay bastante ambigüedad en la definición de «ingeniería de datos». Algunos Data Engineers se dedican mucho al reporting y a los paneles de control. Otros pasan la mayor parte del tiempo trabajando en canalizaciones de datos. Y hay quienes toman código en Python de Data Scientists y lo optimizan para ejecutarlo en Java o C.
Para poder empezar a crear cursos, tenemos que escoger una definición única de «Data Engineer» sobre la que trabajar. Tras mucho debate y reflexión, decidimos parafrasear la serie de televisión estadounidense «Law and Order»:
Data Engineers vs Data Analysts vs Data Scientists
En el mundo de la ciencia de datos, los datos están representados por tres profesiones diferentes pero igualmente importantes:
- Los Data Engineers, que usan lenguajes de programación para garantizar un acceso a los datos y a las bases de datos que sea limpio, fiable y con buen rendimiento
- Los Data Analysts, que utilizan lenguajes de programación, hojas de cálculo y herramientas de business intelligence para describir y categorizar los datos existentes
- Los Data Scientists, que emplean algoritmos para predecir datos futuros a partir de la información disponible
Ejemplos
Imagina, por ejemplo, que una empresa vende distintos tipos de sofás en su web. Cada vez que una persona hace clic en un sofá concreto, se crea un nuevo dato. Un Data Engineer definiría cómo recoger ese dato, qué metadatos añadir a cada evento de clic y cómo almacenarlo en un formato de fácil acceso. Un Data Analyst crearía visualizaciones para ayudar a ventas y marketing a seguir quién compra cada sofá y cuánto dinero genera la empresa. Un Data Scientist tomaría los datos sobre qué clientes compraron cada sofá y los usaría para predecir el sofá perfecto para cada nueva visita a la web.
¿Qué es un Data Engineer?
En muchas organizaciones, los Data Engineers son las primeras incorporaciones de un equipo de datos. Antes de analizar los datos recopilados y aprovecharlos con métodos predictivos, hay que organizarlos y limpiarlos. Los Data Engineers comienzan este proceso elaborando un listado de qué datos se almacenan, lo que se conoce como esquema de datos. Después, deben elegir una ubicación fiable y de fácil acceso para almacenar los datos, es decir, un data warehouse. Ejemplos de sistemas de data warehousing son Amazon Redshift o Google Cloud. Por último, los Data Engineers crean procesos ETL (Extract, Transform, Load) para asegurarse de que los datos llegan al data warehouse.
A medida que una organización crece, los Data Engineers se encargan de integrar nuevas fuentes de datos en el ecosistema y de enviar los datos almacenados a distintas herramientas de análisis. Cuando el data warehouse se vuelve muy grande, los Data Engineers tienen que buscar nuevas formas de mantener un buen rendimiento en los análisis, como paralelizar procesos o crear subconjuntos más pequeños para consultas rápidas.
La relación entre las tres profesiones
Dentro del universo de la ciencia de datos, siempre hay solapamientos entre las tres profesiones. A menudo, los Data Engineers asumen proyectos sencillos de análisis de datos o transforman algoritmos escritos por Data Scientists en formatos más robustos que puedan ejecutarse en paralelo. Por su parte, Data Analysts y Data Scientists necesitan aprender nociones básicas de ingeniería de datos, especialmente si trabajan en una startup en fase temprana con recursos de ingeniería limitados.
¡Aprende ingeniería de datos con DataCamp!
En DataCamp, nos hace mucha ilusión ampliar nuestra oferta de cursos de ingeniería de datos. Sabemos qué queremos enseñar y ya estamos empezando a reclutar instructores para diseñar estos cursos. Si te interesa, echa un vistazo a nuestra solicitud y a la lista de cursos que estamos priorizando ahora mismo.


