programa
La ingeniería de datos tiene uno de los caminos de aprendizaje más caóticos de todo el ámbito de datos. Necesitas SQL, Python, orquestación con Airflow, transformación con dbt y, como mínimo, una plataforma en la nube. Y el material gratuito de cada parte está repartido por sitios distintos y con calidades desiguales.
La buena noticia es que casi todo lo necesario para estar listo para trabajar está disponible gratis, o al menos con acceso gratuito inicial. La mala es que lo gratuito está disperso, es irregular y en algunos casos va por detrás de las versiones de las herramientas que usarás en el trabajo. Este recopilatorio existe para darte una ruta entre todo eso.
Esta lista está pensada para dos perfiles: quien empieza de cero y quiere un orden sensato, y la persona analista o desarrolladora que ya domina SQL y quiere dar el salto a las canalizaciones. Tanto si nunca has escrito una línea de Python como si ya pones en producción trabajos ETL, aquí tienes el siguiente paso.
He elegido estos recursos por su profundidad práctica, por cómo se construyen unos sobre otros y por lo a menudo que los recomiendan ingenieros de datos en activo en r/dataengineering y en hilos de contratación. Cuando un recurso tiene una limitación real —ya sea por versiones desactualizadas o por un muro de pago escondido tras la palabra "gratis"— lo señalo. También puedes leer nuestra guía sobre cómo convertirse en data engineer para la parte de carrera profesional.
Resumen
| Recurso | Tipo | Nivel | Ideal para |
|---|---|---|---|
| Understanding Data Engineering | Curso de DataCamp | Principiante | Aprender el vocabulario y el modelo mental antes de tocar herramientas |
| Tutoriales y blogs de DataCamp | Tutoriales/blogs | De principiante a avanzado | Tapar huecos concretos (Airflow, dbt, ETL, SQL) |
| Práctica de SQL (Mode, SQLBolt, SQLZoo) | Tutoriales interactivos | De principiante a avanzado | Ganar soltura en SQL y preparar entrevistas |
| Fundamentos de Python (docs, Automate the Boring Stuff) | Documentación/libro | Principiante | Guiones y automatización antes de pasar a canalizaciones |
| Data Engineering Zoomcamp | Curso abierto en GitHub | Intermedio | Un proyecto de portfolio de principio a fin con el stack moderno |
| dbt Learn | Curso del proveedor | Intermedio | Analytics engineering y la capa de transformación |
| Docs de Apache Airflow + guías de Astronomer | Documentación/guías | Intermedio | Orquestación y creación de DAGs |
| Formación gratuita de Databricks Academy | Cursos del proveedor | De principiante a intermedio | Fundamentos de Delta Lake y lakehouse |
| Microsoft Learn (DP-900, DP-203) | Itinerarios del proveedor | De principiante a avanzado | Servicios de datos de Azure estructurados y preparación de certificaciones |
| Google Cloud Skills Boost + AWS Skill Builder | Itinerarios del proveedor | De intermedio a avanzado | Laboratorios en la nube, prácticos y de nivel producción |
Los mejores recursos para aprender ingeniería de datos
He ordenado los recursos para que un principiante pueda ir de arriba a abajo, empezando por conceptos y bases antes de pasar a la orquestación y a la nube.
1. Understanding Data Engineering (curso de DataCamp)
Es el punto de partida adecuado si aún no tienes claro qué hace exactamente un data engineer en su día a día. Nuestro curso Understanding Data Engineering es una introducción conceptual de 2 horas que cubre canalizaciones de datos, opciones de almacenamiento y las diferencias entre procesamiento por lotes y en streaming, sin necesidad de programar.
Está planteado a propósito como no técnico, y ese es el valor. Saldrás entendiendo el vocabulario que el resto de recursos dan por sabido: ETL frente a ELT, data warehouses frente a lakes y dónde encaja la orquestación.
La limitación evidente es que no te enseña a construir nada. Tómalo como el mapa, no el viaje, y combínalo con los recursos prácticos de abajo.
- Nivel: Principiante
- Formato: Curso interactivo, 2 horas
- Ideal para: Decidir si la ingeniería de datos es tu camino antes de invertir tiempo en herramientas
Empieza el curso: Understanding Data Engineering.
2. Tutoriales y blogs de DataCamp
Cuando ya estás construyendo cosas, nuestros tutoriales y blogs gratuitos son la forma más rápida de cubrir un hueco concreto sin meterte en un curso entero. Están escritos para esos momentos exactos en los que te atascas con una herramienta.
Algunas recomendaciones: nuestro tutorial de Apache Airflow recorre la creación de DAGs de principio a fin, y el tutorial de dbt cubre modelos, tests y documentación con ejemplos ejecutables. Para entrevistas, nuestro artículo de preguntas de SQL es una lista de repaso realmente útil.
El aviso honesto: una colección de tutoriales no es un programa de formación. Necesitas algo que te marque el orden, por eso los pongo como complemento a cursos estructurados y no como sustituto.
- Nivel: De principiante a avanzado
- Formato: Tutoriales y blogs gratuitos, de 10 a 30 minutos cada uno
- Ideal para: Cubrir un hueco concreto en Airflow, dbt, SQL o ETL mientras sigues un curso más amplio
Lee los tutoriales: Data Engineering tutorials de DataCamp.
3. Práctica de SQL: Mode, SQLBolt, SQLZoo y LeetCode
SQL es la habilidad más importante para un data engineer, y la mejor práctica gratuita está repartida entre cuatro sitios que cada uno hace muy bien su parte. No hay un ganador único, así que yo los combinaría.
La combinación que más se recomienda en r/dataengineering sigue un orden claro:
- DataCamp para cursos, webinars y tutoriales de SQL. Muchos capítulos de curso son gratis, y los tutoriales y blogs siempre lo son.
- SQLBolt para lo más básico, con lecciones interactivas en el navegador y sin registro.
- Mode Analytics SQL Tutorial para practicar consultas sobre datasets analíticos reales, más cercano a lo que harás en el trabajo.
- SQLZoo para ejercicios progresivos que aumentan de dificultad.
- La ruta de SQL de LeetCode para problemas de entrevista de fácil a difícil, aunque muchos están tras la suscripción premium.
W3Schools SQL sirve como referencia rápida, pero es demasiado superficial para aprender desde cero. La limitación real de todos estos es que ninguno te enseña a optimizar SQL a gran escala; eso solo se aprende en un data warehouse real.
- Nivel: De principiante a avanzado
- Formato: Ejercicios interactivos en navegador, gratis (LeetCode tiene un nivel premium de pago)
- Ideal para: Ganar soltura en SQL desde cero y preparar entrevistas técnicas
Empieza a practicar: SQL for Absolute Beginners.
4. Fundamentos de Python: documentación y Automate the Boring Stuff
La ingeniería de datos funciona con Python, así que antes de Airflow o Spark necesitas soltura con scripts, ficheros y funciones. Los mejores fundamentos gratuitos de Python son realmente gratuitos, sin trucos de "auditar".
Para principiantes absolutos, Automate the Boring Stuff with Python es un libro completo, disponible gratis bajo Creative Commons, y su foco en manejo de archivos, scraping web y automatización con hojas de cálculo encaja de lleno con tareas reales de ingesta.
Cuando ya puedas escribir scripts, el canal de YouTube de Corey Schafer cubre Python y herramientas como Git y Docker con una calidad que muchos cursos de pago no igualan, y el tutorial oficial de Python.org es la referencia autorizada para entender el comportamiento preciso de cada cosa. La pega de docs y YouTube es que no te ofrecen un camino con evaluación, así que necesitarás disciplina.
- Nivel: Principiante
- Formato: Libro gratuito, vídeos, ejercicios interactivos y documentación oficial
- Ideal para: Llegar a un scripting cómodo antes de tocar herramientas de canalización
Lee el libro: Automate the Boring Stuff with Python.
5. Data Engineering Zoomcamp (DataTalks.Club)
Es el recurso que recomendaría a quien cambia de carrera para conseguir un proyecto de portfolio real, y es el que más a menudo se cita como el mejor curso gratuito de ingeniería de datos de extremo a extremo en Reddit y LinkedIn. Es un plan de nueve semanas, estilo bootcamp, mantenido por la comunidad y alojado íntegramente en GitHub.
Los módulos cubren el stack moderno en el orden en que lo verías en el trabajo: ingesta de datos, orquestación con Airflow, almacenamiento en BigQuery y Postgres, procesamiento por lotes y en streaming con Kafka, transformación con dbt e infraestructura con Terraform. Todo corre con datasets reales y despliegues en la nube, y el certificado gratuito se consigue completando las tareas y un proyecto final.
Dos avisos honestos. Es un curso intermedio que presupone Python y SQL básicos y cierta comodidad con la línea de comandos, y el compromiso de tiempo es real: de 5 a 10 horas semanales durante más de 9 semanas. Al ser mantenido por la comunidad, en GitHub suelen aparecer issues señalando que la consola de BigQuery y las versiones de Airflow o dbt han cambiado respecto a las capturas, y las secciones de Terraform son una rampa pronunciada si nunca has tocado DevOps.
- Nivel: Intermedio
- Formato: Curso abierto en GitHub, más de 9 semanas, gratis incluido el certificado
- Ideal para: Construir un proyecto de extremo a extremo que cubra todo el stack moderno
Empieza el curso: Data Engineering Zoomcamp en GitHub.
6. dbt Learn
dbt Learn es el recurso para la capa de transformación, y sus cursos troncales a tu ritmo son gratuitos. Si ya sabes SQL y quieres pasar a analytics engineering, este es el sitio.
El curso Fundamentals cubre modelado, tests y documentación, y módulos aparte recorren dbt con BigQuery, Snowflake y Redshift. Hay módulos más recientes sobre dbt con Iceberg y formatos de tabla abiertos, algo interesante si la empresa a la que apuntas usa un lakehouse.
La limitación es clara: el alcance. dbt Learn solo enseña la capa de transformación y modelado, así que da por hecho que manejas SQL y unas nociones de modelado dimensional, y no toca orquestación ni ingesta.
- Nivel: Intermedio
- Formato: Cursos del proveedor a tu ritmo, contenido central gratuito
- Ideal para: Analytics engineering y dominar el flujo de trabajo de transformación con dbt
Empieza a aprender: dbt Learn.
7. Documentación de Apache Airflow y guías de Astronomer
Airflow es la herramienta de orquestación con la que casi seguro te toparás en un puesto de ingeniería de datos, y su documentación oficial es gratuita y muy completa. Cubre conceptos clave, creación de DAGs, operators, planificación y opciones de despliegue.
La documentación en solitario puede resultar abstracta; ahí ayudan las guías de Astronomer.io. Aportan patrones de despliegue, enfoques de testing y ejemplos ETL concretos que la referencia oficial no detalla, y son gratuitas aunque la plataforma Cloud gestionada de Astronomer sea de pago.
La desventaja honesta es la curva de aprendizaje. La documentación presupone que lees Python con soltura, y las secciones de despliegue en producción se apoyan en Kubernetes y Helm, así que es lectura obligada cuando ya tienes las bases, no como primera parada. Si quieres una entrada más suave, empieza por nuestro tutorial de Airflow.
- Nivel: Intermedio
- Formato: Documentación oficial gratuita y guías gratuitas del proveedor
- Ideal para: Aprender orquestación y creación de DAGs cuando ya sabes Python
Lee la documentación: Apache Airflow documentation.
8. Formación gratuita en Databricks Academy
Databricks Academy ofrece cursos gratuitos a tu ritmo que son una buena introducción al mundo lakehouse, cada vez más presente en ofertas de empleo. El registro es gratuito e incluye varios cursos introductorios.
El nivel gratuito incluye "Get Started with Databricks" sobre el workspace y los notebooks, nociones básicas para analistas de SQL y BI, y una introducción a Delta Lake. Para principiantes, lo más valioso es Delta Lake porque explica por qué existen los lakehouses y no solo cómo hacer clic en la interfaz.
La pega es que los itinerarios más profundos y orientados a roles de ingeniería suelen estar detrás de planes de pago o se desbloquean con cuenta de empresa. Considera los cursos gratuitos como fundamentos, no como una ruta completa de ingeniería.
- Nivel: De principiante a intermedio
- Formato: Cursos del proveedor a tu ritmo, gratis tras registrarte
- Ideal para: Fundamentos de Delta Lake y lakehouse
Empieza a aprender: Databricks Academy.
9. Microsoft Learn: DP-900 y DP-203
Microsoft Learn alberga contenido totalmente gratuito para dos rutas de datos en Azure y es la vía gratuita más estructurada hacia los servicios de datos de una nube concreta. No hay truco de auditoría: los módulos de aprendizaje son realmente gratuitos.
Los itinerarios se dividen por nivel:
- Azure Data Fundamentals (DP-900) es una ruta para principiantes sobre bases de datos, analítica y servicios de datos clave de Azure.
- Azure Data Engineer Associate (DP-203) es una ruta de intermedio a avanzado que cubre Azure Synapse, Data Factory, Databricks, Delta Lake y Stream Analytics.
Con una cuenta gratuita de Azure obtienes créditos por tiempo limitado, anunciados en $200 durante 30 días, además de una capa siempre gratuita para ciertos servicios, así podrás practicar sin gastar. La crítica más común es que ambos itinerarios son muy de examen: excelentes para preparar la certificación, pero a veces enseñan para el test más que para problemas reales y desordenados.
- Nivel: De principiante (DP-900) a avanzado (DP-203)
- Formato: Itinerarios gratuitos del proveedor en Microsoft Learn
- Ideal para: Una entrada estructurada y enfocada a certificación en servicios de datos de Azure
Empieza a aprender: ruta Microsoft Learn DP-900.
10. Google Cloud Skills Boost y AWS Skill Builder
Si ya sabes en qué nube quieres trabajar, Google y AWS ofrecen laboratorios con entornos de nivel producción que ningún MOOC gratuito iguala. Son los recursos gratuitos más cercanos a lo que operarás en un trabajo real.
Google Cloud Skills Boost aloja la ruta Professional Data Engineer con laboratorios de BigQuery, Dataflow, Dataproc, Pub/Sub y Composer. AWS Skill Builder ofrece un plan de aprendizaje de Data Engineering on AWS que cubre S3, Glue, EMR, Redshift, Kinesis, Lambda y Lake Formation.
Los niveles gratuitos existen, pero son limitados. En ambas plataformas, algunos laboratorios y misiones avanzados requieren suscripción o créditos, y ejecutar labs contra servicios reales puede acarrear pequeños cargos si superas la capa gratuita, por ejemplo con Glue o Redshift. Google anuncia $300 en créditos durante 90 días para usuarios nuevos, y estudiantes de ambas plataformas comentan que, a veces, las instrucciones de los labs se desajustan respecto a la interfaz actual de la consola.
- Nivel: De intermedio a avanzado
- Formato: Itinerarios y laboratorios gratuitos del proveedor, con niveles de pago para contenido avanzado
- Ideal para: Práctica práctica, específica de la nube, en entornos de estilo producción
Empieza a aprender: ruta de Data Engineer en Google Cloud Skills Boost y AWS Skill Builder.
Ruta de aprendizaje sugerida
Estos recursos se apoyan entre sí, así que este sería el orden que seguiría si empezara desde cero.
Fase 1: conceptos y fundamentos
Empieza con nuestro curso Understanding Data Engineering para aprender el vocabulario, y después construye las dos habilidades que cualquier trabajo exige: SQL y Python. Recorre SQLBolt y luego el Mode SQL Tutorial para consultar datos, y lee Automate the Boring Stuff para scripting.
No corras en esta fase. Casi todo el que se atasca más adelante con el Zoomcamp es porque le falta base sólida en SQL o Python. Si te planteas suscribirte, el itinerario Professional Data Engineer in Python de DataCamp es muy recomendable aquí.
Fase 2: construye un proyecto de extremo a extremo
Cuando ya escribas SQL y Python con comodidad, el Data Engineering Zoomcamp es donde conviertes el conocimiento en portfolio. Te obliga a tocar ingesta, orquestación, almacenamiento y transformación en un único proyecto conectado, justo lo que un hiring manager quiere ver.
Apóyate en la documentación de Airflow y en nuestro tutorial de dbt cuando algún módulo del Zoomcamp vaya más rápido de lo que te gustaría.
Fase 3: especialízate en una plataforma
Tras el Zoomcamp, elige la nube que usan los empleos a los que apuntas y profundiza con el itinerario del proveedor: Microsoft Learn para Azure, Google Cloud Skills Boost para GCP o AWS Skill Builder para AWS. Si los roles mencionan lakehouses, añade el material de Delta Lake de Databricks Academy.
Si aspiras más a analytics engineering que a pipeline engineering, cambia la ruta de nube por los módulos avanzados de dbt Learn.
Cómo elegir el recurso adecuado
El mejor punto de partida depende de lo que ya sabes y de dónde quieres llegar. Aquí tienes una guía rápida de decisión.
- Principiante total, con dudas de si esto es para ti: empieza con el curso Understanding Data Engineering de DataCamp. Son 2 horas y no cuesta nada salir de dudas.
- Ya sabes SQL y quieres pasar de analista a ingeniero: sáltate los sitios de SQL y ve a dbt Learn y al Data Engineering Zoomcamp.
- No sabes nada de Python: haz Automate the Boring Stuff o los recursos de Python gratuitos de DataCamp antes que nada en esta lista.
- Ya sabes qué nube quieres: ve directo a Microsoft Learn, Google Cloud Skills Boost o AWS Skill Builder para esa plataforma.
- Estás preparando entrevistas: combina una ruta gratuita de SQL con nuestro blog de preguntas de entrevista de SQL.
- Quieres un portfolio listo para empleo, no un certificado: el Zoomcamp es una buena opción gratuita porque produce un proyecto real; también puedes consultar la lista de proyectos de ingeniería de datos de DataCamp.
Conviene decirlo claro: "gratis para auditar" y "gratis" no son lo mismo. Varias certificaciones de múltiples cursos se anuncian como gratuitas pero solo te dan los vídeos; las tareas evaluadas y el certificado quedan tras una suscripción de unos $49 al mes. Los recursos de esta lista o bien son totalmente gratuitos o bien son gratuitos para empezar con las partes de pago claramente indicadas, por eso he preferido cursos abiertos, documentación de proveedores y tutoriales frente a certificados solo para auditar.
Reflexiones finales
Para la mayoría que empieza desde cero, nuestro curso Understanding Data Engineering más un buen trabajo de base con SQL es el primer movimiento acertado, porque todo lo demás da por hecho ese cimiento.
El siguiente paso depende de ti. Un analista que pasa a ingeniería debería priorizar dbt Learn, mientras que alguien que apunta a un rol en una nube concreta debería ir directo a la ruta gratuita del proveedor cuando tenga los fundamentos.
Algunos avisos honestos. El material mantenido por la comunidad, como el Zoomcamp, va por detrás de las versiones reales de las herramientas, así que espera que la interfaz de BigQuery y las versiones de Airflow o dbt no coincidan con las capturas. Las capas gratuitas de los proveedores son temporales: Azure anuncia $200 durante 30 días y Google $300 durante 90 días, y los labs en la nube pueden generar pequeños cargos si superas la cuota gratuita en servicios como Glue o Redshift.
La respuesta sincera a "¿lo gratuito basta?" es que sí para las habilidades, pero necesitarás disciplina para unir por tu cuenta las piezas dispersas. Si prefieres seguir una ruta única y estructurada, nuestra carrera de Data Engineer cubre lo mismo en un solo sitio.
FAQs
¿Se puede aprender ingeniería de datos gratis?
Sí, puedes aprender prácticamente todas las habilidades de ingeniería de datos gratis con cursos abiertos, documentación de proveedores y tutoriales. DataCamp tiene un montón de recursos gratuitos, dbt Learn y la documentación de Apache Airflow no cuestan nada, y sitios como SQLBolt y Mode son gratuitos. El único coste que no puedes evitar del todo es la infraestructura: al ejecutar laboratorios en GCP, AWS o Azure puedes incurrir en pequeños cargos cuando superas los créditos gratuitos por tiempo limitado. Más allá de eso, la mayor carencia del aprendizaje gratuito es la estructura, así que necesitarás disciplina para hilvanar los recursos en un camino coherente.
¿Necesito saber Python y SQL antes de aprender ingeniería de datos?
Necesitas al menos Python básico y un SQL sólido para que la mayoría de cursos de ingeniería de datos tengan sentido. dbt Learn y la documentación de Airflow dan por hecho que dominas ambos. Si empiezas desde cero, trabaja primero con Automate the Boring Stuff para Python y con los tutoriales de SQL de DataCamp. SQL es lo más importante: aparece en almacenamiento, transformación y en casi todas las entrevistas técnicas.
¿Cuánto se tarda en aprender ingeniería de datos con recursos gratis?
Un plazo realista desde principiante hasta estar listo para trabajar es de unos 4 a 8 meses de estudio constante a tiempo parcial. Calcula entre 4 y 8 semanas para construir bases sólidas de SQL y Python, luego más de 9 semanas para el Data Engineering Zoomcamp dedicando de 5 a 10 horas semanales, y unas semanas más para especializarte en una plataforma cloud. Tu ritmo depende mucho de tu experiencia previa en programación y del tiempo semanal que puedas dedicar.
¿Puedo conseguir un empleo en ingeniería de datos solo con recursos gratuitos?
Seamos claros: terminar cursos gratuitos por sí solo no garantiza un empleo, pero sí basta para adquirir las habilidades que las empresas buscan. La clave es convertir lo aprendido en un portfolio con proyectos reales de extremo a extremo. A las empresas les importa lo aplicado, así que combina el aprendizaje gratuito con dos o tres proyectos que ingieran, orquesten y transformen datos reales. Añade la ruta del proveedor de nube que usan los roles a los que apuntas y serás competitivo.
Escritora y editora de contenidos en el ámbito de la tecnología educativa. Comprometido con la exploración de tendencias de datos y entusiasmado con el aprendizaje de la ciencia de datos.
