Ir al contenido principal

Los mejores artículos que quizá te perdiste el mes pasado

Este artículo repasa las principales noticias y novedades en ciencia de datos y aprendizaje automático del mes pasado. Abarca temas como tutoriales, investigación, nuevos paquetes, casos de uso y mucho más.
Actualizado 17 sept 2026  · 7 min leer

Explorar con IA

ChatGPTClaudePerplexity

La ciencia de datos es uno de los sectores que más rápido evoluciona. Cada día se publican nuevos artículos de investigación, paquetes, tutoriales y tecnologías, lo que a veces complica seguirles la pista. Para cualquier profesional de datos, estar al día es clave para seguir aprendiendo y creciendo. En este artículo encontrarás una selección con las últimas noticias, tutoriales, investigaciones y análisis que podrías haberte perdido el mes pasado. 

Nuevos tutoriales

Dos formas de crear transformadores personalizados con scikit-learn

Este artículo en Towards Data Science ofrece un tutorial sencillo sobre cómo crear un transformador a medida con scikit-learn. Scikit-learn es uno de los paquetes más utilizados en ciencia de datos, y probablemente la librería de machine learning más popular. Incluye numerosas funciones de preprocesado como One-Hot Encoding, MinMax Scaling y muchas más. A veces, sin embargo, conviene utilizar funciones de preprocesado personalizadas en lugar de las predefinidas como OneHotEncoder. Este tutorial te enseña a crear transformadores propios en scikit-learn para agilizar el preprocesado de datos en proyectos de machine learning.

MLOps en BigQuery ML con Vertex AI

En el último año, las grandes tecnológicas han avanzado mucho en MLOps. Llevar modelos de machine learning a producción sigue siendo uno de los mayores retos para los equipos de datos. Este vídeo ofrece un tutorial rápido sobre cómo combinar Vertex AI y BigQuery ML de Google Cloud para construir una canalización de Vertex AI lista para producción.

Nuevos tutoriales de Power BI de DataCamp

Con el lanzamiento de su nuevo itinerario de aprendizaje Data Analyst in Power BI en colaboración con Microsoft, DataCamp publicó varios tutoriales sobre Power BI el mes pasado. Power BI es una de las herramientas de business intelligence más extendidas y, si tu empresa usa Microsoft Office, es muy probable que ya tengas acceso. También es un gran paso para quien quiera ir más allá de Excel y profundizar en el mundo de los datos. Estos tutoriales cubren todo el recorrido con Power BI, desde cómo pasar de Excel a Power BI, un tutorial más completo de Power BI para principiantes, modelado de datos en Power BI y un tutorial sobre fórmulas DAX de Power BI para principiantes. Además, puedes descargar esta chuleta práctica para acompañar tu aprendizaje. 

Investigación pionera en machine learning

DALLE-2 de OpenAI

El mes pasado, OpenAI sorprendió al mundo con su algoritmo de generación de imágenes DALLE-2. OpenAI ha entrenado este nuevo modelo de machine learning para crear imágenes y arte fotorrealista a partir de texto en lenguaje natural. DALLE-2, sucesor de DALLE-1, logra un gran nivel de realismo mediante un proceso llamado «difusión», que crea un patrón de puntos aleatorios y lo va modificando gradualmente hasta formar una imagen que reconoce a partir del texto. Puedes leer más aquí y ver a Isabella Leslie Miller, data journalist de DataCamp, explicarlo en nuestro vídeo semanal de actualidad.

Pathways Language Model (PaLM)

PaLM demuestra el primer uso a gran escala del sistema Pathways. Google presentó la arquitectura Pathways el año pasado para entrenar de forma eficiente una nueva generación de modelos capaces de realizar múltiples tareas en distintos dominios. Con PaLM, Google ha creado un enorme modelo Transformer de 540.000 millones de parámetros que ha alcanzado resultados de vanguardia en diversas tareas de lenguaje y razonamiento: desde generación de código y explicación de chistes hasta identificación de causa y efecto, entre otras. Echa un vistazo al artículo para profundizar en Pathways y en los casos de uso que desbloquea PaLM. 

Nuevos paquetes y modelos

Lanzamiento de PyTorch 1.11

Con la publicación de la versión 1.11 de PyTorch llegan varias mejoras. La última versión incluye betas de TorchData, sucesor de la API DataLoader, y functorch, que ofrece transformaciones de funciones componibles para módulos de PyTorch. Además de estas novedades, PyTorch 1.11 incorpora mejoras de rendimiento, como un arranque un 40% más rápido en despliegues móviles y en el edge, entre otras. Si quieres aprender más sobre PyTorch, echa un vistazo a este curso de DataCamp para principiantes. 

EpyNN 1.2.7

EpyNN significa «Educational python for Neural Networks». Está pensado para docentes, estudiantes, científicos y cualquier persona con conocimientos básicos de Python que quiera entender y construir redes neuronales desde cero. Ofrece plantillas de arquitecturas y ejemplos prácticos que reducen el tiempo necesario para aprender a desarrollar redes neuronales desde cero. 

Entrenamiento del gran modelo de lenguaje de BigScience (tr11-176B-ml-logs)

BigScience es un espacio muy popular en Hugging Face y tiene la misión de crear modelos de lenguaje a gran escala de forma abierta con miles de investigadores en todo el mundo. El entrenamiento de su modelo principal comenzó el 11 de marzo de 2022 y se prolongará entre tres y cuatro meses en 384 GPUs A100 de 80 GB del superordenador público Jean Zay. Este modelo open source contará con 176.000 millones de parámetros y una arquitectura de decodificador tipo GPT. Puedes seguir las actualizaciones del entrenamiento en Twitter y podrás usar el modelo alrededor de junio. 

Casos de uso de ciencia de datos y machine learning

LaLiga se asocia con Databricks para analytics de fútbol

El equipo de analítica de LaLiga se ha asociado con Databricks para desplegar un data lakehouse dentro de su infraestructura analítica. Esto permitirá a LaLiga Tech —el nuevo brazo de analítica unificado de la liga— estructurar y gestionar sus datos con mucha más eficiencia y aplicar machine learning en casos como la predicción de lesiones, recomendaciones de contenido para aficionados y más. 

Uso de deep learning para anotar el universo de proteínas

Desde hace tiempo, la comunidad científica utiliza herramientas computacionales para inferir y anotar la función de las proteínas directamente a partir de su secuencia. El equipo de IA de Google ha logrado predecir de forma fiable la función de proteínas con deep learning; lo llaman ProtENN, y les ha permitido añadir unos 6,8 millones de entradas a la base de datos de Pfam. El equipo ha publicado el modelo ProtENN y un artículo interactivo al estilo distill para experimentar. Resolver este tipo de problemas permitirá acelerar descubrimientos de fármacos novedosos y terapias más fiables con ayuda del machine learning. 

Análisis y opinión

Potenciando al analista de datos moderno

En el último podcast DataFramed, Peter Fishman, CEO de Mozart Data, analiza el estado del stack de datos moderno y cómo las últimas herramientas de ciencia de datos están pensadas para empoderar al analista actual. Además, comparte su experiencia liderando equipos de datos, qué hace excelente a un buen analista, la importancia del conocimiento del dominio y de escuchar a los usuarios, y más. Escucha y suscríbete a DataFramed en tu plataforma de podcasts favorita.

MLOps es un caos, y es normal

En este artículo, Mihail Eric, fundador de Confetti AI, comparte su visión sobre el estado actual de las herramientas de MLOps. Tal como indica el título, Mihail desglosa con acierto el panorama fragmentado del tooling de machine learning. Dado que las operaciones de machine learning aún están en una fase temprana, los estándares, herramientas y buenas prácticas siguen formándose y no existe una pila canónica clara en la que los profesionales puedan apoyarse. Además, resolver la escasez de talento y adoptar una mentalidad de machine learning en la cultura de las organizaciones marcará la adopción de MLOps en los próximos años. 

Más recursos

Esperamos que te haya gustado este resumen de noticias, análisis, tutoriales e investigación. Para seguir al día en ciencia de datos, echa un vistazo a estos recursos:

Temas
Ciencia de datos
Aprendizaje automático
Relacionado

blog

Los 15 mejores libros sobre machine learning para leer en 2026

Machine learning es uno de los temas más candentes en la ciencia de datos. Aquí tienes una lista de 15 libros para iniciarte en este campo o convertirte en un experto.
Javier Canales Luna's photo

Javier Canales Luna

8 min

Machine Learning Interview Questions

blog

Las 35 preguntas más frecuentes en entrevistas sobre machine learning para 2026

Prepárate para tu entrevista con esta guía completa sobre preguntas relacionadas con el machine learning, que abarca desde conceptos básicos y algoritmos hasta temas avanzados y específicos de cada puesto.
Abid Ali Awan's photo

Abid Ali Awan

15 min

Machine Learning

blog

33 proyectos de machine learning para todos los niveles en 2026

Proyectos de machine learning para principiantes, estudiantes de último año y profesionales. La lista incluye proyectos guiados, tutoriales y código fuente de ejemplo.
Abid Ali Awan's photo

Abid Ali Awan

15 min

blog

8 modelos de machine learning explicados en 20 minutos

Descubre todo lo que necesitas saber sobre los tipos de modelos de machine learning, incluyendo para qué se utilizan y ejemplos de cómo ponerlos en práctica.
Natassha Selvaraj's photo

Natassha Selvaraj

15 min

Tutorial

Introducción al aprendizaje automático estadístico

Descubra la potente fusión de estadística y aprendizaje automático. Explore cómo las técnicas estadísticas sustentan los modelos de aprendizaje automático, permitiendo la toma de decisiones basada en datos.
Joanne Xiong's photo

Joanne Xiong

11 min

Tutorial

Aprendizaje automático de datos categóricos con el tutorial de Python

Aprenda los trucos más comunes para manejar datos categóricos y preprocesarlos para construir modelos de aprendizaje automático.
Moez Ali's photo

Moez Ali

14 min

Ver MásVer Más