Ir al contenido principal

Lo último sobre OpenAI, Google AI y qué significa para la ciencia de datos

Descubre las tecnologías disruptivas de lenguaje, visión y multimodalidad y cómo nos hacen más productivos y efectivos.
Actualizado 17 sept 2026  · 13 min leer

Explorar con IA

ChatGPTClaudePerplexity

OpenAI Google AI Data Science

Tanto Google AI como OpenAI tienen un historial de lanzamientos de tecnologías de IA punteras. Pero el panorama cambió con la llegada de ChatGPT, que ha encendido una nueva carrera en la que las grandes tecnológicas como Google se apresuran por lanzar modelos similares.

En este artículo, veremos los avances recientes de OpenAI y Google AI y qué podemos esperar a futuro. Además, veremos cómo el progreso en IA está transformando la ciencia de datos y cómo aprovecharlo para trabajar con más productividad.   

OpenAI

La API de OpenAI es una plataforma que permite acceder vía API a modelos generativos de última generación. Podemos generar imágenes de alta calidad con DALLE-2, texto y código con GPT-3, y usar embeddings para otras tareas de lenguaje. Además, te permite moderar resultados, añadir límites de uso y afinar el modelo con un conjunto de datos específico. Conoce GPT-3 leyendo nuestra guía para principiantes sobre GPT-3.

OpenAI Products

Imagen del autor | Fuente OpenAI

Todos estos son productos comerciales y siguen un modelo de pago por uso, pero de vez en cuando OpenAI ha publicado herramientas y modelos de código abierto, como:

  1. Whisper: modelo de reconocimiento de voz con supervisión débil a gran escala.
  2. OpenAI Baselines: implementación de algoritmos de aprendizaje por refuerzo. 
  3. Gym: toolkit para desarrollar y evaluar algoritmos de aprendizaje por refuerzo. 
  4. GPT2: código y modelo del artículo "Language Models are Unsupervised Multitask Learners".
  5. DALL-E: paquete de PyTorch para el VAE discreto usado en DALL·E.

Las APIs, los toolkits y los grandes modelos de lenguaje son fantásticos, pero ninguno se acerca al éxito de ChatGPT

El modelo de ChatGPT se entrenó con aprendizaje por refuerzo con retroalimentación humana (RLHF), de forma similar a InstructGPT (una versión mejorada de GPT-3), aunque la fase de recogida de datos es ligeramente distinta. 

¿En qué se diferencia de generaciones anteriores? La IA conversacional puede repreguntar, cuestionar premisas erróneas, reconocer fallos y demostrar medidas de seguridad.

Recientemente, Microsoft, socio de OpenAI, ha presentado una versión mejorada de ChatGPT. Con el despliegue iterativo de OpenAI, estamos viendo una nueva ola de tecnologías de IA que entienden nuestras necesidades y nos prestan asistencia. 

Si eres completamente nuevo en inteligencia artificial, empieza con el curso sin código AI Fundamentals. Cubre los fundamentos del aprendizaje automático: aprendizaje supervisado y no supervisado, deep learning y más. 

GPT-4

Más allá de ChatGPT, esperamos GPT-4, que será el gran modelo de lenguaje más avanzado. En el pódcast de Greylock, el CEO de OpenAI, Sam Altman, compartió algo de información sobre GPT-4. Dijo que los rumores de Twitter son falsos, que no tendrá 100 billones de parámetros, y que la gente se va a llevar una decepción. También afirmó que "lanzaremos GPT-4 cuando creamos que es seguro y funcional". 

GPT 4

Imagen del autor

¿Qué puedes esperar de GPT-4?

  • El tamaño del modelo no será mucho mayor que GPT-3.
  • Modelos grandes optimizados con nueva parametrización (μP).
  • Entrenamiento con cómputo óptimo, aumentando los tokens de entrenamiento para minimizar la pérdida. 
  • Será un modelo solo de texto. GPT-4 no será multimodal como DALL-E 2.
  • Podría usar dispersidad para reducir costes de cómputo.
  • Igual que ChatGPT, estará más alineado con nuestras intenciones y valores.

Conoce GPT-1, GPT-2, GPT-3 y GPT-4 leyendo nuestro artículo Todo lo que sabemos de GPT-4 hasta ahora

Creación de una AGI segura

En la entrevista con StrictlyVC, Altman dio algunas claves sobre hasta dónde hemos llegado en el desarrollo de la AGI (inteligencia artificial general). 

Dijo: «Cuanto más nos acercamos, más difícil es responder. Porque creo que va a ser mucho más difuso y una transición más gradual de lo que la gente piensa.»

También desmintió los rumores sobre la AGI. En la entrevista dijo que OpenAI no tiene una AGI que aprenda como los humanos. 

Creation of safe AGI

Imagen del autor

OpenAI va por buen camino para desarrollar una AGI segura, pero aún está lejos de ser perfecta. La AGI de la que se habla sería un modelo multimodal que entienda voz, texto, imagen y vídeo. Sería la combinación de ChatGPT, DALLE-2, Whisper, un modelo de generación de vídeo y otros algoritmos de aprendizaje por refuerzo. 

Modelos multimodales

Para desarrollar una AGI, OpenAI tiene que trabajar en modelos multimodales: no solo texto a imagen, sino texto a vídeo y audio a vídeo y audio. Es decir, podrás hablar con un bot que suene y se vea natural. Ya lo han logrado algunos desarrolladores, como la persona streamer de Twitch generada por IA. No es perfecto, pero es un comienzo. 

Durante el programa de StrictlyVC, Sam Altman desveló que están trabajando en un modelo de vídeo, y podemos suponer que será generación de texto a vídeo con un modelo de audio, añadiendo otra capa de complejidad. Ya existen tecnologías de generación de vídeo donde se superponen fotogramas generados con el modelo de stable diffusion. 

Google AI 

Google AI es la columna vertebral del ecosistema de Google. Se usa en Google Maps, Fotos, aplicaciones y Cloud. Google ha estado a la vanguardia en el desarrollo de herramientas y modelos de IA. La mayoría de productos están disponibles en Google Cloud, desde AutoML hasta modelos de visión y lenguaje de última generación. 

También ha lanzado múltiples herramientas y modelos punteros que han cambiado el panorama del procesamiento del lenguaje natural, el procesamiento del habla y la visión por ordenador. De TensorFlow a BERT (Bidirectional Encoder Representations from Transformers), Google ha abierto un nuevo camino para la investigación y el desarrollo en IA y machine learning. 

Google LaMDA

Gif de LaMDA

En 2020, Google Research presentó Meena, un modelo conversacional neuronal que entiende el contexto y aprende a responder con sentido. Después, Google lanzó el modelo LaMDA, similar a ChatGPT. Fue una tecnología conversacional revolucionaria construida con transformers pero entrenada en diálogos. 

Cada año vemos nueva tecnología de Google y, en el futuro, podemos esperar un buscador más avanzado impulsado por AI Bard, modelos de lenguaje, visión, generativos y multimodales que harán la IA multipropósito. 

Google AI Bard

Tras el lanzamiento de ChatGPT, la gente empezó a decir que era el «asesino de Google». La ampliación de la alianza entre Microsoft y OpenAI lo hacía aún más probable. Microsoft está lista para plantar cara a Google en el negocio de los buscadores con su Bing potenciado por OpenAI. 

Para contrarrestarlo, Google lanzó su versión de ChatGPT llamada Google AI Bard. Consulta nuestra comparativa entre ChatGPT y Google Bard en un artículo aparte. 

Google Bard and new AI features

Gif de Bard y nuevas funciones de IA

En las recientes actualizaciones de Google AI, Sundar Pichai, CEO de Google y Alphabet, presentó un nuevo servicio experimental de IA conversacional llamado Bard, impulsado por LaMDA. Google ha anunciado que ha dado acceso a testers de confianza y que, en las próximas semanas, estará disponible para el público. 

Bard usa información de la web para ofrecer respuestas de alta calidad. A diferencia del modelo ChatGPT, Bard es un servicio que combina el conocimiento del mundo con potencia, inteligencia y creatividad. Inicialmente, Google lo lanza con una versión ligera de LaMDA y, con el tiempo, incorporará modelos de lenguaje más potentes.

Modelos de lenguaje, visión y generativos

Según informes recientes de Google Research, han logrado avances en tecnologías de lenguaje, visión por ordenador y modelos generativos. 

The ability to perform multi-step arithmetic

Imagen de Google AI

  • Grandes modelos de lenguaje: Pathways Language Model (PaLM) y LaMDA han mostrado resultados prometedores, y en el futuro podrás esperar modelos de lenguaje aún mejores para IA conversacional y otras tareas de procesamiento del lenguaje natural. 
  • Visión por ordenador: MaxViT (Multi-Axis Vision Transformer), Pix2Seq (marco de modelado de lenguaje para detección de objetos) y avances en conversión de 2D a 3D usando interpolación de fotogramas con gran movimiento.
  • Generación de imágenes: modelos avanzados de generación fotorrealista: Imagen (modelo de difusión) y Parti (arquitectura transformadora autorregresiva). Ambos usan texto como entrada para generar píxeles de imagen. 
  • Generación de vídeo: el año pasado, Google AI trabajó en Imagen Video y Phenaki. Imagen Video usa modelos de difusión en cascada para generar vídeos de alta resolución, mientras que Phenaki usa descripciones textuales de dominio abierto para generar vídeos de longitud variable. 

Empieza tu carrera en deep learning (IA) con nuestro itinerario de habilidades Deep Learning in Python. Incluye cuatro cursos que llevarán tus habilidades de machine learning al siguiente nivel. 

Modelos multimodales

La mayoría de modelos de ML se centran en una sola modalidad de datos (clasificación de texto, segmentación de imágenes o reconocimiento de voz). Pero gracias a DALL-E 2 y Stable Diffusion, ahora muchas empresas se enfocan en modelos multimodales para lograr resultados de vanguardia. 

Google AI ha logrado multimodalidad pasando los datos por capas específicas de cada modalidad y mezclando las características de distintas modalidades a través de una capa embudo. Combinar modalidades también puede mejorar el rendimiento en tareas de una sola modalidad. 

Multimodal Models

Gif de Google AI

Algunos de los avances más recientes de Google AI en modelos multimodales: 

  • Locked-image Tuning (LiT) añade comprensión del lenguaje a modelos de imagen ya preentrenados. 
  • PaLI puede realizar muchas tareas en más de 100 idiomas: respuesta a preguntas visuales, subtitulado de imágenes, detección de objetos y su traducción, clasificación de imágenes y más.  
  • VDTTS: modelo de texto a voz guiado visualmente que toma el texto y los fotogramas originales del actor y genera un audio de voz que encaja con el vídeo original manteniendo tiempos y emoción. 
  • Look and Talk es una tecnología multimodal que usa vídeo y audio como entrada para hacer la conversación con el Asistente de Google más natural. El modelo aprende múltiples pistas visuales y de audio para determinar con más precisión si la persona se dirige al Asistente o no.  
  • 4D-Net combina datos de nubes de puntos 3D de vehículos autónomos con otros sensores para entender mejor el entorno y los objetos y tomar mejores decisiones.

Podemos suponer que, en el futuro, se adoptarán estos modelos en los ecosistemas de Google para aumentar el engagement y crear nuevos productos. 

IA y ciencia de datos

La IA moderna se impulsa con ciencia de datos, algoritmos e ingeniería de datos. Para crear tecnología puntera como ChatGPT y LaMDA, hay que empezar por los fundamentos: entender cómo manejar datos y aplicar técnicas de procesamiento del lenguaje natural y aprendizaje por refuerzo, aprender sobre deep learning y transformers, y optimizar modelos.

Empieza tu carrera en ciencia de datos completando el itinerario profesional Data Scientist with Python. Te enseñará las habilidades esenciales para convertirte en científico de datos profesional.

AI and Data Science

Imagen del autor

Y ahora, la gran pregunta: ¿la IA sustituirá a científicos de datos, analistas o ingenieros? La respuesta corta es «NO». Quizá en un futuro lejano, pero incluso entonces tendremos otros trabajos, más creativos y centrados en la toma de decisiones. A medida que evolucione la IA, nosotros también creceremos.

GitHub Copilot, DALL-E 2, ChatGPT y otras tecnologías punteras están aquí para asistirte. Su objetivo es que seamos más productivos y eficientes. 

Andrej Karpathy, exdirector de IA en Tesla y OpenAI, dice:

«Copilot ha acelerado mi programación de forma drástica; cuesta imaginar volver a la "programación manual". Sigo aprendiendo a usarlo, pero ya escribe ~80% de mi código, con ~80% de acierto. Realmente ya no programo: hago prompts y edito.» - Twitter

Demuestra que mucha gente que entiende la tecnología la usará para mejorar en programación, lógica, análisis de datos y toma de decisiones. 

¿Cómo pueden usar la IA los científicos de datos?

  1. Generar datos realistas manteniendo la privacidad de los usuarios.
  2. Escribir código elegante y eficiente.
  3. Prototipar productos.
  4. Realizar mejor análisis de datos mediante prompts. 
  5. Generar consultas SQL complejas con lenguaje natural. 
  6. Crear informes más claros para perfiles no técnicos.
  7. Hacer análisis estadísticos complejos con explicación.
  8. Aprender nuevos lenguajes de programación, habilidades, frameworks y conceptos. 
  9. Usar AutoML y herramientas de optimización de modelos impulsadas por IA para crear soluciones de ML de vanguardia.
  10. Construir scripts de automatización para ahorrar tiempo y evitar errores. 

Una nueva era de avances en IA

Microsoft, en colaboración con OpenAI, ha integrado ChatGPT en el nuevo buscador Bing, al que llama copiloto para la web. Con este anuncio, ha comenzado una nueva carrera por la supremacía tecnológica.

Microsoft planea integrar ChatGPT y otros modelos GPT en su ecosistema. Esto lo cambiará todo, ya que los usuarios ni siquiera tendrán que salir de la aplicación: podrán buscar, añadir contenido, editarlo y generar ideas simplemente chateando con un bot. 

Bing Copilot Demo

Demo de Bing Copilot

En el evento de París, Google lanzó su versión de ChatGPT llamada Bard. Está impulsada por una versión ligera de LaMDA. Bard es bastante similar al copiloto de Microsoft para la web; también está integrado en el buscador de Google y ofrece prestaciones parecidas. 

Los inconvenientes del avance en IA

  • Grandes modelos de lenguaje como GPT pueden usarse en el futuro para campañas de desinformación —openai.com. Tienen potencial de causar daños físicos y emocionales.
  • El contenido generado con IA está optimizado para SEO y es más difícil de detectar. Estudiantes y profesionales lo usan para crear trabajos originales sin aprender ni entender los conceptos. Lee más sobre riesgos y oportunidades en educación en la documentación de OpenAI API.
  • Los problemas de copyright son reales. Estos modelos se entrenan con texto disponible en línea, parte del cual está protegido. No se puede apropiarse del trabajo ajeno para justificar el avance en IA. 
  • A veces, la IA produce respuestas incorrectas. Esto podría causar grandes problemas si estos modelos se implantan en ámbitos como las fuerzas de seguridad. 

Estos problemas se irán resolviendo y veremos nueva legislación que regule el uso de la IA. Escuelas y grandes plataformas de contenido ya están aplicando políticas sobre contenido generado con IA. 

Entonces, ¿qué podemos hacer? Empezar a aprender estas tecnologías y usarlas de forma ética. Puedes empezar a aprender IA inscribiéndote en nuestro itinerario profesional Machine Learning Scientist with Python. Te enseñará las habilidades esenciales de machine learning para conseguir un puesto como ingeniero de IA.

Temas
Inteligencia Artificial
Aprendizaje profundo
Ciencia de datos

Cursos destacados

programa

Fundamentos del aprendizaje automático en Python

16 h
Aprende el arte del Aprendizaje Automático y sal como un jefe en predicción, reconocimiento de patrones y los inicios del Aprendizaje Profundo y de Refuerzo.
Ver detallesRight Arrow
Iniciar Curso
Ver másRight Arrow
Relacionado

blog

Todo lo que sabemos sobre GPT-5

Descubre cómo GPT-5 evolucionará hasta convertirse en un sistema unificado con funciones avanzadas, cuyo lanzamiento está previsto para el verano de 2025, basándose en la última hoja de ruta de OpenAI y en la historia de GPT.
Josep Ferrer's photo

Josep Ferrer

8 min

blog

¿Qué es GPT-4 y por qué es importante?

OpenAI ha anunciado el lanzamiento de su último gran modelo lingüístico, GPT-4. Este modelo es un gran modelo multimodal que puede aceptar tanto entradas de imagen como de texto y generar salidas de texto.
Abid Ali Awan's photo

Abid Ali Awan

9 min

blog

¿Qué es Sora de OpenAI? Cómo funciona, Ejemplos, Características

Descubre Sora de OpenAI a través de vídeos de ejemplo y explora sus funciones, como Remix, Re-cut, Loop, Storyboard, Blend y Style Preset.
Richie Cotton's photo

Richie Cotton

8 min

blog

El papel de la IA en la tecnología: Cómo la Inteligencia Artificial está transformando las industrias

Descubre el poder de la IA en la tecnología, desde el desarrollo de software hasta la asistencia sanitaria. Descubre cómo utilizan la IA las empresas y por qué es crucial mejorar los conocimientos sobre IA.
Javier Canales Luna's photo

Javier Canales Luna

10 min

blog

Cómo aprender IA desde cero en 2026: Guía completa de los expertos

Descubre todo lo que necesitas saber sobre el aprendizaje de la IA en 2026, desde consejos para empezar, recursos útiles e información de expertos del sector.
Adel Nehme's photo

Adel Nehme

15 min

Tutorial

Tutorial de la API de OpenAI Assistants

Una visión completa de la API Assistants con nuestro artículo, que ofrece una mirada en profundidad a sus características, usos en la industria, guía de configuración y las mejores prácticas para maximizar su potencial en diversas aplicaciones empresariales.
Zoumana Keita 's photo

Zoumana Keita

14 min

Ver MásVer Más