programa
BERT, GPT-3, DALL-E 2, LLaMA, BLOOM; estos modelos son algunas de las estrellas de la revolución de la IA que hemos presenciado desde el lanzamiento de ChatGPT. ¿Qué tienen en común? Exacto: todos son foundation models.
Los foundation models son un desarrollo reciente en IA. Se crean a partir de algoritmos diseñados para optimizar la generalidad y la versatilidad de sus salidas. Se basan en redes neuronales a gran escala que suelen entrenarse con una amplia variedad de fuentes y enormes volúmenes de datos para realizar un abanico muy amplio de tareas posteriores, incluidas algunas para las que no fueron desarrollados ni entrenados de forma específica.
La popularización de los foundation models está reavivando el debate clásico entre narrow AI y la inteligencia artificial general (AGI), también conocida como IA fuerte. La narrow AI se refiere a sistemas de IA diseñados para tareas concretas que no pueden desempeñar funciones fuera de ese alcance. Por el contrario, la AGI es un sistema hipotético de IA capaz de comprender, aprender y aplicar conocimiento en una amplia variedad de tareas, de forma similar a un humano.
Aunque los foundation models todavía no piensan como las personas, ya están ofreciendo resultados revolucionarios que nos acercan al umbral de la AGI. Por eso, tanto quienes trabajan con datos como quienes no son expertos deberían familiarizarse con estos modelos.
Si estás empezando en el tema, nuestro itinerario de aprendizaje AI Essentials te ayudará a obtener una visión profunda de los modelos de IA de nueva generación. Si ya tienes base, nuestro artículo sobre proyectos de IA generativa te permite poner a prueba tus conocimientos.
¡Vamos a ver de cerca los foundation models!
¿Qué son los foundation models? Conceptos clave
Foundation model es un término relativamente reciente que se solapa con otros conceptos populares como IA generativa, transformer y large language models (LLMs).
Aún hay debate sobre la terminología de la IA. Aquí tienes una serie de definiciones que te ayudarán a moverte por este campo en rápida evolución:
- IA generativa. Es un término amplio para describir sistemas de IA cuya función principal es generar contenido, a diferencia de otros sistemas de IA orientados a tareas como la clasificación o la predicción.
- Transformer. Los transformers han revolucionado el deep learning. Aportan una arquitectura innovadora para gestionar datos secuenciales de forma más eficaz. Son especialmente adecuados para procesar texto y, por ello, se han convertido en piedra angular del procesamiento y la generación del lenguaje natural (NLP y NLG). También se han aplicado con éxito a otros tipos de datos, como imágenes.
- Large language model. Los LLMs son sistemas de IA para modelar y procesar el lenguaje humano. Los transformers son la tecnología subyacente de los LLMs. Se llaman «grandes» porque tienen cientos de millones o incluso miles de millones de parámetros, y se preentrenan con un corpus masivo de texto.
- Foundation model. Es un término amplio para definir modelos de IA diseñados para producir una gran variedad de salidas generales. Pueden abordar muchas tareas y aplicaciones posibles, como la generación de texto, vídeo, imagen o audio. Una característica singular es que pueden funcionar como sistemas independientes o como «base» para otras aplicaciones. Por ejemplo, el LLM llamado GPT funciona como foundation model de ChatGPT.
¿Cómo funcionan los foundation models?
La tecnología que sustenta los foundation models –independientemente de la tarea para la que se diseñen y del tipo de datos de entrenamiento– es el transformer.
Desarrollados por investigadores de Google en 2017, los transformers son una alternativa a las tradicionales redes neuronales recurrentes (RNN) y las redes neuronales convolucionales (CNN) para manejar datos secuenciales, especialmente texto.
Los transformers funcionan prediciendo la siguiente palabra de una secuencia para generar una respuesta coherente. Este proceso se basa en un mecanismo llamado atención, que pondera la influencia de distintas palabras al generar la respuesta.
El entrenamiento de transformers tiene dos fases: preentrenamiento y ajuste fino.
Preentrenamiento
En esta fase, los transformers se entrenan con grandes volúmenes de datos (de texto) sin procesar, siendo internet la fuente principal.
El entrenamiento se realiza mediante aprendizaje autosupervisado, un tipo de entrenamiento innovador que no requiere intervención humana para etiquetar datos.
El objetivo del preentrenamiento es aprender los patrones estadísticos del lenguaje. Dado que la estrategia más extendida para mejorar el rendimiento es aumentar el tamaño del modelo (es decir, sus parámetros) y la cantidad de datos usados durante el preentrenamiento, esta fase suele ser costosa y llevar mucho tiempo.
Ajuste fino
El preentrenamiento permite a un transformer adquirir una comprensión básica del lenguaje, pero no basta para realizar tareas prácticas concretas. Por eso, el modelo pasa por una fase de ajuste fino, en la que se entrena con un conjunto de datos más acotado y específico del dominio, generado con la ayuda de personas revisoras que siguen directrices definidas.
Modalidad
Otra característica importante de los foundation models es la modalidad. Según el tipo de datos que puedan recibir como entrada, pueden ser unimodales o multimodales. Los primeros solo aceptan un tipo de dato y generan la misma clase de salida; los segundos pueden recibir múltiples tipos de entrada y producir salidas diversas (por ejemplo, GPT-4 puede aceptar imágenes y texto como entrada y generar texto como salida).
Entender a fondo cómo funcionan los transformers puede ser complejo y se sale del alcance de este artículo. Para una explicación más detallada, consulta nuestro artículo ¿Qué es ChatGPT?, donde le hacemos la pregunta directamente a ChatGPT, y aprende sobre Transformers y Hugging Face para una visión más técnica.
Si quieres profundizar en cómo funcionan los LLMs, nuestro curso de conceptos sobre large language models (LLMs) es un gran punto de partida.
Aplicaciones de los foundation models
Los foundation models pueden usarse como sistemas independientes o como base para innumerables sistemas y aplicaciones de IA posteriores. Aunque la mayoría de los modelos modernos están diseñados para generar texto o código y realizar tareas de NLP, cada vez hay más sistemas capaces de generar otros tipos de salida, como imágenes o música.
A continuación, tienes una tabla con algunos de los foundation models más populares.
|
Foundation model |
Sistema de IA derivado |
Aplicaciones |
|
LaMDA (Google) |
Servicio experimental de chat conversacional con IA. |
|
|
GPT-3.5 (OpenAI) |
Permite mantener conversaciones con un lenguaje similar al humano. |
|
|
GPT-4 (OpenAI) |
Ayuda a los usuarios de DataLab a programar mejor e ir más rápido. |
|
|
Codex (OpenAI) |
GitHub Copilot |
Sugiere código y funciones completas en tiempo real. |
|
AudioLM (Google) |
MusicLM |
Crea música a partir de descripciones en texto. |
|
BLOOM (Hugging Face) |
Sin aplicación derivada; puede usarse directamente |
Múltiples tareas de NLP. Entrenado en 46 idiomas y 13 lenguajes de programación. |
|
LLaMA (Meta) |
Sin aplicación derivada; puede usarse directamente |
Ayuda a investigadores a avanzar en este subcampo de la IA. |
|
DALL-E 2 (OpenAI) |
Sin aplicación derivada; puede usarse directamente |
Crea imágenes y arte realistas a partir de descripciones en lenguaje natural. |
Retos y preocupaciones en torno a los foundation models
Los foundation models están a la vanguardia de la IA y tienen potencial para impulsar innumerables aplicaciones. Sin embargo, es importante considerar sus riesgos y desafíos.
Aquí tienes una lista no exhaustiva de riesgos asociados a la adopción generalizada de foundation models:
- Falta de transparencia. La opacidad algorítmica es una de las principales preocupaciones: a menudo se describen como modelos de «caja negra», tan complejos que es imposible rastrear su razonamiento. Los proveedores de IA suelen mostrarse reacios a facilitar información por confidencialidad empresarial. No obstante, aumentar la transparencia es esencial para conocer el coste e impacto de estos modelos y evaluar su seguridad y eficacia.
- Sesgos y discriminación. Los modelos sesgados pueden derivar en decisiones injustas que agravan la discriminación contra grupos minoritarios. IBM Research está explorando cómo minimizar estos sesgos.
- Privacidad. Los foundation models se entrenan con cantidades ingentes de datos, a menudo con información personal. Esto puede generar problemas y riesgos en materia de privacidad y seguridad de los datos.
- Consideraciones éticas. A veces, estos modelos pueden influir en decisiones con implicaciones serias en nuestra vida, afectando a derechos fundamentales. En otro artículo hemos analizado la ética de la IA generativa.
El futuro de los foundation models
Los foundation models están alimentando el boom actual de la IA generativa. Sus posibles aplicaciones son tan amplias que todos los sectores e industrias, incluida la ciencia de datos, probablemente se verán impactados por la adopción de la IA en los próximos años.
Aunque todavía estamos lejos de lograr una inteligencia artificial general, el desarrollo de estos modelos representa un hito importante en la carrera de la IA. Empresas, reguladores y la sociedad en general deben conocer el estado actual de la IA como condición previa para garantizar transparencia, equidad y rendición de cuentas.
En DataCamp trabajamos para ofrecer recursos completos y accesibles que ayuden a todo el mundo a mantenerse al día de los avances en IA. Échales un vistazo:
- Introduction to Meta AI's LLaMA: Empowering AI Innovation - Esta entrada presenta LLaMA, una colección de foundation models de lenguaje de última generación.
- An Introduction to Statistical Machine Learning - Este tutorial explica cómo las técnicas estadísticas sustentan los modelos de machine learning, una base clave para entender los foundation models.
- 5 Projects You Can Build with Generative AI Models (with examples) - Esta entrada ofrece ideas de proyectos prácticos con modelos de IA generativa, un tipo de foundation model.
- How to Ethically Use Machine Learning to Drive Decisions - Este artículo aborda la importancia de la ética al usar modelos de machine learning, incluidos los foundation models.
- AI Essentials Skill Track - Este itinerario de aprendizaje ofrece una introducción completa a la IA, incluidos modelos como ChatGPT, que es un tipo de foundation model.
Soy analista de datos autónomo y colaboro con empresas y organizaciones de todo el mundo en proyectos de ciencia de datos. También soy instructor de ciencia de datos con más de 2 años de experiencia. Escribo regularmente artículos relacionados con la ciencia de datos en inglés y español, algunos de los cuales se han publicado en sitios web consolidados como DataCamp, Towards Data Science y Analytics Vidhya Como científico de datos con formación en ciencias políticas y derecho, mi objetivo es trabajar en la interacción de las políticas públicas, el derecho y la tecnología, aprovechando el poder de las ideas para promover soluciones y narrativas innovadoras que puedan ayudarnos a abordar retos urgentes, como la crisis climática. Me considero autodidacta, aprendiz constante y firme partidaria de la multidisciplinariedad. Nunca es demasiado tarde para aprender cosas nuevas.





