Curso

Los agentes de IA como Auto-GPT, AgentGPT y BabyAGI son la siguiente evolución en el vertiginoso mundo de la IA. Aunque ChatGPT llevó la IA generativa al gran público a finales de 2022, necesita que una persona introduzca indicaciones. La idea detrás de los agentes de IA es que la IA trabaje de forma independiente hacia un objetivo con una intervención humana mínima o nula.
Muchos desarrolladores han visto el potencial de esta nueva tecnología. Auto-GPT es el proyecto de código abierto de más rápido crecimiento de la historia si lo mides por el número de estrellas en GitHub (el equivalente a «marcar como favorito» un proyecto de software). En las seis semanas desde que empezó su desarrollo, ha alcanzado 107.000 estrellas. A modo de comparación, pandas, el paquete de Python más popular para ciencia de datos, tiene 38.000 estrellas.
Este tutorial explica qué son los agentes de IA, cómo se relacionan con los grandes modelos de lenguaje como GPT y para qué pueden usarse. Antes de leerlo, te vendrá bien saber qué es un gran modelo de lenguaje. A Beginner's Guide to GPT-3 es una buena introducción. También te recomiendo nuestro nuevo curso Introduction to AI Agents para aprenderlo todo sobre los agentes de IA y sus usos reales.
Introducción a los agentes de IA
¿Cómo se relacionan los agentes de IA con ChatGPT?
Explicar los agentes de IA requiere conocer algo de jerga. Consulta las definiciones a continuación:
- Un gran modelo de lenguaje (LLM) es un tipo de modelo de machine learning que se utiliza para generar texto.
- GPT de OpenAI es actualmente el LLM más popular. La versión más reciente es GPT-4, aunque la anterior, GPT-3.5-turbo, sigue utilizándose.
- Chat es un flujo de trabajo en el que envías una indicación de texto a la IA, que devuelve una respuesta en texto.
- Embeddings es un flujo de trabajo en el que envías una indicación de texto a la IA y esta devuelve como respuesta una representación numérica del texto. Representar texto como números es útil para tareas de búsqueda, recomendación y clasificación.
- ChatGPT de OpenAI es una aplicación web que ofrece una interfaz cómoda para chatear con GPT.
Del mismo modo que ChatGPT es una aplicación web impulsada por el LLM GPT, los tres agentes de IA que veremos en este tutorial también son aplicaciones basadas en GPT.
El principal problema que intentan resolver estos agentes de IA es reducir la cantidad de interacción humana necesaria para que la IA complete una tarea.
AgentGPT y BabyAGI son básicamente «GPT en bucle»: se llama repetidamente a GPT para descomponer la petición del usuario en problemas abordables y se va puliendo la salida de cada paso hasta completar con éxito cada subtarea.
Auto-GPT va un paso más allá al dotar al agente de IA de acceso a internet y capacidad para ejecutar código, lo que le permite resolver una mayor variedad de problemas.
Merecen mención las siguientes innovaciones.
Memoria a largo plazo
Los LLM generan palabras en función de las palabras anteriores de la conversación (tanto las indicaciones del usuario como las respuestas de la IA). Sin embargo, tienen una memoria bastante corta: muchos modelos recuerdan solo unos cientos de palabras, y el GPT-4 más avanzado recuerda alrededor de 6.000 palabras por defecto. Cuando la longitud de la conversación supera la memoria del LLM, las respuestas pueden volverse inconsistentes entre sí.
Para la mayoría de los casos de uso, esto no supone un problema. Pero en otros es esencial recordar toda la conversación, e incluso conversaciones anteriores. Los chatbots, y sus primos más avanzados, los agentes de IA, son un buen ejemplo.
Dotar de memoria a un agente de IA se consigue usando un flujo de trabajo de embeddings para almacenar el texto de la conversación como números. Cada indicación del usuario o respuesta de la IA se guarda como un array que representa el significado del texto.
Estos arrays numéricos se almacenan en una base de datos vectorial. Actualmente, Auto-GPT y BabyAGI usan Pinecone (el líder en este ámbito), y el equipo de AgentGPT está incorporando compatibilidad con esta función.
Capacidades de navegación web
Si le preguntas a ChatGPT sobre acontecimientos recientes, te dirá que no puede responder porque solo fue entrenado con datos hasta septiembre de 2021. De nuevo, para muchos usos esto no es un problema, pero sí lo es si tu tarea implica información o eventos actuales.
Una solución es darle al agente de IA capacidad para navegar por la web, acceder a internet y encontrar respuestas por sí mismo.
Auto-GPT puede investigar por su cuenta a través de la API de Google Search.
Esta función genera algo de debate: los desarrolladores de AgentGPT y BabyAGI no la han añadido por ahora y prefieren limitar el conocimiento de la IA a lo que sabe GPT.
Ejecución de código
Aunque los LLM como GPT pueden generar código desde cero y depurar o mejorar código existente, no pueden ejecutarlo.
Auto-GPT puede ejecutar código de shell y de Python. Es decir, puede escribir código y también ejecutarlo.
Una capacidad especialmente potente que le da esto es escribir el código para interactuar con otros programas y luego ejecutarlo. Así puede completar tareas aprovechando otro software.
¿Cuáles son los casos de uso de los agentes de IA?
Aún es muy pronto para determinar cómo vamos a usar los agentes de IA. Muchos ejemplos son variantes de un asistente personal automatizado, como una versión de nueva generación de IBM Watson Assistant.
Udit Goenka, CEO de FirstSales.io, publicó en Twitter que había utilizado Auto-GPT para crear un motor de prospección. La captura del tuit muestra al agente de IA creando un plan para buscar empresas que hayan levantado una ronda semilla en el último año (es decir, prospectos que deberían tener liquidez) y describiendo los detalles para crear la lista (extrayendo nombres y URL de empresas).

Yew Jin Lim, ingeniero de software en Google, contó que había usado Auto-GPT para crear un asistente de correo (repositorio en GitHub). El vídeo del tuit muestra a Yew Jin enviando un email al agente de IA con los detalles de una tarea y al agente realizando acciones como añadir un evento a su calendario.
¿Cuáles son los riesgos y limitaciones de los agentes de IA?
El consejo general al trabajar con IA es mantener a una persona en el circuito para comprobar con sentido común lo que está haciendo la IA. Recuerda que la IA debe ser un asistente, no una experta (y es un asistente que a veces alucina). Conviene tener en cuenta varias precauciones.
Ejecutar la IA de forma continua puede salir caro
Aunque una sola llamada a GPT vía la API de OpenAI es bastante barata (normalmente menos de 1 centavo de dólar con GPT-3.5, según la cantidad de salida; GPT-4 es más caro), usar cualquiera de los tres agentes de IA aquí comentados para una tarea compleja puede implicar cientos o miles de llamadas a la API.
Es buena idea incluir puntos de control donde se requiera intervención humana para autorizar que la IA continúe ejecutándose.
Dar a Auto-GPT acceso a software puede ser peligroso
Aunque a Auto-GPT se le puede dar acceso a cualquier API, si le concedes acceso para comprar acciones automáticamente en tu nombre, prepárate para perder todo el dinero de tu cuenta. Del mismo modo, es mala idea darle permisos de escritura en tu base de datos corporativa.
Más allá de pérdidas personales o corporativas, algunos investigadores sostienen que una IA avanzada supone riesgos mayores o incluso existenciales. Aunque los primeros intentos de usar Auto-GPT para destruir a la humanidad no han tenido éxito, conviene tener presente la advertencia de Eliezer Yudkowsky, investigador sénior en el Machine Intelligence Research Institute.
Para visualizar una IA hostil y sobrehumana, no imagines a una pensadora erudita pero pasiva dentro de internet enviando correos malintencionados. Imagina toda una civilización alienígena pensando millones de veces más rápido que los humanos, confinada inicialmente a ordenadores, en un mundo de criaturas que, desde su perspectiva, son muy torpes y muy lentas. Una IA lo bastante inteligente no permanecerá mucho tiempo confinada a ordenadores. En el mundo actual puedes enviar cadenas de ADN por email a laboratorios que producirán proteínas bajo demanda, lo que permitiría a una IA confinada inicialmente a internet crear formas de vida artificiales o dar el salto directamente a la fabricación molecular posbiológica.
Si alguien construye una IA demasiado potente, en las condiciones actuales, espero que poco después muera cada miembro de la especie humana y toda la vida biológica de la Tierra.
Aunque es claramente un escenario extremo, merece la pena considerar los peligros que podría entrañar una IA sin restricciones.
¿Cómo puedo acceder a un agente de IA?
Para probar estos agentes tú mismo, hay varias webs que te permiten trastear con la tecnología. Si quieres usarlos de forma más seria, tendrás que instalarlos en tu entorno de desarrollo preferido.
Elijas el agente que elijas, y lo uses como lo uses, necesitarás una clave de la API de OpenAI. En el tutorial Using GPT-3.5 and GPT-4 via the OpenAI API in Python tienes las instrucciones.
Si quieres instalar cualquiera de estos agentes de IA, ten en cuenta que son aplicaciones de línea de comandos y, en su estado actual, requieren algo de esfuerzo para configurarse.
Interfaces web
La plataforma de IA Hugging Face ofrece una versión alojada de Auto-GPT. Solo tienes que indicar tu clave de la API de OpenAI y luego asignar a la IA un rol y unos objetivos.
God Mode (llamado así por un modo truco de videojuegos) te permite igualmente introducir tu clave de la API de OpenAI y darle a Auto-GPT una tarea a completar.
Si usas Replit, también puedes hacer fork de este repl y darle tu clave de la API de OpenAI.
El equipo de AgentGPT ofrece una versión de demostración de su agente, aunque como versión gratuita solo se ejecutará unos dos minutos antes de finalizar.
Actualmente no hay una versión alojada de BabyAGI que haya podido encontrar.
Instalar Auto-GPT
Auto-GPT es una aplicación de línea de comandos y, en su estado actual, requiere algo de esfuerzo para configurarse. Puedes encontrar documentación detallada de instalación para empezar.
Esta guía asume que puedes acceder a un shell (como bash o zsh) y que tienes git y Python instalados.
Clona el repositorio de Auto-GPT
En la terminal, clona el repositorio de Auto-GPT.
git clone https://github.com/Significant-Gravitas/Auto-GPT.git
Ve al directorio Auto-GPT que se acaba de crear y cambia a la rama estable
cd Auto-GPT
git checkout stable
Obtén las claves de API
Auto-GPT requiere que tengas una clave de la API de OpenAI (para contactar con GPT). La cuenta gratuita solo permite hacer 3 llamadas por minuto, lo que es insuficiente para usar Auto-GPT, así que necesitarás una cuenta de pago. En nuestro tutorial Using GPT-3.5 and GPT-4 via the OpenAI API in Python tienes las instrucciones.
Opcionalmente puedes usar la API de Pinecone (para almacenamiento), la de ElevenLabs (para interfaz de voz), la de Google (para búsqueda) y la de Twitter (para promocionar lo que acabas de crear).
Configura Auto-GPT
Auto-GPT guarda todas las claves de API en un archivo de configuración llamado .env.
Ten en cuenta que guardar claves de API así, en texto plano, es una mala práctica de seguridad, por lo que deberías ejecutar Auto-GPT solo en un entorno seguro, como tu máquina local, o invalidar tus claves después de usarlas.
Haz una copia del archivo .env.template y llámala .env.
En un editor de texto, busca la línea que empieza por OPENAI_API_KEY= y añade tu clave de la API de OpenAI sin espacios ni comillas.
Añade cualquier clave adicional con el mismo formato clave=valor.
Ejecuta Auto-GPT
Auto-GPT se ejecuta mediante el script de shell run.sh (run.bat en Windows).
Para obtener ayuda sobre cómo usar este script, utiliza el argumento --help.
sh run.sh --help
Ten en cuenta que el script realiza muchas comprobaciones de versiones de paquetes de Python antes de mostrar los detalles de uso.
Para iniciar un asistente de Auto-GPT, simplemente ejecuta el mismo comando sin el argumento de ayuda.
sh run.sh
Tras las comprobaciones de paquetes, Auto-GPT te pedirá tres cosas
- Indica un nombre para tu asistente de IA.
- Describe el rol de tu IA.
- Proporciona hasta cinco objetivos para que el asistente los intente alcanzar.
Instalar AgentGPT
AgentGPT ofrece una breve guía de inicio en el README de su repositorio en GitHub.
Clona el repositorio de AgentGPT
En la terminal, clona el repositorio de AgentGPT.
git clone https://github.com/reworkd/AgentGPT.git
Ve al directorio AgentGPT que se acaba de crear.
cd AgentGPT
Ejecuta el script de configuración
Hay un script de bash para configurar el agente de IA.
bash setup.sh --local
Lo primero que se te pedirá será introducir tu clave de la API de OpenAI y pulsar ENTER.
Es posible que se te pida dar acceso a tus archivos del Escritorio y aceptar conexiones de red entrantes. Acéptalo.
Tras unos segundos, deberías ver un mensaje parecido a:
ready - started server on 0.0.0.0:3000, url: http://localhost:3000
Copia la URL y pégala en la barra de direcciones de tu navegador. AgentGPT se abrirá con un mensaje de bienvenida.

Lanza tu agente
Ponle un nombre y un objetivo a tu agente y haz clic en "Deploy Agent".

Instalar BabyAGI
BabyAGI cuenta con algo de documentación (muy mínima) en el README de su repositorio en GitHub.
Clona el repositorio de BabyAGI
En la terminal, clona el repositorio de BabyAGI.
git clone https://github.com/yoheinakajima/babyagi.git
Ve al directorio BabyAGI que se acaba de crear.
cd BabyAGI
Instala los paquetes de Python necesarios
Usa pip para instalar los paquetes necesarios para ejecutar BabyAGI.
pip install -r requirements.txt
Configura BabyAGI
Crea un archivo de configuración llamado .env.
cp .env.example .env
Edita el archivo de configuración. Puedes usar cualquier editor de texto en terminal; aquí usaremos vim.
vim .env
Pulsa i para insertar texto.
- En la línea que empieza por
OPENAI_API_KEY=añade tu clave de la API de OpenAI. - En la línea que empieza por
INSTANCE_NAME=puedes dar opcionalmente un nombre a tu agente de IA. - En la línea que empieza por
OBJECTIVE=indica un objetivo para tu agente de IA.
Ejecuta BabyAGI
Ejecuta el script de BabyAGI.
python3 babyagi.py
Ejemplo con Auto-GPT
Como prueba, llamé a mi asistente de IA «Jeff», lo describí como «un experto en ciencia de datos que escribe tutoriales sobre IA» y le di el objetivo de «escribir un tutorial sobre Auto-GPT».

Auto-GPT te pedirá regularmente permiso para realizar la siguiente tarea, ya sea buscar más información en internet o escribir un archivo. Pulsa «y» para dejar que continúe o aporta comentarios por escrito.
Tras unos minutos intentando redactar un tutorial, Auto-GPT produjo este archivo de tutorial.

No es un buen tutorial, ni siquiera correcto en los hechos, así que, como siempre al usar IA, debes ser muy preciso con tus requisitos en las indicaciones y prestar mucha atención a lo que hace la IA.
Llévalo al siguiente nivel
Agentes de IA como Auto-GPT, AgentGPT y BabyAGI suponen un salto importante en el ámbito de la IA y nos acercan a la visión de sistemas verdaderamente autónomos. Al trabajar hacia objetivos con una intervención humana mínima, abren un mundo de aplicaciones potenciales, desde asistentes personales hasta solucionadores de problemas.
Para mantenerte a la vanguardia en este entorno que cambia tan rápido, te animamos a ampliar tus conocimientos y habilidades en ciencia de datos, machine learning e IA. Echa un vistazo a estos recursos para seguir aprendiendo:
Curso de Introducción al ChatGPT
Empieza con ChatGPT
Richie ayuda a particulares y organizaciones a mejorar en el uso de los datos y la IA. Es científico de datos desde antes de que se llamara ciencia de datos, y ha escrito dos libros y creado muchos cursos DataCamp sobre el tema. Es presentador del podcast DataFramed, y dirige el programa de seminarios web de DataCamp.
FAQs
¿Cuál es la diferencia entre ChatGPT y agentes de IA como Auto-GPT?
ChatGPT está pensado para interacciones con una persona en el circuito, donde alguien introduce indicaciones y recibe respuestas. Los agentes de IA como Auto-GPT, en cambio, están diseñados para trabajar de forma autónoma hacia un objetivo definido, a menudo usando bucles, memoria y herramientas externas como navegadores web o ejecución de código para completar tareas con poca o ninguna intervención humana adicional.
¿Necesito saber programar para usar agentes de IA?
Por lo general, se necesita un entendimiento básico de herramientas de línea de comandos, Python y claves de API para instalar y ejecutar agentes de IA como Auto-GPT o BabyAGI. Algunas plataformas (como Hugging Face o God Mode) ofrecen interfaces más fáciles de usar, pero para aprovechar todo el potencial de estas herramientas a menudo hace falta configuración y puesta a punto manual.
¿Pueden los agentes de IA navegar por la web y acceder a datos en tiempo real?
Sí, algunos agentes de IA como Auto-GPT pueden acceder a internet mediante APIs como Google Search, lo que les permite recuperar datos en tiempo real. Sin embargo, esta función a veces se omite (p. ej., en AgentGPT y BabyAGI) por motivos de seguridad, coste o fiabilidad.





