En los últimos meses, los mundos de la ciencia de datos y la IA han estado revolucionados con la llegada de GPT-3, el nuevo modelo de lenguaje de OpenAI. Para muchos, este modelo supone un salto notable en la capacidad de un único algoritmo para razonar con lenguaje humano en una gran variedad de tareas.
Los desarrolladores que están probando GPT-3 han compartido casos de uso muy llamativos. Ejemplos como la generación automática de código a partir de instrucciones en inglés, respuestas a preguntas médicas o la traducción de lenguaje legal han despertado la imaginación de muchos data scientists que ya piensan en la próxima generación de software con IA.



Aunque gran parte del valor del machine learning a nivel organizativo está en los llamados quick wins, como predecir la fuga de clientes, hacer previsiones de ventas simples o segmentar clientes, merece la pena pensar qué supone la comercialización de GPT-3 para el futuro. Su potencial puede transformar cómo concebimos y operacionalizamos la inteligencia artificial.
Definir inteligencia artificial, machine learning y deep learning
El mundo empresarial y los medios están llenos de términos de moda como inteligencia artificial (IA), machine learning (ML) y deep learning (DL). Vamos a definirlos rápidamente antes de entrar en cómo funciona GPT-3.
Andrew Ng, cofundador de Google Brain y ex Chief Scientist en Baidu, describe la inteligencia artificial como un "conjunto enorme de herramientas para hacer que los ordenadores se comporten de forma inteligente". Esto abarca desde software programado explícitamente, como las calculadoras, hasta aplicaciones de ML como los sistemas de recomendación y los coches autónomos.
Según Arthur Samuel, pionero de la inteligencia artificial y los videojuegos, el machine learning es el "campo de estudio que da a los ordenadores la capacidad de aprender sin ser programados explícitamente". En general, existen dos tipos de algoritmos de machine learning. El primero es el aprendizaje supervisado, donde los algoritmos aprenden los patrones entre datos existentes (entradas) y etiquetas (salidas) y predicen la salida sobre datos no vistos, como estimar si un nuevo cliente abandonará en función del histórico de churn. El segundo es el aprendizaje no supervisado, donde los algoritmos descubren patrones generales en los datos y agrupan puntos de datos similares entre sí, por ejemplo al segmentar clientes según comportamientos comunes.
El deep learning es una forma de machine learning basada en redes neuronales artificiales con múltiples capas, inspiradas de forma laxa en las redes neuronales biológicas del cerebro. Puede ser supervisado o no supervisado y es, en gran medida, responsable de los casos de uso más conocidos de la última década en ML, como el reconocimiento de imágenes o el análisis de sentimiento. Los modelos de deep learning varían en arquitectura y complejidad según el número de capas y nodos de la red neuronal. Cuanto más complejo es un modelo, más parámetros tiene. Si quieres aprender más sobre cómo se construyen estos modelos, echa un vistazo al itinerario de aprendizaje de deep learning de DataCamp.
Para profundizar en estos temas, consulta nuestro e-book, The Definitive Guide to Machine Learning for Business Leaders.
Cómo funciona GPT-3
Entonces, ¿dónde se cruza GPT-3 con la inteligencia artificial, el machine learning y el deep learning? El acrónimo GPT significa "generative pre-trained transformer": un algoritmo de deep learning no supervisado que suele preentrenarse con grandes volúmenes de texto sin etiquetar. Luego se ajusta y entrena con un conjunto de datos grande y etiquetado para una tarea concreta (p. ej., traducción de inglés a francés) y, a partir de ahí, infiere el conjunto de salidas más probables (traducción al francés) para un conjunto de entradas determinado (palabras en inglés). Puedes imaginarlo como un autocompletado extremadamente sofisticado para diferentes tareas de lenguaje.
GPT-3 es la tercera iteración de este modelo y, aunque no innova sobre la arquitectura de sus predecesores, se preentrena con conjuntos de datos enormes que recogen gran parte de internet, incluido el dataset de Common Crawl, y añade muchas más capas en su arquitectura de red. Esto convierte a GPT-3 en el modelo de lenguaje más complejo concebido hasta la fecha, con 175.000 millones de parámetros en su arquitectura. Son diez veces más parámetros que el modelo más complejo anterior a GPT-3, Turing-NLG de Microsoft, y 117 veces más que GPT-2.
Lo más relevante es que GPT-3 se beneficia del few-shot learning, donde el modelo preentrenado no necesita ajustarse con grandes cantidades de datos etiquetados para una tarea específica. Basta con darle una descripción de la tarea —traducir palabras del inglés al francés— y unos pocos ejemplos de entradas y salidas. Unido a una interfaz plug and play muy sencilla, GPT-3 elimina gran parte de las barreras de entrada y permite que perfiles no expertos obtengan resultados útiles en distintas tareas de lenguaje.

Por qué GPT-3 es importante
Con solo unos pocos ejemplos y descripciones de tarea, GPT-3 compite con modelos de lenguaje ajustados finamente que han sido entrenados con datos específicos para multitud de tareas. GPT-3 también muestra cierto éxito en tareas que requieren razonamiento, como la aritmética, que no son estrictamente de lenguaje. Por ejemplo, GPT-3 alcanzó un 100% de acierto en sumas y restas de dos cifras tras proporcionarle unos pocos ejemplos. Modelos menos complejos, con menos parámetros, no han logrado superar el 60% en estas tareas. Aunque GPT-3 flojea en cálculos más complejos, esto sugiere que modelos más grandes podrían generalizar fuera del dominio en el que fueron entrenados.

Curiosamente, esto indica que seguir aumentando el tamaño de los datos y de los modelos puede aportar más mejoras. Por ahora no parece que el rendimiento agregado del modelo en distintas tareas se haya estancado con 175.000 millones de parámetros. Si mantuviéramos el mismo ritmo de escalado de parámetros que de GPT-2 a GPT-3, cabe preguntarse cómo evolucionaría el rendimiento si GPT-4 tuviera 117 veces más parámetros que GPT-3.

Aunque ahora mismo se está calibrando en una beta privada, empaquetar GPT-3 en una API plug and play significa que podría utilizarse a escala en cuanto salga de la beta. Como señaló la investigadora en IA Shreya Shankar, uno de los grandes retos será ofrecer esta API de forma eficiente y sencilla para que las organizaciones puedan usarla.

Qué significa para el futuro
Las tecnologías nuevas suelen seguir el ciclo de sobreexpectación de Gartner; de hecho, el CEO de OpenAI, Sam Altman, ya ha activado las alarmas sobre el hype en torno a GPT-3.

Ahora bien, los casos de uso que están compartiendo los desarrolladores de GPT-3 iluminan el tipo de aplicaciones con IA que podemos esperar a medio y largo plazo. Entre las posibles aplicaciones: herramientas que ayuden a los diseñadores a prototipar con facilidad, que agilicen el análisis de datos, que permitan investigaciones más sólidas, que automaticen la generación de contenidos para equipos de content marketing y mucho más.




Además, empaquetar el modelo en una interfaz plug and play sencilla podría cambiar la dinámica de cómo se instrumentaliza la IA en toda la organización. Por ejemplo, podría desincentivar a las empresas a desarrollar sus propios modelos internos y permitir que perfiles menos técnicos creen soluciones con GPT-3.
Por último, cuando pienses en desplegar sistemas de IA a escala, ten muy presente su capacidad para amplificar sesgos y generar daño. Como señalaron muchos investigadores al probar GPT-3, es relativamente fácil generar salidas nocivas que refuercen estereotipos y prejuicios a partir de entradas neutras.

Como cualquier algoritmo de machine learning desplegado a gran escala, GPT-3 requiere una supervisión y un control rigurosos para mitigar posibles daños.



