Curso
Todo proyecto de machine learning llega a un punto en el que hacen falta datos etiquetados, y etiquetarlos cuesta más tiempo y dinero del que la mayoría de equipos puede permitirse.
Contratar a un equipo para etiquetar un millón de imágenes o transcribir un millón de audios puede dispararse hasta seis cifras. Al mismo tiempo, Internet está lleno de texto, imágenes, audio y vídeo sin etiquetar. Los equipos de ML tienen más datos en bruto de los que jamás usarán, pero casi ninguno viene con las etiquetas necesarias para entrenar el modelo.
El aprendizaje autosupervisado elimina el paso de etiquetado. Convierte la propia estructura de los datos en información de entrenamiento. En lugar de pagar a personas para que indiquen qué hay en una imagen o qué significa una frase, planteas una tarea que los datos ya pueden responder por sí solos, como ocultar una palabra y hacer que el modelo la adivine a partir del contexto.
En este artículo, desglosaré cómo funciona el aprendizaje autosupervisado, repasaremos sus técnicas principales y veremos en qué se parece y en qué se diferencia del supervisado, el no supervisado y el semisupervisado.
¿Qué es el aprendizaje autosupervisado?
Es una forma de entrenar modelos sin que nadie etiquete los datos manualmente de antemano.
En lugar de que una persona etiquete cada ejemplo, los propios datos traen su "plantilla de respuestas". El modelo observa una parte de la entrada, oculta otra y aprende intentando rellenar ese hueco. No hace falta intervención humana.
Por ejemplo, tomas una frase, ocultas una palabra y pides al modelo que la adivine a partir de las palabras que la rodean. "La ingeniera hizo push del ___ a la rama principal" da al modelo suficiente contexto para apostar por "código" o "cambios" sin que nadie le diga la respuesta correcta. La propia frase hace de etiqueta.
El aprendizaje autosupervisado ocupa una posición peculiar entre dos categorías. Su objetivo de entrenamiento se parece al de aprendizaje supervisado: hay una entrada clara, un objetivo claro y una función de pérdida que mide el error. Pero como esos objetivos no los crea una persona, suele agruparse con el aprendizaje no supervisado, que también trabaja con datos en bruto sin etiquetar. El autosupervisado toma la mecánica de uno y la fuente de datos del otro.
¿Cómo funciona el aprendizaje autosupervisado?
El proceso sigue un patrón repetible, uses el tipo de datos que uses. Estos son los pasos:
- Empieza con datos sin etiquetar: Texto, imágenes, audio, vídeo... da igual, siempre que tengas mucho volumen.
- Crea una tarea de aprendizaje a partir de los propios datos: esto se llama tarea de pretexto. No es la tarea que de verdad te importa; es un problema artificial diseñado para forzar al modelo a aprender algo útil. Ocultar una palabra y predecirla es un ejemplo.
- Entrena el modelo para resolver esa tarea: el modelo hace una predicción, la contrasta con el valor real y se ajusta.
- Aprende representaciones útiles: al resolver la tarea de pretexto, el modelo construye una comprensión interna de la estructura de los datos (gramática, contexto, formas, patrones...).
- Adapta esas representaciones a tareas posteriores: cuando el modelo ya ha aprendido buenas representaciones, lo enfocas a la tarea que realmente querías resolver. Esta es la tarea downstream.
La tarea de pretexto es solo un ejercicio de entrenamiento. Nadie despliega un modelo para adivinar palabras ocultas por diversión: el valor está en las representaciones que aprende por el camino y que luego se transfieren a problemas reales.
Aprendizaje autosupervisado frente a otros métodos
La forma más sencilla de entenderlo es ver dónde se solapa y en qué difiere de otros paradigmas de entrenamiento.
Autosupervisado vs. supervisado
El aprendizaje supervisado necesita un ejemplo etiquetado por cada entrada, como una imagen marcada como "perro" o una reseña como "negativa". Alguien debe crear esas etiquetas a mano: supone coste, tiempo y limita cuántos datos puedes usar de forma realista.
Con el autosupervisado, el modelo sigue teniendo un objetivo que predecir, pero ese objetivo sale de los propios datos: una palabra oculta o el siguiente token de una secuencia. No hace falta anotación humana para generar la señal de entrenamiento.
Autosupervisado vs. no supervisado
Ambos trabajan con datos sin etiquetar, por eso suelen confundirse. La diferencia está en el objetivo.
El aprendizaje no supervisado busca estructura sin un objetivo de predicción concreto, como agrupar clientes similares o reducir la dimensionalidad. El autosupervisado construye una tarea de predicción explícita a partir de los datos y entrena el modelo para resolverla. Ese objetivo de predicción le da un bucle de entrenamiento al estilo supervisado, aunque las etiquetas se generen solas.
Autosupervisado vs. semisupervisado
El aprendizaje semisupervisado mezcla deliberadamente un conjunto pequeño de datos etiquetados con otro mayor sin etiquetar, usando ambos a la vez para mejorar el modelo.
El preentrenamiento autosupervisado no necesita ninguna etiqueta para empezar. Puede preentrenar íntegramente con datos sin etiquetar y, opcionalmente, pasar después a un conjunto etiquetado para el ajuste fino. Si aparecen etiquetas, es tras el preentrenamiento.
| ¿Se necesitan etiquetas? | Fuente de la señal de aprendizaje | Uso habitual | |
|---|---|---|---|
| Supervisado | Sí, para cada ejemplo | Etiquetas creadas por personas | Entrenar un modelo directamente en la tarea objetivo |
| No supervisado | No | Estructura en los datos (clústeres, patrones) | Agrupación, reducción de dimensionalidad |
| Semisupervisado | Algunas, mezcladas con datos sin etiquetar | Ejemplos etiquetados más patrones en datos sin etiquetar | Mejorar la precisión cuando hay pocas etiquetas |
| Autosupervisado | No, para el preentrenamiento | Una tarea de pretexto construida a partir de los datos | Preentrenar antes de ajustar a una tarea downstream |
Aprendizaje autosupervisado comparado con otros métodos
Tipos de aprendizaje autosupervisado
Los métodos autosupervisados caen en varias familias amplias, cada una alrededor de un tipo distinto de tarea de pretexto.
Aprendizaje contrastivo
El aprendizaje contrastivo entrena a un modelo para distinguir ejemplos relacionados de los no relacionados. Acerca las representaciones de ejemplos similares y aleja las de ejemplos distintos, sin usar nunca una etiqueta manual para definir "similar".
Dos versiones aumentadas de la misma imagen cuentan como relacionadas. Una imagen y su pie correspondiente también. SimCLR aplica esta idea dentro de una sola modalidad, comparando recortes o transformaciones de la misma imagen. CLIP la aplica entre modalidades, alineando imágenes con el texto que las describe.
Modelado enmascarado
El modelado enmascarado oculta parte de la entrada y entrena al modelo para reconstruirla. Es la misma idea del "rellena el hueco" llevada más lejos.
En lenguaje, aparece como enmascaramiento de palabras: ocultas varias en una frase y las predices con el contexto de ambos lados. En visión, como enmascaramiento de imagen: ocultas parches y pides al modelo reconstruir los píxeles que faltan o su representación subyacente.
Aprendizaje autorregresivo
El aprendizaje autorregresivo predice el siguiente elemento de una secuencia usando todo lo anterior. Dado el inicio de una frase, predice la siguiente palabra; luego la siguiente, y así sucesivamente.
Es el objetivo detrás del preentrenamiento de la mayoría de modelos de lenguaje modernos. Encaja de forma natural con el texto y escala bien a corpus enormes sin preparación extra.
Autodestilación
La autodestilación entrena un modelo usando sus propias predicciones como objetivo, en lugar de una respuesta fija oculta en los datos.
Un planteamiento común ejecuta dos versiones de la misma red —"estudiante" y "profesor"— sobre vistas distintas de la misma entrada. El estudiante aprende a igualar la salida del profesor, y el profesor se actualiza como una media móvil lenta del estudiante. DINO y BYOL son enfoques representativos. No hacen falta ejemplos negativos ni entradas enmascaradas: el modelo se auto-supervisa a partir de la consistencia entre vistas.
Aprendizaje autosupervisado en grandes modelos de lenguaje
La autosupervisión sustenta todo el preentrenamiento de los grandes modelos de lenguaje. Todos los LLM que usas han aprendido estructura del lenguaje, hechos y patrones de razonamiento sin una sola etiqueta escrita por una persona, resolviendo tareas de pretexto autosupervisadas sobre texto en bruto.
Predicción del siguiente token
La mayoría de LLM modernos se preentrena prediciendo el siguiente token: dada una secuencia de tokens, adivinar el que viene a continuación. El modelo lee todo lo anterior a una posición, apuesta por lo que sigue, se contrasta con el token real y se ajusta.
Si ejecutas esto sobre billones de tokens extraídos de webs y repositorios de código, el modelo acaba construyendo una noción funcional de gramática, hechos e incluso patrones de razonamiento. Es el mismo objetivo autorregresivo de antes, llevado a gran escala.
Enmascaramiento de lenguaje
Antes de que se impusiera el preentrenamiento autorregresivo, modelos como BERT usaban otra tarea de pretexto. En lugar de predecir lo siguiente, BERT oculta tokens aleatorios en una frase y los predice usando el contexto bidireccional.
Ese contexto bidireccional hace que los modelos enmascarados destaquen en tareas de comprensión como clasificación o QA, aunque no generen texto como lo hacen los de siguiente token.
Aprender de grandes corpus de texto
Nada de esto funciona sin volumen. El preentrenamiento toma datos de páginas web, libros, repositorios de código y foros, filtrados y deduplicados en corpus con miles de millones o billones de tokens. Cuanto más grande y variado el corpus, más generales son las representaciones resultantes.
El preentrenamiento es donde la autosupervisión hace su trabajo, pero no es la última etapa. El ajuste fino con instrucciones escritas por personas enseña a seguir indicaciones, y métodos de optimización por preferencias como RLHF o DPO usan preferencias humanas clasificadas para moldear respuestas. Ambas fases posteriores sí necesitan datos etiquetados. El preentrenamiento autosupervisado es la única etapa que no.
Aprendizaje autosupervisado en visión por computador
La visión por computador es el ejemplo perfecto de área con pocas etiquetas. Dibujar bounding boxes y máscaras de segmentación lleva mucho más que poner una etiqueta a un texto, por lo que los métodos autosupervisados han sido especialmente valiosos aquí.
El aprendizaje contrastivo con imágenes aplica la misma idea de acercar y alejar: tomas dos versiones aumentadas de la misma foto (un recorte, un giro) y entrenas al modelo para reconocerlas como relacionadas, tratando el resto de imágenes del lote como no relacionadas. SimCLR es un ejemplo conocido de este enfoque en imágenes.
El modelado enmascarado de imágenes toma la idea del lenguaje y la aplica a los píxeles: ocultar parches de una imagen y entrenar al modelo para reconstruir el contenido que falta, ya sea como píxeles brutos o como representación de características. Este es el objetivo de MAE (Masked Autoencoders).
La alineación imagen-texto entrena un modelo para casar imágenes con los pies que las describen, acercando en un espacio de embeddings las parejas que encajan y separando las que no. CLIP es el ejemplo más conocido, y explica por qué modelos entrenados así permiten clasificación zero-shot: reconocen categorías en las que nunca se entrenaron explícitamente, comparando la imagen con una descripción en texto.
Más allá de texto e imágenes
La tarea de pretexto siempre sigue la forma de los datos, así que donde haya muchos datos sin etiquetar, normalmente puedes diseñar una tarea autosupervisada alrededor de ellos.
En voz y audio, los modelos predicen segmentos de audio enmascarados o contrastan distintos clips del mismo modo que visión contrasta recortes de imagen, aprendiendo representaciones útiles para tareas como reconocimiento de voz sin necesitar transcripciones de partida.
En vídeo, la tarea puede consistir en predecir fotogramas futuros o emparejar clips del mismo vídeo de origen, dando al modelo una noción de movimiento y estructura temporal que una sola imagen no aporta.
Los modelos multimodales combinan dos o más de estas ideas a la vez, alineando texto, imágenes, audio y vídeo dentro de un espacio de representación compartido, similar a cómo CLIP alinea imágenes y texto, pero extendido a más tipos de datos.
La autosupervisión aparece incluso en datos científicos y de sensores —como secuencias genómicas o series temporales— donde enmascarar o predecir partes de la señal permite aprender estructura a partir de medidas que nunca se pensaron para estar "etiquetadas".
Cómo se usan los modelos autosupervisados aguas abajo
El preentrenamiento produce un modelo bueno resolviendo una tarea de pretexto. Eso, en sí, no le importa a nadie; lo importante es lo que haces después.
Ajuste fino
El ajuste fino toma el modelo preentrenado y sigue entrenando todos sus pesos, ahora con datos etiquetados de la tarea real. Como el modelo ya entiende la estructura del dominio, suele necesitar muchas menos etiquetas que entrenando desde cero.
Sondeo lineal
El sondeo lineal congela por completo el modelo preentrenado y entrena solo una capa lineal encima de su salida. Si un clasificador lineal sencillo separa clases con esas características congeladas, las representaciones preentrenadas capturaron estructura real. Es una forma común de evaluar la calidad de las representaciones por sí mismas.
Extracción de características
Funciona igual que el sondeo lineal, pero sin la parte lineal. Tomas las representaciones congeladas y las envías al algoritmo downstream que quieras. El papel del modelo preentrenado es generar buenos embeddings; lo de después ya es cosa tuya.
Uso zero-shot y few-shot
Algunas representaciones son tan buenas que puedes usarlas sin entrenamiento adicional. CLIP lo hace incrustando una imagen y un conjunto de etiquetas de texto candidatas en el mismo espacio y eligiendo la etiqueta más cercana. El few-shot learning parte de la misma idea y añade un puñado de ejemplos etiquetados, que suele bastar porque las representaciones ya llevan la mayor parte de la estructura necesaria.
Con el aprendizaje autosupervisado obtienes representaciones reutilizables. Preentrenas una vez y luego ajustas, sondeas, extraes características o consultas ese mismo núcleo en tantas tareas downstream como necesites. La parte costosa sucede una sola vez durante el preentrenamiento, no una por tarea.
Aprendizaje autosupervisado en Python
Aquí tienes un ejemplo ligero usando un modelo preentrenado, no un sistema autosupervisado construido desde cero, para que veas el flujo de trabajo.
all-MiniLM-L6-v2, disponible a través del paquete sentence-transformers, se preentrenó con un objetivo de modelado de lenguaje enmascarado y después se entrenó más con un objetivo contrastivo en pares de frases. Esa es la parte autosupervisada ya hecha por ti: tú solo aprovechas las representaciones resultantes.
Para empezar, instala las dependencias:
pip install sentence-transformers scikit-learn
Ahora, el código:
from sentence_transformers import SentenceTransformer
from sklearn.linear_model import LogisticRegression
# Create unlabeled data
support_tickets = [
"My order arrived damaged and I need a replacement.",
"The app crashes every time I try to upload a photo.",
"I love how fast the checkout process is now.",
"Can you tell me when my refund will be processed?",
"The new dashboard layout is so much easier to use.",
"I can't log in, it keeps saying my password is wrong.",
]
# Load a model pretrained with a self-supervised objective
model = SentenceTransformer("all-MiniLM-L6-v2")
# Obtain learned representations
embeddings = model.encode(support_tickets)
print(embeddings.shape)

Forma de los embeddings
El método .encode() procesa cada ticket con el modelo preentrenado y devuelve un vector denso que representa su significado. A partir de ahí, una tarea downstream solo necesita unos pocos ejemplos etiquetados, ya que los embeddings ya capturan la mayor parte de la estructura:
# Use the representations for a downstream task, 1 = complaint, 0 = positive feedback
labels = [1, 1, 0, 1, 0, 1]
clf = LogisticRegression()
clf.fit(embeddings, labels)
new_ticket = ["The delivery was late and no one responded to my email."]
new_embedding = model.encode(new_ticket)
print(clf.predict(new_embedding))

Predicción con regresión logística
Seis tickets etiquetados y un clasificador LogisticRegression bastan aquí porque son las representaciones, no el clasificador, las que hacen la mayor parte del trabajo.
Ventajas y limitaciones del aprendizaje autosupervisado
Repasemos ahora sus pros y contras.
Ventajas
- Reduce la dependencia de datos etiquetados manualmente: la tarea de pretexto genera sus propios objetivos, así que el presupuesto de etiquetado deja de ser el límite duro del volumen de entrenamiento.
- Aprovecha conjuntos de datos muy grandes: colecciones a escala web de texto y audio pasan a ser útiles para entrenar, no solo los pequeños subconjuntos etiquetados que un equipo puede anotar.
- Genera representaciones transferibles: un único modelo preentrenado puede servir para ajuste fino, sondeo lineal, extracción de características y uso zero-shot en varias tareas downstream.
- Permite el preentrenamiento a gran escala: es lo que hace posibles los modelos base actuales.
Limitaciones
- Altos requisitos de cómputo: preentrenar con datos a escala Internet requiere hardware y tiempo serios, fuera del alcance de la mayoría de equipos.
- El diseño de la tarea de pretexto importa: una tarea mal elegida produce representaciones que no transfieren bien, por muchos datos que uses.
- Las representaciones aprendidas pueden heredar sesgos: los patrones, carencias o sesgos del entrenamiento afloran en las representaciones, ya que nada los filtra durante el preentrenamiento.
- Un gran rendimiento en preentrenamiento no garantiza el éxito downstream: un modelo que resuelve bien su tarea de pretexto puede rendir por debajo en una tarea específica para la que no se optimizó directamente.
Por qué el autosupervisado es clave en la IA moderna
El aprendizaje autosupervisado es la razón por la que los modelos base son posibles.
El preentrenamiento a la escala que requieren los modelos modernos sería inviable si dependiera de etiquetas manuales. Nadie etiqueta a mano un billón de tokens de texto o mil millones de imágenes. La autosupervisión hizo práctico el preentrenamiento con colecciones a escala Internet y reutilizar ese único modelo en un amplio abanico de tareas downstream en lugar de entrenar uno por cada tarea.
Ese cambio de muchos modelos específicos de tarea a un único modelo general preentrenado adaptado a muchos usos es la dirección en la que se ha movido gran parte de la IA moderna. El aprendizaje autosupervisado es el mecanismo que lo ha hecho posible.
Conclusión
El aprendizaje autosupervisado obtiene su supervisión de la estructura de los datos sin etiquetar, en lugar de etiquetas escritas por una persona. El patrón típico es ocultar una palabra o predecir el siguiente token. Los datos se responden a sí mismos y el modelo aprende intentando acertar.
Los enfoques principales se apoyan en esa misma idea de formas distintas. El aprendizaje contrastivo acerca ejemplos relacionados y aleja los no relacionados. El modelado enmascarado oculta parte de la entrada y entrena al modelo para reconstruirla. El aprendizaje autorregresivo predice el siguiente elemento de una secuencia con todo lo anterior. La mecánica cambia, pero el principio —dejar que la estructura de los datos aporte la señal de entrenamiento— es el mismo.
Ese principio está detrás de la mayoría de modelos de lenguaje, visión y multimodales que ya usas. La predicción del siguiente token preentrena los LLM actuales; los objetivos contrastivos y enmascarados preentrenan los modelos de visión; y la alineación imagen-texto preentrena los modelos multimodales que conectan ambos mundos.
Si quieres aprender a crear un LLM desde cero, apúntate a nuestro itinerario Developing Large Language Models para ver PyTorch, Hugging Face y las últimas técnicas de NLP en acción.
FAQs
¿Qué es el aprendizaje autosupervisado?
El aprendizaje autosupervisado es una forma de entrenar modelos sin etiquetas creadas por personas. El modelo observa una parte de la entrada, oculta otra y aprende intentando predecir la parte que falta. Los datos aportan su propia señal de entrenamiento, de ahí lo de "autosupervisado".
¿En qué se diferencia del aprendizaje no supervisado?
Ambos trabajan con datos sin etiquetar, pero los abordan de forma distinta. El no supervisado busca estructura sin un objetivo de predicción concreto, como agrupar clientes similares. El autosupervisado construye una tarea de predicción explícita a partir de los propios datos y entrena el modelo para resolverla.
¿Por qué importa para la IA moderna?
Es la razón por la que los modelos base son posibles. Preentrenar a la escala actual sería inalcanzable si dependiera de etiquetas manuales: nadie etiqueta a mano un billón de tokens. La autosupervisión permite reutilizar un único modelo preentrenado en varias tareas downstream en lugar de entrenar uno por cada tarea.
¿Diferencia entre tarea de pretexto y tarea downstream?
Una tarea de pretexto es el problema artificial que el modelo resuelve durante el preentrenamiento, como predecir una palabra oculta. No es la tarea que te importa; solo fuerza al modelo a aprender representaciones útiles. Una tarea downstream es el problema real al que aplicas después esas representaciones, como clasificación o búsqueda.
¿Puede funcionar con cero datos etiquetados?
Sí, el preentrenamiento en sí no necesita ninguna etiqueta. Una vez que el modelo ha aprendido representaciones, algunos usos downstream, como la clasificación zero-shot de CLIP, siguen sin requerir etiquetas. Otros, como el ajuste fino o el few-shot, incorporan una pequeña cantidad de etiquetas solo en esa fase posterior.



