Ir al contenido principal

Aprendizaje autosupervisado: cómo aprenden los modelos sin datos etiquetados

El aprendizaje autosupervisado entrena modelos para obtener su propia supervisión de texto, imágenes, audio y vídeo sin etiquetar, con técnicas como el aprendizaje contrastivo, el modelado enmascarado y la predicción autorregresiva que dan forma a las representaciones detrás de los modelos de lenguaje, visión y multimodales actuales.
Actualizado 9 sept 2026  · 14 min leer

Explorar con IA

ChatGPTClaudePerplexity

Todo proyecto de machine learning llega a un punto en el que hacen falta datos etiquetados, y etiquetarlos cuesta más tiempo y dinero del que la mayoría de equipos puede permitirse.

Contratar a un equipo para etiquetar un millón de imágenes o transcribir un millón de audios puede dispararse hasta seis cifras. Al mismo tiempo, Internet está lleno de texto, imágenes, audio y vídeo sin etiquetar. Los equipos de ML tienen más datos en bruto de los que jamás usarán, pero casi ninguno viene con las etiquetas necesarias para entrenar el modelo.

El aprendizaje autosupervisado elimina el paso de etiquetado. Convierte la propia estructura de los datos en información de entrenamiento. En lugar de pagar a personas para que indiquen qué hay en una imagen o qué significa una frase, planteas una tarea que los datos ya pueden responder por sí solos, como ocultar una palabra y hacer que el modelo la adivine a partir del contexto.

En este artículo, desglosaré cómo funciona el aprendizaje autosupervisado, repasaremos sus técnicas principales y veremos en qué se parece y en qué se diferencia del supervisado, el no supervisado y el semisupervisado.

¿Qué es el aprendizaje autosupervisado?

Es una forma de entrenar modelos sin que nadie etiquete los datos manualmente de antemano.

En lugar de que una persona etiquete cada ejemplo, los propios datos traen su "plantilla de respuestas". El modelo observa una parte de la entrada, oculta otra y aprende intentando rellenar ese hueco. No hace falta intervención humana.

Por ejemplo, tomas una frase, ocultas una palabra y pides al modelo que la adivine a partir de las palabras que la rodean. "La ingeniera hizo push del ___ a la rama principal" da al modelo suficiente contexto para apostar por "código" o "cambios" sin que nadie le diga la respuesta correcta. La propia frase hace de etiqueta.

El aprendizaje autosupervisado ocupa una posición peculiar entre dos categorías. Su objetivo de entrenamiento se parece al de aprendizaje supervisado: hay una entrada clara, un objetivo claro y una función de pérdida que mide el error. Pero como esos objetivos no los crea una persona, suele agruparse con el aprendizaje no supervisado, que también trabaja con datos en bruto sin etiquetar. El autosupervisado toma la mecánica de uno y la fuente de datos del otro.

¿Cómo funciona el aprendizaje autosupervisado?

El proceso sigue un patrón repetible, uses el tipo de datos que uses. Estos son los pasos:

  1. Empieza con datos sin etiquetar: Texto, imágenes, audio, vídeo... da igual, siempre que tengas mucho volumen.
  2. Crea una tarea de aprendizaje a partir de los propios datos: esto se llama tarea de pretexto. No es la tarea que de verdad te importa; es un problema artificial diseñado para forzar al modelo a aprender algo útil. Ocultar una palabra y predecirla es un ejemplo.
  3. Entrena el modelo para resolver esa tarea: el modelo hace una predicción, la contrasta con el valor real y se ajusta.
  4. Aprende representaciones útiles: al resolver la tarea de pretexto, el modelo construye una comprensión interna de la estructura de los datos (gramática, contexto, formas, patrones...).
  5. Adapta esas representaciones a tareas posteriores: cuando el modelo ya ha aprendido buenas representaciones, lo enfocas a la tarea que realmente querías resolver. Esta es la tarea downstream.

La tarea de pretexto es solo un ejercicio de entrenamiento. Nadie despliega un modelo para adivinar palabras ocultas por diversión: el valor está en las representaciones que aprende por el camino y que luego se transfieren a problemas reales.

Aprendizaje autosupervisado frente a otros métodos

La forma más sencilla de entenderlo es ver dónde se solapa y en qué difiere de otros paradigmas de entrenamiento.

Autosupervisado vs. supervisado

El aprendizaje supervisado necesita un ejemplo etiquetado por cada entrada, como una imagen marcada como "perro" o una reseña como "negativa". Alguien debe crear esas etiquetas a mano: supone coste, tiempo y limita cuántos datos puedes usar de forma realista.

Con el autosupervisado, el modelo sigue teniendo un objetivo que predecir, pero ese objetivo sale de los propios datos: una palabra oculta o el siguiente token de una secuencia. No hace falta anotación humana para generar la señal de entrenamiento.

Autosupervisado vs. no supervisado

Ambos trabajan con datos sin etiquetar, por eso suelen confundirse. La diferencia está en el objetivo.

El aprendizaje no supervisado busca estructura sin un objetivo de predicción concreto, como agrupar clientes similares o reducir la dimensionalidad. El autosupervisado construye una tarea de predicción explícita a partir de los datos y entrena el modelo para resolverla. Ese objetivo de predicción le da un bucle de entrenamiento al estilo supervisado, aunque las etiquetas se generen solas.

Autosupervisado vs. semisupervisado

El aprendizaje semisupervisado mezcla deliberadamente un conjunto pequeño de datos etiquetados con otro mayor sin etiquetar, usando ambos a la vez para mejorar el modelo.

El preentrenamiento autosupervisado no necesita ninguna etiqueta para empezar. Puede preentrenar íntegramente con datos sin etiquetar y, opcionalmente, pasar después a un conjunto etiquetado para el ajuste fino. Si aparecen etiquetas, es tras el preentrenamiento.

  ¿Se necesitan etiquetas? Fuente de la señal de aprendizaje Uso habitual
Supervisado Sí, para cada ejemplo Etiquetas creadas por personas Entrenar un modelo directamente en la tarea objetivo
No supervisado No Estructura en los datos (clústeres, patrones) Agrupación, reducción de dimensionalidad
Semisupervisado Algunas, mezcladas con datos sin etiquetar Ejemplos etiquetados más patrones en datos sin etiquetar Mejorar la precisión cuando hay pocas etiquetas
Autosupervisado No, para el preentrenamiento Una tarea de pretexto construida a partir de los datos Preentrenar antes de ajustar a una tarea downstream

Aprendizaje autosupervisado comparado con otros métodos

Tipos de aprendizaje autosupervisado

Los métodos autosupervisados caen en varias familias amplias, cada una alrededor de un tipo distinto de tarea de pretexto.

Aprendizaje contrastivo

El aprendizaje contrastivo entrena a un modelo para distinguir ejemplos relacionados de los no relacionados. Acerca las representaciones de ejemplos similares y aleja las de ejemplos distintos, sin usar nunca una etiqueta manual para definir "similar".

Dos versiones aumentadas de la misma imagen cuentan como relacionadas. Una imagen y su pie correspondiente también. SimCLR aplica esta idea dentro de una sola modalidad, comparando recortes o transformaciones de la misma imagen. CLIP la aplica entre modalidades, alineando imágenes con el texto que las describe.

Modelado enmascarado

El modelado enmascarado oculta parte de la entrada y entrena al modelo para reconstruirla. Es la misma idea del "rellena el hueco" llevada más lejos.

En lenguaje, aparece como enmascaramiento de palabras: ocultas varias en una frase y las predices con el contexto de ambos lados. En visión, como enmascaramiento de imagen: ocultas parches y pides al modelo reconstruir los píxeles que faltan o su representación subyacente.

Aprendizaje autorregresivo

El aprendizaje autorregresivo predice el siguiente elemento de una secuencia usando todo lo anterior. Dado el inicio de una frase, predice la siguiente palabra; luego la siguiente, y así sucesivamente.

Es el objetivo detrás del preentrenamiento de la mayoría de modelos de lenguaje modernos. Encaja de forma natural con el texto y escala bien a corpus enormes sin preparación extra.

Autodestilación

La autodestilación entrena un modelo usando sus propias predicciones como objetivo, en lugar de una respuesta fija oculta en los datos.

Un planteamiento común ejecuta dos versiones de la misma red —"estudiante" y "profesor"— sobre vistas distintas de la misma entrada. El estudiante aprende a igualar la salida del profesor, y el profesor se actualiza como una media móvil lenta del estudiante. DINO y BYOL son enfoques representativos. No hacen falta ejemplos negativos ni entradas enmascaradas: el modelo se auto-supervisa a partir de la consistencia entre vistas.

Aprendizaje autosupervisado en grandes modelos de lenguaje

La autosupervisión sustenta todo el preentrenamiento de los grandes modelos de lenguaje. Todos los LLM que usas han aprendido estructura del lenguaje, hechos y patrones de razonamiento sin una sola etiqueta escrita por una persona, resolviendo tareas de pretexto autosupervisadas sobre texto en bruto.

Predicción del siguiente token

La mayoría de LLM modernos se preentrena prediciendo el siguiente token: dada una secuencia de tokens, adivinar el que viene a continuación. El modelo lee todo lo anterior a una posición, apuesta por lo que sigue, se contrasta con el token real y se ajusta.

Si ejecutas esto sobre billones de tokens extraídos de webs y repositorios de código, el modelo acaba construyendo una noción funcional de gramática, hechos e incluso patrones de razonamiento. Es el mismo objetivo autorregresivo de antes, llevado a gran escala.

Enmascaramiento de lenguaje

Antes de que se impusiera el preentrenamiento autorregresivo, modelos como BERT usaban otra tarea de pretexto. En lugar de predecir lo siguiente, BERT oculta tokens aleatorios en una frase y los predice usando el contexto bidireccional.

Ese contexto bidireccional hace que los modelos enmascarados destaquen en tareas de comprensión como clasificación o QA, aunque no generen texto como lo hacen los de siguiente token.

Aprender de grandes corpus de texto

Nada de esto funciona sin volumen. El preentrenamiento toma datos de páginas web, libros, repositorios de código y foros, filtrados y deduplicados en corpus con miles de millones o billones de tokens. Cuanto más grande y variado el corpus, más generales son las representaciones resultantes.

El preentrenamiento es donde la autosupervisión hace su trabajo, pero no es la última etapa. El ajuste fino con instrucciones escritas por personas enseña a seguir indicaciones, y métodos de optimización por preferencias como RLHF o DPO usan preferencias humanas clasificadas para moldear respuestas. Ambas fases posteriores sí necesitan datos etiquetados. El preentrenamiento autosupervisado es la única etapa que no.

Aprendizaje autosupervisado en visión por computador

La visión por computador es el ejemplo perfecto de área con pocas etiquetas. Dibujar bounding boxes y máscaras de segmentación lleva mucho más que poner una etiqueta a un texto, por lo que los métodos autosupervisados han sido especialmente valiosos aquí.

El aprendizaje contrastivo con imágenes aplica la misma idea de acercar y alejar: tomas dos versiones aumentadas de la misma foto (un recorte, un giro) y entrenas al modelo para reconocerlas como relacionadas, tratando el resto de imágenes del lote como no relacionadas. SimCLR es un ejemplo conocido de este enfoque en imágenes.

El modelado enmascarado de imágenes toma la idea del lenguaje y la aplica a los píxeles: ocultar parches de una imagen y entrenar al modelo para reconstruir el contenido que falta, ya sea como píxeles brutos o como representación de características. Este es el objetivo de MAE (Masked Autoencoders).

La alineación imagen-texto entrena un modelo para casar imágenes con los pies que las describen, acercando en un espacio de embeddings las parejas que encajan y separando las que no. CLIP es el ejemplo más conocido, y explica por qué modelos entrenados así permiten clasificación zero-shot: reconocen categorías en las que nunca se entrenaron explícitamente, comparando la imagen con una descripción en texto.

Más allá de texto e imágenes

La tarea de pretexto siempre sigue la forma de los datos, así que donde haya muchos datos sin etiquetar, normalmente puedes diseñar una tarea autosupervisada alrededor de ellos.

En voz y audio, los modelos predicen segmentos de audio enmascarados o contrastan distintos clips del mismo modo que visión contrasta recortes de imagen, aprendiendo representaciones útiles para tareas como reconocimiento de voz sin necesitar transcripciones de partida.

En vídeo, la tarea puede consistir en predecir fotogramas futuros o emparejar clips del mismo vídeo de origen, dando al modelo una noción de movimiento y estructura temporal que una sola imagen no aporta.

Los modelos multimodales combinan dos o más de estas ideas a la vez, alineando texto, imágenes, audio y vídeo dentro de un espacio de representación compartido, similar a cómo CLIP alinea imágenes y texto, pero extendido a más tipos de datos.

La autosupervisión aparece incluso en datos científicos y de sensores —como secuencias genómicas o series temporales— donde enmascarar o predecir partes de la señal permite aprender estructura a partir de medidas que nunca se pensaron para estar "etiquetadas".

Cómo se usan los modelos autosupervisados aguas abajo

El preentrenamiento produce un modelo bueno resolviendo una tarea de pretexto. Eso, en sí, no le importa a nadie; lo importante es lo que haces después.

Ajuste fino

El ajuste fino toma el modelo preentrenado y sigue entrenando todos sus pesos, ahora con datos etiquetados de la tarea real. Como el modelo ya entiende la estructura del dominio, suele necesitar muchas menos etiquetas que entrenando desde cero.

Sondeo lineal

El sondeo lineal congela por completo el modelo preentrenado y entrena solo una capa lineal encima de su salida. Si un clasificador lineal sencillo separa clases con esas características congeladas, las representaciones preentrenadas capturaron estructura real. Es una forma común de evaluar la calidad de las representaciones por sí mismas.

Extracción de características

Funciona igual que el sondeo lineal, pero sin la parte lineal. Tomas las representaciones congeladas y las envías al algoritmo downstream que quieras. El papel del modelo preentrenado es generar buenos embeddings; lo de después ya es cosa tuya.

Uso zero-shot y few-shot

Algunas representaciones son tan buenas que puedes usarlas sin entrenamiento adicional. CLIP lo hace incrustando una imagen y un conjunto de etiquetas de texto candidatas en el mismo espacio y eligiendo la etiqueta más cercana. El few-shot learning parte de la misma idea y añade un puñado de ejemplos etiquetados, que suele bastar porque las representaciones ya llevan la mayor parte de la estructura necesaria.

Con el aprendizaje autosupervisado obtienes representaciones reutilizables. Preentrenas una vez y luego ajustas, sondeas, extraes características o consultas ese mismo núcleo en tantas tareas downstream como necesites. La parte costosa sucede una sola vez durante el preentrenamiento, no una por tarea.

Aprendizaje autosupervisado en Python

Aquí tienes un ejemplo ligero usando un modelo preentrenado, no un sistema autosupervisado construido desde cero, para que veas el flujo de trabajo.

all-MiniLM-L6-v2, disponible a través del paquete sentence-transformers, se preentrenó con un objetivo de modelado de lenguaje enmascarado y después se entrenó más con un objetivo contrastivo en pares de frases. Esa es la parte autosupervisada ya hecha por ti: tú solo aprovechas las representaciones resultantes.

Para empezar, instala las dependencias:

pip install sentence-transformers scikit-learn

Ahora, el código:

from sentence_transformers import SentenceTransformer
from sklearn.linear_model import LogisticRegression

# Create unlabeled data
support_tickets = [
    "My order arrived damaged and I need a replacement.",
    "The app crashes every time I try to upload a photo.",
    "I love how fast the checkout process is now.",
    "Can you tell me when my refund will be processed?",
    "The new dashboard layout is so much easier to use.",
    "I can't log in, it keeps saying my password is wrong.",
]

# Load a model pretrained with a self-supervised objective
model = SentenceTransformer("all-MiniLM-L6-v2")

# Obtain learned representations
embeddings = model.encode(support_tickets)
print(embeddings.shape)

Forma de los embeddings

Forma de los embeddings

El método .encode() procesa cada ticket con el modelo preentrenado y devuelve un vector denso que representa su significado. A partir de ahí, una tarea downstream solo necesita unos pocos ejemplos etiquetados, ya que los embeddings ya capturan la mayor parte de la estructura:

# Use the representations for a downstream task, 1 = complaint, 0 = positive feedback
labels = [1, 1, 0, 1, 0, 1]

clf = LogisticRegression()
clf.fit(embeddings, labels)

new_ticket = ["The delivery was late and no one responded to my email."]
new_embedding = model.encode(new_ticket)
print(clf.predict(new_embedding))

Predicción con regresión logística

Predicción con regresión logística

Seis tickets etiquetados y un clasificador LogisticRegression bastan aquí porque son las representaciones, no el clasificador, las que hacen la mayor parte del trabajo.

Ventajas y limitaciones del aprendizaje autosupervisado

Repasemos ahora sus pros y contras.

Ventajas

  1. Reduce la dependencia de datos etiquetados manualmente: la tarea de pretexto genera sus propios objetivos, así que el presupuesto de etiquetado deja de ser el límite duro del volumen de entrenamiento.
  2. Aprovecha conjuntos de datos muy grandes: colecciones a escala web de texto y audio pasan a ser útiles para entrenar, no solo los pequeños subconjuntos etiquetados que un equipo puede anotar.
  3. Genera representaciones transferibles: un único modelo preentrenado puede servir para ajuste fino, sondeo lineal, extracción de características y uso zero-shot en varias tareas downstream.
  4. Permite el preentrenamiento a gran escala: es lo que hace posibles los modelos base actuales.

Limitaciones

  1. Altos requisitos de cómputo: preentrenar con datos a escala Internet requiere hardware y tiempo serios, fuera del alcance de la mayoría de equipos.
  2. El diseño de la tarea de pretexto importa: una tarea mal elegida produce representaciones que no transfieren bien, por muchos datos que uses.
  3. Las representaciones aprendidas pueden heredar sesgos: los patrones, carencias o sesgos del entrenamiento afloran en las representaciones, ya que nada los filtra durante el preentrenamiento.
  4. Un gran rendimiento en preentrenamiento no garantiza el éxito downstream: un modelo que resuelve bien su tarea de pretexto puede rendir por debajo en una tarea específica para la que no se optimizó directamente.

Por qué el autosupervisado es clave en la IA moderna

El aprendizaje autosupervisado es la razón por la que los modelos base son posibles.

El preentrenamiento a la escala que requieren los modelos modernos sería inviable si dependiera de etiquetas manuales. Nadie etiqueta a mano un billón de tokens de texto o mil millones de imágenes. La autosupervisión hizo práctico el preentrenamiento con colecciones a escala Internet y reutilizar ese único modelo en un amplio abanico de tareas downstream en lugar de entrenar uno por cada tarea.

Ese cambio de muchos modelos específicos de tarea a un único modelo general preentrenado adaptado a muchos usos es la dirección en la que se ha movido gran parte de la IA moderna. El aprendizaje autosupervisado es el mecanismo que lo ha hecho posible.

Conclusión

El aprendizaje autosupervisado obtiene su supervisión de la estructura de los datos sin etiquetar, en lugar de etiquetas escritas por una persona. El patrón típico es ocultar una palabra o predecir el siguiente token. Los datos se responden a sí mismos y el modelo aprende intentando acertar.

Los enfoques principales se apoyan en esa misma idea de formas distintas. El aprendizaje contrastivo acerca ejemplos relacionados y aleja los no relacionados. El modelado enmascarado oculta parte de la entrada y entrena al modelo para reconstruirla. El aprendizaje autorregresivo predice el siguiente elemento de una secuencia con todo lo anterior. La mecánica cambia, pero el principio —dejar que la estructura de los datos aporte la señal de entrenamiento— es el mismo.

Ese principio está detrás de la mayoría de modelos de lenguaje, visión y multimodales que ya usas. La predicción del siguiente token preentrena los LLM actuales; los objetivos contrastivos y enmascarados preentrenan los modelos de visión; y la alineación imagen-texto preentrena los modelos multimodales que conectan ambos mundos.

Si quieres aprender a crear un LLM desde cero, apúntate a nuestro itinerario Developing Large Language Models para ver PyTorch, Hugging Face y las últimas técnicas de NLP en acción.


Dario Radečić's photo
Author
Dario Radečić
LinkedIn
Científico de Datos Senior con base en Croacia. Top Tech Writer con más de 700 artículos publicados, generando más de 10M de visitas. Autor del libro Automatización del aprendizaje automático con TPOT.

FAQs

¿Qué es el aprendizaje autosupervisado?

El aprendizaje autosupervisado es una forma de entrenar modelos sin etiquetas creadas por personas. El modelo observa una parte de la entrada, oculta otra y aprende intentando predecir la parte que falta. Los datos aportan su propia señal de entrenamiento, de ahí lo de "autosupervisado".

¿En qué se diferencia del aprendizaje no supervisado?

Ambos trabajan con datos sin etiquetar, pero los abordan de forma distinta. El no supervisado busca estructura sin un objetivo de predicción concreto, como agrupar clientes similares. El autosupervisado construye una tarea de predicción explícita a partir de los propios datos y entrena el modelo para resolverla.

¿Por qué importa para la IA moderna?

Es la razón por la que los modelos base son posibles. Preentrenar a la escala actual sería inalcanzable si dependiera de etiquetas manuales: nadie etiqueta a mano un billón de tokens. La autosupervisión permite reutilizar un único modelo preentrenado en varias tareas downstream en lugar de entrenar uno por cada tarea.

¿Diferencia entre tarea de pretexto y tarea downstream?

Una tarea de pretexto es el problema artificial que el modelo resuelve durante el preentrenamiento, como predecir una palabra oculta. No es la tarea que te importa; solo fuerza al modelo a aprender representaciones útiles. Una tarea downstream es el problema real al que aplicas después esas representaciones, como clasificación o búsqueda.

¿Puede funcionar con cero datos etiquetados?

Sí, el preentrenamiento en sí no necesita ninguna etiqueta. Una vez que el modelo ha aprendido representaciones, algunos usos downstream, como la clasificación zero-shot de CLIP, siguen sin requerir etiquetas. Otros, como el ajuste fino o el few-shot, incorporan una pequeña cantidad de etiquetas solo en esa fase posterior.

Temas
Aprendizaje automático

Aprende con DataCamp

Curso

Aprendizaje supervisado con scikit-learn

4 h
300.7K
Mejora tu machine learning con scikit-learn en Python. Haz predicciones potentes con conjuntos de datos reales en este curso interactivo.
Ver detallesRight Arrow
Iniciar Curso
Ver másRight Arrow
Relacionado

blog

Introducción al aprendizaje no supervisado

Aprende sobre el aprendizaje no supervisado, sus tipos -agrupación, minería de reglas de asociación y reducción de la dimensionalidad- y en qué se diferencia del aprendizaje supervisado.
Kurtis Pykes 's photo

Kurtis Pykes

9 min

blog

Machine learning supervisado

Descubre qué es el machine learning supervisado, en qué se diferencia del machine learning no supervisado y cómo funcionan algunos algoritmos esenciales del machine learning supervisado
Moez Ali's photo

Moez Ali

8 min

blog

Explicación de los modelos de lenguaje visual (VLM)

Los modelos de lenguaje visual (VLM) son modelos de IA que pueden comprender y procesar datos visuales y textuales, lo que permite realizar tareas como subtitular imágenes, responder a preguntas visuales y generar texto a imagen.
Bhavishya Pandit's photo

Bhavishya Pandit

8 min

blog

¿Qué son los datos etiquetados?

Los datos etiquetados son datos brutos a los que se les han asignado etiquetas para añadir contexto o significado, que se utilizan para entrenar modelos de machine learning en el aprendizaje supervisado.
Abid Ali Awan's photo

Abid Ali Awan

6 min

Tutorial

Introducción al aprendizaje automático estadístico

Descubra la potente fusión de estadística y aprendizaje automático. Explore cómo las técnicas estadísticas sustentan los modelos de aprendizaje automático, permitiendo la toma de decisiones basada en datos.
Joanne Xiong's photo

Joanne Xiong

11 min

Tutorial

Aprendizaje automático de datos categóricos con el tutorial de Python

Aprenda los trucos más comunes para manejar datos categóricos y preprocesarlos para construir modelos de aprendizaje automático.
Moez Ali's photo

Moez Ali

14 min

Ver MásVer Más