Ir al contenido principal

Active learning: algoritmos de IA con criterio propio

Descubre el active learning, un caso de aprendizaje automático semisupervisado: desde su definición y beneficios, hasta sus aplicaciones e investigación actual.
Actualizado 17 sept 2026  · 14 min leer

Explorar con IA

ChatGPTClaudePerplexity

El active learning es uno de esos temas de los que oyes hablar, pero para los que nunca sacas tiempo de entender a fondo. En la entrada de hoy te explicamos el razonamiento detrás del active learning, sus beneficios y cómo encaja en la investigación moderna de machine learning.

Saber utilizar bien el active learning te da una herramienta potentísima cuando hay escasez de datos etiquetados. Puedes verlo como un tipo de "metodología de diseño", similar al transfer learning, que también permite aprovechar pequeñas cantidades de datos etiquetados.

En un próximo post, aprenderás cómo combinar active learning y transfer learning para exprimir al máximo los datos existentes (y los nuevos).

Motivación

En lugar de empezar con una definición formal, es mejor ver un ejemplo sencillo para entender por qué funciona el active learning.

ejemplo de active learning

En la imagen de la izquierda (tomada de este estudio), hay dos grupos: puntos verdes y puntos rojos. Es un problema de clasificación y queremos una "frontera de decisión" (aquí, una línea) que separe las figuras verdes de las rojas. Pero no conocemos las etiquetas (rojo o verde) de los puntos y obtenerlas para todos sería muy costoso. Así que queremos muestrear un subconjunto pequeño, averiguar sus etiquetas y usar esos puntos etiquetados como datos de entrenamiento para un clasificador.

En la imagen central, se usa regresión logística tras muestrear y etiquetar aleatoriamente unos pocos puntos. La frontera resultante (línea azul) es subóptima: está sesgada hacia los rojos e invade la zona de los verdes, así que muchos verdes se clasificarán mal como rojos. Este sesgo se debe a una mala selección de puntos para etiquetar. En la imagen de la derecha, volvemos a usar regresión logística, pero ahora elegimos un subconjunto pequeño con un método de consulta de active learning. La nueva frontera es mucho mejor porque separa mejor ambos colores. La mejora viene de seleccionar mejores puntos para que el clasificador pueda trazar una frontera de decisión sólida.

Cómo ese método de consulta logró escoger puntos tan buenos es una de las grandes líneas de investigación en active learning. Más abajo verás algunos de los métodos más populares para consultar puntos.

Active learning: definición y conceptos

La hipótesis principal del active learning es que, si un algoritmo puede elegir de qué datos quiere aprender, puede rendir mejor que los métodos tradicionales con sustancialmente menos datos de entrenamiento.

¿Y cuáles son exactamente esos métodos tradicionales?

Son tareas que consisten en recopilar una gran cantidad de datos muestreados aleatoriamente de la distribución subyacente y usar ese gran conjunto para entrenar un modelo que haga predicciones. A este enfoque típico lo llamaremos aprendizaje pasivo.

Una de las tareas más laboriosas del aprendizaje pasivo es recopilar datos etiquetados. En muchos contextos, hay factores que dificultan reunir grandes volúmenes de datos con etiqueta.

Pensemos en el estudio del cáncer de páncreas. Quieres predecir si una persona podría desarrollarlo, pero quizá solo puedes someter a un pequeño número de pacientes a pruebas adicionales para recoger variables, etc. En ese caso, en lugar de seleccionar pacientes al azar, puedes elegirlos según ciertos criterios. Por ejemplo, que consuman alcohol y tengan más de 40 años. Ese criterio no tiene por qué ser fijo: puede cambiar según los resultados previos. Si descubres que tu modelo predice bien en mayores de 50, pero falla más entre 40 y 50, ese podría ser tu nuevo criterio.

El proceso de seleccionar esos pacientes (o instancias, en general) en función de los datos recopilados hasta el momento se llama active learning.

Escenarios

En active learning, suele haber tres escenarios o configuraciones en los que el aprendiz consulta las etiquetas de las instancias. Los más estudiados en la literatura son:

  • Membership Query Synthesis: un término rimbombante que significa que el aprendiz genera o construye una instancia (a partir de alguna distribución natural subyacente). Por ejemplo, si los datos son imágenes de dígitos, el aprendiz crea una imagen similar a un dígito (quizá rotada o con una parte omitida) y la envía al oráculo para que la etiquete.

active learning con consultas por síntesis

  • Stream-based selective sampling: aquí se asume que obtener una instancia sin etiqueta no tiene coste. Con esa premisa, se toma cada instancia no etiquetada de una en una y el aprendiz decide si quiere consultar su etiqueta o descartarla según su grado de informatividad. Para medirlo, se usa una estrategia de consulta (ver la siguiente sección). Siguiendo el ejemplo, elegirías una imagen del conjunto no etiquetado, decidirías si hay que etiquetarla o descartarla y repetirías con la siguiente imagen.

active learning en muestreo selectivo por flujo

  • Pool-based sampling: se asume que existe un gran pool de datos sin etiqueta, como en el caso anterior. Las instancias se seleccionan del pool según una medida de informatividad. Esa medida se aplica a todas las instancias del pool (o a un subconjunto si es muy grande) y se eligen las más informativas. Es el escenario más común en la comunidad de active learning. Siguiendo el ejemplo, se ordenan todas las imágenes sin etiquetar de dígitos y se seleccionan las mejores (más informativas) para solicitar sus etiquetas.

active learning con muestreo basado en pool

Estrategias de consulta

La gran diferencia entre un aprendiz activo y uno pasivo es su capacidad para consultar instancias basándose en consultas previas y las respuestas (etiquetas) obtenidas. Como has visto, todos los escenarios de active learning requieren alguna medida de informatividad sobre las instancias sin etiqueta. En esta sección explico tres enfoques populares bajo el paraguas de uncertainty sampling, ya que se apoyan en probabilidades (para más estrategias y detalle, recomiendo este artículo de revisión).

Usaré la siguiente tabla para ilustrarlas. Muestra dos instancias y las probabilidades de cada etiqueta. Para d1, las probabilidades de las etiquetas A, B y C son 0,9, 0,09 y 0,01 respectivamente; y para d2, 0,2, 0,5 y 0,3.

Instancias Etiqueta A Etiqueta B Etiqueta C
d1 0.9 0.09 0.01
d2 0.2 0.5 0.3
  • Least confidence (LC): el aprendiz elige la instancia en la que tiene menor confianza en su etiqueta más probable. En la tabla, está bastante seguro de d1 (probabilidad 0,9 de A), pero menos de d2, cuyas probabilidades están más repartidas y su etiqueta más probable (B) solo alcanza 0,5. Con least confidence, elegiría d2 para consultar su etiqueta real.

  • Margin sampling: la debilidad del método LC es que solo considera la etiqueta más probable e ignora el resto. Margin sampling lo corrige eligiendo la instancia con la menor diferencia entre la primera y la segunda etiquetas más probables. En d1, la diferencia es 0,81 (0,9 - 0,09) y en d2 es 0,2 (0,5 - 0,3). De nuevo, se seleccionaría d2.

  • Entropy sampling: para aprovechar todas las probabilidades, se usa la entropía. Se calcula para cada instancia y se consulta la de mayor valor. En el ejemplo, d1 tiene 0,155 y d2 0,447, así que el aprendiz volvería a escoger d2.

Juntándolo todo

Hasta ahora hemos visto las piezas que componen el active learning. Puede parecer lioso unir todos los pasos, pero en esta sección recorrerás un ejemplo completo —aunque muy sencillo—.

Paso 0: recopila datos

Parece trivial, pero es clave que el conjunto que reúnas sea representativo de la distribución real. Es decir, intenta evitar sesgos fuertes. En la práctica, es imposible tener una muestra perfectamente representativa por limitaciones legales, de tiempo o de disponibilidad.

En este ejemplo, partimos de 5 instancias. Feature A y Feature B representan características de cada punto. Importante: los datos que reunimos no están etiquetados.

Instancias Feature A Feature B
d1 10 0
d2 4 9
d3 8 5
d4 3 3
d5 5 5

Paso 1: divide en seed y conjunto sin etiquetar

A continuación, divide los datos en un conjunto muy pequeño que vas a etiquetar y un conjunto grande sin etiquetas. En la jerga de active learning, ese pequeño conjunto etiquetado es la seed. No hay un número o porcentaje fijo. Una vez apartado, etiqueta esas instancias.

Nota: en gran parte de la literatura, no se usa un oráculo o experto para etiquetar estas instancias. Suele partirse de un dataset ya etiquetado, se toma una pequeña parte como seed (ya tienen etiqueta) y se trata el resto como si no la tuviera. Cuando el aprendiz selecciona una instancia para consultarla al orcale, simplemente se mira su etiqueta en el dataset.

En el ejemplo, eliges dos instancias para la seed, d1 y d3. Las etiquetas posibles son "Y" y "N".

Seed/conjunto etiquetado

Instancias Feature A Feature B Etiqueta
d1 10 0 Y
d3 8 5 N

Conjunto sin etiquetar

Instancias Feature A Feature B
d2 4 9
d4 3 3
d5 5 5

Paso 2: entrena el modelo

Con los datos divididos, usa la seed para entrenar el aprendiz como en cualquier proyecto de machine learning (con validación cruzada, etc.). El tipo de modelo dependerá del dominio y, en general, interesa usar aprendices que devuelvan probabilidades sobre las etiquetas, ya que las usaremos en las estrategias de consulta.

En el ejemplo, puedes usar el clasificador que quieras y entrenarlo con las dos instancias etiquetadas.

Paso 3: elige instancias sin etiquetar

Una vez entrenado el aprendiz, ya puedes seleccionar las instancias a consultar. Tienes que decidir el escenario (Membership Query Synthesis, Stream-based selective sampling o Pool-based sampling) y la estrategia de consulta.

Usaremos pool-based sampling con un tamaño de lote de 2. Es decir, en cada iteración seleccionas dos instancias del conjunto sin etiquetar y las añades al conjunto etiquetado. Usas least confidence para elegir. El aprendiz selecciona d2 y d4, cuyas etiquetas consultadas son "Y" y "N", respectivamente.

Conjunto etiquetado

Instancias Feature A Feature B Etiqueta
d1 10 0 Y
d3 8 5 N
d2 4 9 Y
d4 3 3 N

Conjunto sin etiquetar

Instancias Feature A Feature B
d5 5 5

Paso 4: criterio de parada

Ahora puedes repetir los pasos 2 y 3 hasta cumplir un criterio de parada. Es decir, con el nuevo conjunto etiquetado reentrenas el aprendiz y vuelves a seleccionar datos sin etiqueta para consultar. Un criterio puede ser el número de instancias consultadas, otro el número de iteraciones, o parar cuando el rendimiento deje de mejorar por encima de un umbral.

En el ejemplo, paramos tras una iteración y damos por terminado el algoritmo de active learning. También puedes tener un conjunto de test independiente para evaluar el aprendiz y registrar su rendimiento. Así verás si mejora o se estanca al añadir datos etiquetados.

Aplicaciones e investigación actual en active learning

Uno de los campos más populares es el procesamiento de lenguaje natural (NLP). Muchas tareas de NLP requieren grandes volúmenes de datos etiquetados (por ejemplo, etiquetado gramatical o reconocimiento de entidades) y etiquetar es muy costoso.

De hecho, hay pocos datasets en NLP que estén completamente etiquetados y sean de libre acceso. Por eso, usar active learning puede reducir de forma significativa la cantidad de datos etiquetados y de expertos necesarios. El mismo razonamiento aplica a reconocimiento de voz e incluso a tareas como la recuperación de información.

El active learning sigue siendo un área muy activa. Se está investigando su aplicación con distintos algoritmos de deep learning como CNNs y LSTMs como aprendices y cómo mejorar su eficiencia en estos marcos (Kronrod y Anandkumar, 2017; Sener y Savarese, 2017). También hay trabajos que incorporan Generative Adversarial Networks (GANs) al framework de active learning (Zhu y Bento, 2017). Con el auge del aprendizaje por refuerzo profundo, se intenta replantear el active learning como un problema de refuerzo (Fang et al., 2017). Además, hay artículos que buscan aprender estrategias de active learning mediante meta-learning (Fang et al., 2017).

Temas
Aprendizaje automático

Aprende más sobre machine learning

Curso

Comprender el machine learning

2 h
308K
Introducción al machine learning, ¡y no hay que programar!
Ver detallesRight Arrow
Iniciar Curso
Ver másRight Arrow
Relacionado

blog

¿Qué es un algoritmo?

Aprende algoritmos y su importancia en el machine learning. Comprende cómo los algoritmos resuelven problemas y realizan tareas con pasos bien definidos.
DataCamp Team's photo

DataCamp Team

11 min

blog

Clasificación en machine learning: Introducción

Aprende sobre la clasificación en machine learning viendo qué es, cómo se utiliza y algunos ejemplos de algoritmos de clasificación.
Zoumana Keita 's photo

Zoumana Keita

14 min

blog

Machine learning supervisado

Descubre qué es el machine learning supervisado, en qué se diferencia del machine learning no supervisado y cómo funcionan algunos algoritmos esenciales del machine learning supervisado
Moez Ali's photo

Moez Ali

8 min

blog

Introducción al aprendizaje no supervisado

Aprende sobre el aprendizaje no supervisado, sus tipos -agrupación, minería de reglas de asociación y reducción de la dimensionalidad- y en qué se diferencia del aprendizaje supervisado.
Kurtis Pykes 's photo

Kurtis Pykes

9 min

Tutorial

IA explicable - Comprender y confiar en los modelos de aprendizaje automático

Sumérjase en la IA explicable (XAI) y aprenda a generar confianza en los sistemas de IA con LIME y SHAP para la interpretabilidad de modelos. Comprender la importancia de la transparencia y la equidad en las decisiones basadas en la IA.
Zoumana Keita 's photo

Zoumana Keita

12 min

Tutorial

Agrupación jerárquica en R

La agrupación es la forma más común de aprendizaje no supervisado, un tipo de algoritmo de aprendizaje automático que se utiliza para hacer inferencias a partir de datos no etiquetados.
DataCamp Team's photo

DataCamp Team

15 min

Ver MásVer Más