Active Learning
Descubre cómo el aprendizaje activo optimiza el entrenamiento de IA. Aprende a usar Ultralytics YOLO26 para identificar datos informativos, reducir los costes de etiquetado y aumentar la precisión.
El aprendizaje activo es un enfoque estratégico del aprendizaje automático (ML) en el que el algoritmo selecciona de forma proactiva los puntos de datos más informativos para etiquetarlos, en lugar de aceptar pasivamente un conjunto de datos preetiquetado. En el aprendizaje supervisado tradicional, los modelos suelen requerir enormes cantidades de datos anotados, cuya creación puede ser costosa y llevar mucho tiempo. El aprendizaje activo optimiza este proceso identificando ejemplos «inciertos» o «difíciles» —aquellos cercanos a la frontera de decisión o en los que el modelo carece de confianza— y solicitando a anotadores humanos que etiqueten únicamente esas instancias concretas. Este ciclo iterativo permite a los modelos alcanzar una gran precisión con muchas menos muestras etiquetadas, lo que lo hace muy eficiente para proyectos con presupuestos o plazos limitados.
Cómo funciona el ciclo de aprendizaje activo#
El núcleo del aprendizaje activo es un ciclo de retroalimentación al que a menudo se hace referencia como human-in-the-loop. En lugar de entrenarse una sola vez con un conjunto de datos estático, el modelo evoluciona mediante ciclos de consulta y actualización.
-
Inicialización: el proceso comienza con un pequeño conjunto de datos de entrenamiento etiquetados que se utiliza para entrenar un modelo inicial, como Ultralytics YOLO26.
-
Selección de consultas: el modelo evalúa un gran conjunto de datos sin etiquetar. Mediante una estrategia de consulta —normalmente, el muestreo por incertidumbre— selecciona las imágenes o el texto sobre los que sus predicciones ofrecen menor confianza.
-
Anotación: estas muestras prioritarias se envían a un experto humano, al que a menudo se denomina «oráculo» en la literatura sobre aprendizaje activo, para el etiquetado de datos.
-
Reentrenamiento: los datos recién etiquetados se añaden al conjunto de entrenamiento y el modelo se vuelve a entrenar. Este modelo actualizado está mejor preparado para seleccionar el siguiente lote de muestras confusas.
Aplicaciones en el mundo real#
El aprendizaje activo es indispensable en sectores en los que abundan los datos, pero su etiquetado requiere conocimientos especializados o tiene un coste elevado.
- Análisis de imágenes médicas: en campos como la radiología, el etiquetado requiere expertos con certificación oficial, cuyo tiempo es extremadamente valioso. En lugar de pedir a un médico que anote miles de exploraciones inequívocas, un sistema de aprendizaje activo puede filtrar los casos ambiguos —como tumores en fases iniciales o anomalías poco frecuentes—, lo que permite al experto centrarse únicamente en las imágenes que realmente mejoran la capacidad diagnóstica del modelo.
- Vehículos autónomos: los coches autónomos generan petabytes de datos de vídeo. Etiquetar cada fotograma es imposible. El aprendizaje activo ayuda a los ingenieros a identificar casos límite, como peatones disfrazados o la conducción con nevadas intensas, que los modelos estándar de detección de objetos podrían pasar por alto. Al priorizar estos escenarios poco frecuentes, las empresas mejoran la seguridad sin desperdiciar recursos en imágenes repetitivas de autopista.
Ejemplo en Python: filtrado de predicciones inciertas#
El siguiente ejemplo muestra una lógica sencilla de «muestreo por incertidumbre» mediante Ultralytics YOLO26. Cargamos un modelo, ejecutamos inferencias sobre imágenes y marcamos aquellas cuyo valor de confianza está por debajo de un umbral determinado para revisarlas manualmente.
from ultralytics import YOLO
# Load the latest YOLO26 model
model = YOLO("yolo26n.pt")
# List of unlabeled image paths
unlabeled_images = ["https://ultralytics.com/images/bus.jpg", "https://ultralytics.com/images/zidane.jpg"]
# Run inference
results = model(unlabeled_images)
# Identify samples with low confidence for active learning
uncertain_threshold = 0.6
for result in results:
# Check if any detection confidence is below the threshold
if result.boxes.conf.numel() > 0 and result.boxes.conf.min() < uncertain_threshold:
print(f"Active Learning Query: {result.path} needs human labeling.")Diferenciación de conceptos relacionados#
Es importante diferenciar el aprendizaje activo de paradigmas de entrenamiento similares:
- Aprendizaje semisupervisado: aunque ambos métodos utilizan datos sin etiquetar, el aprendizaje semisupervisado asigna automáticamente pseudoetiquetas a los datos basándose en las predicciones del modelo con un alto nivel de confianza. En cambio, el aprendizaje activo solicita explícitamente la intervención humana para las predicciones con baja confianza.
- Aprendizaje por transferencia: consiste en tomar un modelo preentrenado (como uno entrenado con ImageNet) y adaptarlo a una tarea nueva. El aprendizaje activo se centra en qué datos etiquetar, mientras que el aprendizaje por transferencia se centra en reutilizar las características aprendidas.
- Aprendizaje por refuerzo: en este caso, un agente aprende al interactuar con un entorno y recibir recompensas. El aprendizaje activo es diferente porque busca etiquetas estáticas de verdad fundamental de un oráculo, en lugar de optimizar una secuencia de acciones para obtener una recompensa.
Integración con MLOps#
Implementar el aprendizaje activo de forma eficaz requiere una canalización sólida de operaciones de aprendizaje automático (MLOps). Necesitas una infraestructura para gestionar el versionado de datos, activar trabajos de reentrenamiento y poner la interfaz de anotación a disposición de los usuarios. Las herramientas que se integran con el ecosistema de Ultralytics permiten pasar sin problemas de la inferencia a la selección y depuración de datos, y al entrenamiento. Por ejemplo, el uso de scripts de entrenamiento personalizados permite a los desarrolladores incorporar rápidamente nuevos lotes de datos de aprendizaje activo a sus modelos YOLO.
Para profundizar en las estrategias de muestreo, los investigadores suelen consultar revisiones exhaustivas de la literatura sobre aprendizaje activo. Además, comprender las métricas de evaluación de modelos es crucial para verificar que el ciclo de aprendizaje activo realmente mejora el rendimiento.









