Multiple Instance Learning
Aprende cómo el aprendizaje de instancia múltiple utiliza etiquetas a nivel de bolsa, agregación de instancias y supervisión débil para imágenes médicas, inspección y clasificación.
El Aprendizaje de Múltiples Instancias (MIL) es un enfoque de aprendizaje automático en el cual los ejemplos de entrenamiento se organizan en grupos llamados bolsas (bags), mientras que los elementos dentro de cada bolsa se denominan instancias. El modelo recibe una etiqueta para toda la bolsa, pero no para cada instancia individual. Por ejemplo, una placa patológica puede estar etiquetada como “cáncer presente” sin identificar qué regiones de la imagen contienen células cancerosas. El MIL resulta útil cuando la anotación detallada es costosa, ambigua o no está disponible.
Cómo funciona el Aprendizaje de Múltiples Instancias#
En el aprendizaje supervisado convencional, cada ejemplo de entrenamiento tiene su propia etiqueta. El MIL cambia la unidad de supervisión: la etiqueta pertenece a un conjunto de ejemplos relacionados.
Una bolsa puede ser un video que contiene muchos fotogramas, un documento que contiene muchos pasajes o una imagen grande dividida en parches. Cada fotograma, pasaje o parche es una instancia. Un modelo MIL típico consta de tres componentes:
- Un codificador de instancias convierte cada instancia en una representación de características numéricas.
- Una función de agregación combina las representaciones de las instancias en una sola representación de la bolsa.
- Un clasificador de bolsas predice la etiqueta de la bolsa a partir de esa representación combinada.
Para la clasificación binaria, la suposición tradicional del MIL establece que una bolsa positiva contiene al menos una instancia positiva, mientras que cada instancia en una bolsa negativa es negativa. Esta suposición se ajusta a tareas donde una pequeña región puede determinar el resultado general. Otros problemas requieren suposiciones colectivas, como predecir una etiqueta positiva solo cuando varias instancias muestran evidencia de apoyo.
Debido a que el MIL aprende a partir de etiquetas de bolsas, se considera una forma de supervisión débil. A diferencia de la clasificación de imágenes ordinaria, no asume que la imagen completa o cada región expresa la clase asignada. Esto evita copiar incorrectamente la etiqueta de una bolsa en todas las instancias.
Agregación e Importancia de las Instancias#
La agregación debe manejar diferentes tamaños de bolsas y, por lo general, debe ser independiente del orden de las instancias. Las estrategias comunes incluyen:
- Max pooling: Utiliza la señal de la instancia más fuerte. Coincide con la suposición de “al menos una instancia positiva”, pero puede ser sensible a los valores atípicos.
- Mean pooling: Promedia la evidencia en toda la bolsa. Funciona mejor cuando muchas instancias contribuyen, pero puede diluir la evidencia positiva rara.
- Attention pooling: Aprende con qué intensidad debe influir cada instancia en el resultado. Los pesos resultantes pueden indicar regiones importantes, aunque no garantizan ser explicaciones definitivas.
La salida agrupada se convierte en una puntuación de bolsa, a menudo mediante una función de probabilidad como Softmax. El entrenamiento compara esta puntuación con la etiqueta de la bolsa y utiliza la propagación hacia atrás para actualizar el codificador y el agregador conjuntamente.
El MIL optimiza principalmente las predicciones a nivel de bolsa. Incluso cuando un modelo asigna una alta importancia a instancias particulares, esas puntuaciones no son automáticamente etiquetas de instancia fiables ni localizaciones precisas.
Aplicaciones en el mundo real#
-
Análisis de imágenes médicas: Una placa de tejido digitalizada puede contener miles de parches, mientras que el diagnóstico disponible se aplica únicamente al paciente o a la placa. El MIL puede procesar los parches como instancias y predecir si la placa completa contiene evidencia de enfermedad. Esto es valioso para el análisis de imágenes médicas porque trazar límites detallados alrededor de cada región anormal requiere el tiempo de un especialista. Los recursos de IA de NCI Genomic Data Commons describen imágenes de portaobjetos completos como entradas para la clasificación de cáncer, la detección de características y la predicción de resultados. (gdc.cancer.gov)
-
Inspección visual industrial: Un componente fabricado puede fotografiarse desde varios ángulos o grabarse como una secuencia corta. Los inspectores de calidad pueden etiquetar la inspección completa como “defectuosa” sin identificar la vista exacta que contiene una grieta o una pieza faltante. El MIL puede tratar las vistas como una sola bolsa y aprender qué evidencia visual predice el fallo. Si más adelante se necesitan ubicaciones precisas de los defectos, se pueden anotar instancias seleccionadas para detección de objetos o segmentación de instancias.
Entornos de Aprendizaje Relacionados#
El MIL difiere de varios enfoques estrechamente relacionados:
- La supervisión débil es la categoría más amplia que abarca etiquetas incompletas, ruidosas o indirectas. El MIL utiliza específicamente etiquetas asociadas a bolsas de instancias.
- El aprendizaje semisupervisado combina ejemplos etiquetados y no etiquetados. Las bolsas de MIL están etiquetadas, pero sus instancias individuales suelen carecer de etiqueta.
- El aprendizaje multietiqueta predice varias clases para un solo ejemplo. El MIL describe cómo se agrupan los ejemplos, por lo que un sistema puede ser tanto multi-instancia como multietiqueta.
- Los mecanismos de atención determinan cómo se pondera o combina la información. Pueden implementar la agregación del MIL, pero no definen el MIL por sí mismos.
- Object detection requires localized annotations such as bounding boxes. MIL can sometimes highlight likely regions, but bag-level training alone does not provide verified object locations.
Flujo de Trabajo Práctico y Evaluación#
El siguiente esquema de inferencia utiliza un modelo de clasificación Ultralytics YOLO26 para calificar dos instancias de imagen y aplica agregación por valor máximo (max). Demuestra el concepto de decisión de bolsa en lugar de un modelo MIL entrenado conjuntamente.
from ultralytics import YOLO
# Treat related images as instances within one bag
sources = [
"https://ultralytics.com/images/bus.jpg",
"https://ultralytics.com/images/zidane.jpg",
]
model = YOLO("yolo26n-cls.pt")
results = model(sources)
# Aggregate evidence for one target class across the bag
target_name = "minibus"
target_id = next(i for i, name in results[0].names.items() if name == target_name)
instance_scores = [float(result.probs.data[target_id]) for result in results]
bag_score = max(instance_scores)
print(f"{target_name} bag probability: {bag_score:.3f}")Una implementación MIL completa entrena un agregador consciente de bolsas utilizando etiquetas de bolsas. Ultralytics YOLO admite flujos de trabajo de clasificación estándar, mientras que se necesita lógica MIL personalizada para agrupar instancias y optimizar la pérdida a nivel de bolsa.
Los profesionales deben preservar los límites de las bolsas durante la creación de lotes (batching), probar múltiples reglas de agregación y evitar que instancias relacionadas crucen las divisiones del conjunto de datos. Herramientas como la validación cruzada GroupKFold pueden mantener juntos los parches del mismo paciente, video o producto. Evalúa la precisión y recuperación a nivel de bolsa y añade una evaluación a nivel de instancia si la localización es importante. La Plataforma Ultralytics puede respaldar la gestión de conjuntos de datos, la anotación, el entrenamiento de modelos estándar y el despliegue cuando se combina una canalización MIL con componentes de detección, segmentación o clasificación.






