Multiple Instance Learning
Découvre comment l'apprentissage multi-instance utilise des étiquettes au niveau des sacs, l'agrégation d'instances et la supervision faible pour l'imagerie médicale, l'inspection et la classification.
L'apprentissage multi-instance (MIL) est une approche d'apprentissage automatique dans laquelle les exemples d'entraînement sont organisés en groupes appelés sacs, tandis que les éléments à l'intérieur de chaque sac sont appelés instances. Le modèle reçoit une étiquette pour l'ensemble du sac, mais pas pour chaque instance. Par exemple, une diapositive de pathologie peut être étiquetée « cancer présent » sans identifier quelles régions de l'image contiennent des cellules cancéreuses. Le MIL est utile lorsque l'annotation détaillée est coûteuse, ambiguë ou indisponible.
Comment fonctionne l'apprentissage multi-instance#
Dans l'apprentissage supervisé conventionnel, chaque exemple d'entraînement possède sa propre étiquette. Le MIL modifie l'unité de supervision : l'étiquette appartient à un ensemble d'exemples apparentés.
Un sac peut être une vidéo contenant de nombreuses images, un document contenant de nombreux passages ou une grande image divisée en correctifs. Chaque image, passage ou correctif est une instance. Un modèle MIL typique comporte trois composants :
- Un encodeur d'instance convertit chaque instance en une représentation de caractéristiques numériques.
- Une fonction d'agrégation combine les représentations d'instances en une représentation de sac unique.
- Un classificateur de sac prédit l'étiquette du sac à partir de cette représentation combinée.
Pour la classification binaire, l'hypothèse MIL traditionnelle stipule qu'un sac positif contient au moins une instance positive, tandis que chaque instance d'un sac négatif est négative. Cette hypothèse s'applique aux tâches où une petite région peut déterminer le résultat global. D'autres problèmes nécessitent des hypothèses collectives, telles que la prédiction d'une étiquette positive uniquement lorsque plusieurs instances présentent des preuves concordantes.
Parce que le MIL apprend à partir des étiquettes de sac, il est considéré comme une forme de supervision faible. Contrairement à la classification d'images ordinaire, il ne suppose pas que l'image complète ou chaque région exprime la classe assignée. Cela évite de copier incorrectement l'étiquette d'un sac sur toutes les instances.
Agrégation et importance des instances#
L'agrégation doit gérer différentes tailles de sacs et doit généralement être indépendante de l'ordre des instances. Les stratégies courantes incluent :
- Max pooling : Utilise le signal d'instance le plus fort. Il correspond à l'hypothèse « au moins une instance positive », mais peut être sensible aux valeurs aberrantes.
- Mean pooling : Fait la moyenne des preuves dans tout le sac. Il fonctionne mieux lorsque de nombreuses instances contribuent, mais peut diluer de rares preuves positives.
- Attention pooling : Apprend la force avec laquelle chaque instance doit influencer le résultat. Les poids obtenus peuvent indiquer des régions importantes, bien qu'ils ne constituent pas des explications garanties.
La sortie regroupée est convertie en un score de sac, souvent en utilisant une fonction de probabilité telle que Softmax. L'entraînement compare ce score à l'étiquette du sac et utilise la rétropropagation pour mettre à jour conjointement l'encodeur et l'agrégateur.
Le MIL optimise principalement les prédictions au niveau du sac. Même lorsqu'un modèle attribue une importance élevée à des instances particulières, ces scores ne constituent pas automatiquement des étiquettes d'instance fiables ou des localisations précises.
Applications concrètes#
-
Analyse d'images médicales : Une diapositive de tissu numérisée peut contenir des milliers de correctifs, tandis que le diagnostic disponible s'applique uniquement au patient ou à la diapositive. Le MIL peut traiter les correctifs comme des instances et prédire si la diapositive complète contient des signes de maladie. C'est précieux pour l'analyse d'images médicales car tracer des frontières détaillées autour de chaque région anormale demande du temps de spécialiste. Les ressources d'IA du NCI Genomic Data Commons décrivent des images de lames entières comme entrées pour la classification du cancer, la détection de caractéristiques et la prédiction des résultats. (gdc.cancer.gov)
-
Inspection visuelle industrielle : Un composant fabriqué peut être photographié sous plusieurs angles ou enregistré sous forme de courte séquence. Les inspecteurs qualité peuvent étiqueter l'inspection complète comme « défectueuse » sans identifier la vue exacte contenant une fissure ou une pièce manquante. Le MIL peut traiter les vues comme un sac unique et apprendre quel indice visuel prédit une défaillance. Si des emplacements précis de défauts s'avèrent nécessaires par la suite, des instances sélectionnées peuvent être annotées pour la détection d'objets ou la segmentation d'instances.
Paramètres d'apprentissage associés#
Le MIL diffère de plusieurs approches étroitement liées :
- La supervision faible est la catégorie plus large couvrant les étiquettes incomplètes, bruyantes ou indirectes. Le MIL utilise spécifiquement des étiquettes attachées à des sacs d'instances.
- Semi-supervised learning combines labeled and unlabeled examples. MIL bags are labeled, but their individual instances are usually unlabeled.
- Multi-label learning predicts several classes for one example. MIL describes how examples are grouped, so a system can be both multi-instance and multi-label.
- Les mécanismes d'attention déterminent comment l'information est pondérée ou combinée. Ils peuvent implémenter l'agrégation MIL mais ne définissent pas le MIL à eux seuls.
- Object detection requires localized annotations such as bounding boxes. MIL can sometimes highlight likely regions, but bag-level training alone does not provide verified object locations.
Flux de travail pratique et évaluation#
L'esquisse d'inférence suivante utilise un modèle de classification Ultralytics YOLO26 pour noter deux instances d'image et applique une agrégation maximale. Elle illustre le concept de décision de sac plutôt qu'un modèle MIL entraîné conjointement.
from ultralytics import YOLO
# Treat related images as instances within one bag
sources = [
"https://ultralytics.com/images/bus.jpg",
"https://ultralytics.com/images/zidane.jpg",
]
model = YOLO("yolo26n-cls.pt")
results = model(sources)
# Aggregate evidence for one target class across the bag
target_name = "minibus"
target_id = next(i for i, name in results[0].names.items() if name == target_name)
instance_scores = [float(result.probs.data[target_id]) for result in results]
bag_score = max(instance_scores)
print(f"{target_name} bag probability: {bag_score:.3f}")Une implémentation MIL complète entraîne un agrégateur conscient des sacs en utilisant les étiquettes de sacs. Ultralytics YOLO prend en charge les flux de travail de classification standard, tandis qu'une logique MIL personnalisée est nécessaire pour regrouper les instances et optimiser la perte au niveau du sac.
Les praticiens doivent préserver les limites des sacs lors de la mise en lots, tester de nombreuses règles d'agrégation et empêcher les instances apparentées de traverser les divisions de jeux de données. Des outils tels que la validation croisée GroupKFold peuvent regrouper des correctifs provenant du même patient, de la même vidéo ou du même produit. Évaluez la précision et le rappel au niveau du sac, et ajoutez une évaluation au niveau de l'instance si la localisation importe. Ultralytics Platform peut prendre en charge la gestion des ensembles de données, l'annotation, l'entraînement de modèles standard et le déploiement lorsqu'un pipeline MIL est combiné à des composants de détection, de segmentation ou de classification.






