YOLO Vision 2026:
Zurück zum Ultralytics Glossar

Multiple Instance Learning

Erfahre, wie Multiple Instance Learning Taschen-Level-Labels (bag-level labels), Instanzaggregation und schwache Überwachung für medizinische Bildgebung, Inspektion und Klassifizierung nutzt.

Multiple Instance Learning (MIL) ist ein machine learning-Ansatz, bei dem Trainingsbeispiele in Gruppen organisiert werden, die als Bags (Taschen) bezeichnet werden, während die Elemente innerhalb jedes Bags als Instances (Instanzen) bezeichnet werden. Das Modell erhält ein Label für das gesamte Bag, aber nicht für jede einzelne Instanz. Beispielsweise kann ein Pathologie-Objektträger mit „Krebs vorhanden“ beschriftet sein, ohne dass angegeben wird, welche Bildbereiche Krebszellen enthalten. MIL ist nützlich, wenn detaillierte Annotationen teuer, zweideutig oder nicht verfügbar sind.

Wie Multiple Instance Learning funktioniert#

Beim herkömmlichen supervised learning hat jedes Trainingsbeispiel sein eigenes Label. MIL ändert die Überwachungseinheit: Das Label gehört zu einer Menge verwandter Beispiele.

Ein Bag kann ein Video mit vielen Frames, ein Dokument mit vielen Abschnitten oder ein großes Bild sein, das in Patches unterteilt ist. Jeder Frame, jeder Abschnitt und jeder Patch ist eine Instanz. Ein typisches MIL-Modell besteht aus drei Komponenten:

  1. Ein Instance Encoder konvertiert jede Instanz in eine numerische Merkmalsrepräsentation.
  2. Eine Aggregation Function (Aggregationsfunktion) kombiniert die Instanzrepräsentationen zu einer einzigen Bag-Repräsentation.
  3. Ein Bag Classifier (Bag-Klassifikator) sagt das Bag-Label aus dieser kombinierten Repräsentation voraus.

Bei der binären Klassifikation besagt die traditionelle MIL-Annahme, dass ein positives Bag mindestens eine positive Instanz enthält, während jede Instanz in einem negativen Bag negativ ist. Diese Annahme passt zu Aufgaben, bei denen ein kleiner Bereich das Gesamtergebnis bestimmen kann. Andere Probleme erfordern kollektive Annahmen, wie etwa die Vorhersage eines positiven Labels nur dann, wenn mehrere Instanzen stützende Beweise zeigen.

Da MIL aus Bag-Labels lernt, wird es als eine Form der weak supervision betrachtet. Im Gegensatz zur gewöhnlichen image classification wird nicht davon ausgegangen, dass das komplette Bild oder jede Region die zugewiesene Klasse ausdrückt. Dadurch wird vermieden, ein Bag-Label fälschlicherweise auf alle Instanzen zu übertragen.

Aggregation und Instanzwichtigkeit#

Die Aggregation muss mit unterschiedlichen Bag-Größen umgehen können und sollte in der Regel unabhängig von der Instanzreihenfolge sein. Zu den gängigen Strategien gehören:

  • Max pooling: Verwendet das stärkste Instanzsignal. Es entspricht der Annahme „mindestens eine positive Instanz“, kann aber anfällig für Ausreißer sein.
  • Mean pooling: Bildet den Durchschnitt der Beweise im gesamten Bag. Es funktioniert besser, wenn viele Instanzen einen Beitrag leisten, kann aber seltene positive Beweise verwässern.
  • Attention pooling: Lernt, wie stark jede Instanz das Ergebnis beeinflussen soll. Die resultierenden Gewichte können auf wichtige Regionen hinweisen, obwohl sie keine garantierten Erklärungen sind.

Der gepoolte Output wird in einen Bag-Score umgewandelt, oft unter Verwendung einer Wahrscheinlichkeitsfunktion wie Softmax. Beim Training wird dieser Score mit dem Bag-Label verglichen, und es wird backpropagation verwendet, um den Encoder und den Aggregator gemeinsam zu aktualisieren.

MIL optimiert in erster Linie Vorhersagen auf Bag-Ebene. Selbst wenn ein Modell bestimmten Instanzen eine hohe Wichtigkeit zuweist, sind diese Scores nicht automatisch zuverlässige Instanz-Labels oder präzise Lokalisierungen.

Praxisanwendungen#

  • Medizinische Bildanalyse: Ein digitalisierter Gewebeobjektträger kann Tausende von Patches enthalten, während die verfügbare Diagnose nur für den Patienten oder den Objektträger gilt. MIL kann die Patches als Instanzen verarbeiten und vorhersagen, ob der vollständige Objektträger Anzeichen einer Krankheit enthält. Dies ist wertvoll für die medical image analysis, da das Zeichnen detaillierter Grenzen um jede abnormale Region viel Zeit von Spezialisten erfordert. Die NCI Genomic Data Commons AI resources beschreiben Ganzbereichsbilder (Whole-Slide Images) als Inputs für die Krebsklassifikation, Merkmalserkennung und Ergebnisvorhersage. (gdc.cancer.gov)

  • Industrielle Sichtprüfung: Eine hergestellte Komponente kann aus mehreren Blickwinkeln fotografiert oder als kurze Sequenz aufgenommen werden. Qualitätsprüfer können die komplette Prüfung als „fehlerhaft“ kennzeichnen, ohne die genaue Ansicht zu identifizieren, die einen Riss oder ein fehlendes Teil enthält. MIL kann die Ansichten als ein einziges Bag behandeln und lernen, welche visuellen Beweise einen Fehler vorhersagen. Wenn später präzise Fehlerpositionen erforderlich werden, können ausgewählte Instanzen für die object detection oder instance segmentation annotiert werden.

Verwandte Lerneinstellungen#

MIL unterscheidet sich von mehreren eng verwandten Ansätzen:

  • Weak supervision ist die breitere Kategorie, die unvollständige, verrauschte oder indirekte Labels abdeckt. MIL verwendet speziell Labels, die an Instanzen-Bags angehängt sind.
  • Semi-supervised learning kombiniert gelabelte und ungelabelte Beispiele. MIL-Bags sind gelabelt, aber ihre einzelnen Instanzen sind in der Regel ungelabelt.
  • Multi-label learning sagt mehrere Klassen für ein einziges Beispiel voraus. MIL beschreibt, wie Beispiele gruppiert werden, sodass ein System sowohl multi-instance als auch multi-label sein kann.
  • Attention mechanisms bestimmen, wie Informationen gewichtet oder kombiniert werden. Sie können MIL-Aggregation implementieren, definieren MIL jedoch nicht von sich aus.
  • Object detection erfordert lokalisierte Annotationen wie Bounding Boxes. MIL kann manchmal wahrscheinliche Regionen hervorheben, aber das Training auf Bag-Ebene allein liefert keine verifizierten Objektpositionen.

Praktischer Workflow und Evaluierung#

Das folgende Inferenz-Skript verwendet ein Ultralytics YOLO26 classification model, um zwei Bildinstanzen zu bewerten, und wendet Max-Aggregation an. Es demonstriert das Konzept der Bag-Entscheidung anstelle eines gemeinsam trainierten MIL-Modells.

from ultralytics import YOLO

# Treat related images as instances within one bag
sources = [
    "https://ultralytics.com/images/bus.jpg",
    "https://ultralytics.com/images/zidane.jpg",
]

model = YOLO("yolo26n-cls.pt")
results = model(sources)

# Aggregate evidence for one target class across the bag
target_name = "minibus"
target_id = next(i for i, name in results[0].names.items() if name == target_name)
instance_scores = [float(result.probs.data[target_id]) for result in results]
bag_score = max(instance_scores)

print(f"{target_name} bag probability: {bag_score:.3f}")

Eine vollständige MIL-Implementierung trainiert einen Bag-bewussten Aggregator unter Verwendung von Bag-Labels. Ultralytics YOLO unterstützt standardmäßige classification workflows, während benutzerdefinierte MIL-Logik erforderlich ist, um Instanzen zu gruppieren und den Loss auf Bag-Ebene zu optimieren.

Praktiker sollten Bag-Grenzen beim Batching beibehalten, mehrere Aggregationsregeln testen und verhindern, dass verwandte Instanzen Dataset-Splits überschreiten. Tools wie GroupKFold cross-validation können Patches desselben Patienten, Videos oder Produkts zusammenhalten. Evaluiere precision and recall auf Bag-Ebene und füge eine Evaluierung auf Instanz-Ebene hinzu, wenn die Lokalisierung wichtig ist. Ultralytics Platform kann das Dataset-Management, die Annotation, das Standard-Modelltraining und die Bereitstellung unterstützen, wenn eine MIL-Pipeline mit Erkennungs-, Segmentierungs- oder Klassifikationskomponenten kombiniert wird.

Explore solutions

Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr

Lass uns gemeinsam die Zukunft der KI bauen!

Beginne deine Reise mit der Zukunft des maschinellen Lernens