Florence-2: Microsofts neuestes Vision-Language-Modell
Lerne Florence-2 kennen, Microsofts Vision-Language-Modell, das eine verbesserte Objekterkennung, Segmentierung und Zero-Shot-Leistung bei hoher Effizienz bietet.

Im Juni 2024 stellte Microsoft Florence-2 vor, ein multimodales visuelles Sprachmodell (VLM), das für eine Vielzahl von Aufgaben wie Objekterkennung, Segmentierung, Bildbeschriftung und Grounding ausgelegt ist. Florence-2 setzt einen neuen Maßstab für die Zero-Shot-Leistung, das heißt, es kann Aufgaben ohne vorheriges spezifisches Training ausführen, und ist kleiner als andere hochmoderne visuelle Sprachmodelle.
Florence-2 ist mehr als nur ein weiteres Modell: Seine Vielseitigkeit und verbesserte Leistung können verschiedene Branchen erheblich beeinflussen, indem sie die Genauigkeit steigern und den Bedarf an umfangreichem Training reduzieren. In diesem Artikel untersuchen wir die innovativen Funktionen von Florence-2, vergleichen seine Leistung mit anderen VLMs und erörtern seine möglichen Einsatzgebiete.
Was ist Florence-2?#
Florence-2 kann eine Vielzahl von Aufgaben innerhalb eines einheitlichen Frameworks bearbeiten. Die beeindruckenden Fähigkeiten des Modells sind teilweise seinem umfangreichen Trainingsdatensatz FLD-5B zu verdanken. FLD-5B umfasst 5,4 Milliarden Annotationen zu 126 Millionen Bildern. Dieser umfassende Datensatz wurde speziell erstellt, um Florence-2 die für eine präzise und effiziente Bearbeitung verschiedenster Bildverarbeitungsaufgaben erforderlichen Fähigkeiten zu vermitteln.
Hier siehst du die von Florence-2 unterstützten Aufgaben im Überblick:
- Objekterkennung: Das Modell kann Objekte in Bildern mit hoher Präzision erkennen und lokalisieren.
- Segmentierung: Bei dieser Aufgabe wird ein Bild in sinnvolle Segmente unterteilt, um die Analyse und Interpretation zu erleichtern.
- Bildbeschriftung: Florence-2 kann beschreibende Bildunterschriften erzeugen, die Kontext und Details zu Bildern liefern.
- Visuelles Grounding: Das Modell kann bestimmte Ausdrücke oder Wörter in einer Bildunterschrift den entsprechenden Bereichen im Bild zuordnen.
- Zero-Shot-Leistung: Das Modell kann Aufgaben ohne spezifisches Training ausführen.

Abb. 1: So wurde Florence-2 trainiert.
Das Modell unterstützt sowohl textbasierte als auch regionsbasierte Aufgaben. Für Aufgaben, die bestimmte Bildbereiche betreffen, werden spezielle Ortstoken zum Vokabular des Modells hinzugefügt. Diese Token helfen dem Modell, verschiedene Formen zu verstehen, etwa Rechtecke um Objekte (Darstellung durch Boxen), viereckige Formen (Darstellung durch Quad-Boxen) und Vielecke (Darstellung durch Polygone). Das Modell wird mit einer Methode namens Kreuzentropieverlust trainiert. Dabei lernt es, indem es seine Vorhersagen mit den korrekten Antworten vergleicht und seine internen Parameter entsprechend anpasst.
Erstellung des Datensatzes FLD-5B#
Der Datensatz FLD-5B umfasst verschiedene Annotationstypen: Textbeschreibungen, Paare aus Regionen und Text sowie Kombinationen aus Text, Ausdrücken und Regionen. Er wurde in einem zweistufigen Verfahren erstellt, das Datensammlung und Annotation umfasste. Die Bilder stammen aus bekannten Datensätzen wie ImageNet-22k, Object 365, Open Images, Conceptual Captions und LAION. Die Annotationen im Datensatz FLD-5B sind größtenteils synthetisch, das heißt, sie wurden automatisch statt manuell erstellt.

Abb. 2: Erstellung des Datensatzes FLD-5B.
Zunächst erstellten auf bestimmte Aufgaben spezialisierte Modelle, etwa für Objekterkennung oder Segmentierung, diese Annotationen. Anschließend wurde ein Filterungs- und Verbesserungsprozess eingesetzt, um sicherzustellen, dass die Annotationen detailliert und präzise waren. Nachdem Rauschen entfernt worden war, wurde der Datensatz iterativ verfeinert. Dabei wurden die Ausgaben von Florence-2 kontinuierlich genutzt, um die Annotationen zu aktualisieren und zu verbessern.
Die Modellarchitektur von Florence-2 verstehen#
Die Modellarchitektur von Florence-2 basiert auf einem Sequence-to-Sequence-Lernansatz. Das bedeutet, dass das Modell eine Eingabesequenz (etwa ein Bild mit einer Textaufforderung) verarbeitet und schrittweise eine Ausgabesequenz (etwa eine Beschreibung oder ein Label) erzeugt. Im Sequence-to-Sequence-Framework wird jede Aufgabe als Übersetzungsproblem behandelt: Das Modell erhält ein Eingabebild und eine aufgabenspezifische Aufforderung und erzeugt die entsprechende Ausgabe.

Abb. 3: Architektur des visuellen Sprachmodells Florence-2.
Im Zentrum der Modellarchitektur steht ein multimodaler Encoder-Decoder-Transformer, der einen Bild-Encoder und einen multimodalen Encoder-Decoder kombiniert. Der Bild-Encoder namens DaViT (dateneffizienter visueller Transformer) verarbeitet Eingabebilder, indem er sie in visuelle Token-Embeddings umwandelt – kompakte Darstellungen des Bildes, die sowohl räumliche Informationen (wo sich Dinge befinden) als auch semantische Informationen (was Dinge sind) erfassen. Diese visuellen Token werden anschließend mit Text-Embeddings (Darstellungen des Textes) kombiniert, sodass das Modell Text- und Bilddaten nahtlos zusammenführen kann.
Vergleich von Florence-2 mit anderen VLMs#
Florence-2 hebt sich durch seine beeindruckenden Zero-Shot-Fähigkeiten von anderen visuellen Sprachmodellen ab. Anders als Modelle wie PaliGemma, die auf umfangreiches Fine-Tuning angewiesen sind, um sich an verschiedene Aufgaben anzupassen, funktioniert Florence-2 direkt nach der Bereitstellung gut. Außerdem kann Florence-2 mit größeren Modellen wie GPT-4V und Flamingo konkurrieren, die häufig deutlich mehr Parameter besitzen, aber nicht immer die Leistung von Florence-2 erreichen. Florence-2 erzielt beispielsweise bessere Zero-Shot-Ergebnisse als Kosmos-2, obwohl Kosmos-2 mehr als doppelt so viele Parameter hat.
In Benchmarktests zeigte Florence-2 bemerkenswerte Leistungen bei Aufgaben wie der COCO-Bildbeschriftung und dem Verständnis referierender Ausdrücke. Bei Aufgaben zur Objekterkennung und Segmentierung auf dem COCO-Datensatz übertraf es Modelle wie PolyFormer und UNINEXT. Damit ist es eine äußerst konkurrenzfähige Wahl für reale Anwendungen, bei denen sowohl Leistung als auch Ressourceneffizienz entscheidend sind.
Einsatzgebiete von Florence-2#
Florence-2 kann in vielen verschiedenen Branchen eingesetzt werden, etwa in den Bereichen Unterhaltung, Barrierefreiheit und Bildung. Sehen wir uns einige Beispiele an, um das besser zu verstehen.
Einsatzgebiete der Bildbeschriftung#
Wenn du auf einer Streamingplattform entscheiden möchtest, was du ansehen willst, liest du vielleicht eine Zusammenfassung des Films, um deine Wahl zu treffen. Was wäre, wenn die Plattform zusätzlich eine ausführliche Beschreibung des Filmplakats bereitstellen könnte? Florence-2 macht das mit Bildbeschriftung möglich, bei der beschreibender Text für Bilder erzeugt wird. Florence-2 kann detaillierte Beschreibungen von Filmplakaten erstellen und Streamingplattformen dadurch für Menschen mit Sehbehinderungen zugänglicher machen. Durch die Analyse visueller Elemente eines Plakats, etwa Figuren, Umgebung und Text, kann Florence-2 ausführliche Beschreibungen erstellen, die Inhalt und Stimmung des Plakats vermitteln. Das folgende Bild zeigt, wie detailliert die von Florence-2 erzeugten Beschreibungen sein können.

Abb. 4: Beispiel einer von Florence-2 erzeugten Bildbeschriftung.
Hier sind einige weitere Beispiele, bei denen Bildbeschriftung hilfreich sein kann:
- E-Commerce: Bildbeschriftungen können detaillierte Beschreibungen von Produktbildern liefern und Kunden dabei helfen, Produktmerkmale und -details besser zu verstehen.
- Reisen und Tourismus: Das Modell kann in Reiseführern und Apps detaillierte Beschreibungen von Sehenswürdigkeiten und Attraktionen bereitstellen.
- Bildung: Bildbeschriftungen können Lernbilder und Diagramme beschriften und beschreiben und dadurch Lehren und Lernen unterstützen.
- Immobilien: Das Modell kann detaillierte Beschreibungen von Immobilienbildern liefern, die Merkmale und Ausstattungsdetails für potenzielle Käufer hervorheben.
Visuelles Grounding beim Kochen einsetzen#
Florence-2 kann auch kulinarische Erlebnisse bereichern. So könnte ein Online-Kochbuch Florence-2 nutzen, um Teile eines komplexen Rezeptbildes visuell zuzuordnen und zu beschriften. Visuelles Grounding hilft dabei, indem bestimmte Bildbereiche mit den entsprechenden beschreibenden Texten verknüpft werden. Jede Zutat und jeder Schritt können präzise beschriftet und erklärt werden. Dadurch können Hobbyköche dem Rezept leichter folgen und die Rolle der einzelnen Bestandteile im Gericht verstehen.

Abb. 5: Beispiel für visuelles Grounding mit Florence-2.
Regionsbasierte OCR für Finanzdokumente#
OCR mit regionsbasierter Verarbeitung, bei der Text aus bestimmten Bereichen eines Dokuments extrahiert wird, kann in Bereichen wie dem Rechnungswesen hilfreich sein. Bestimmte Bereiche von Finanzdokumenten können analysiert werden, um wichtige Informationen wie Transaktionsdetails, Kontonummern und Fälligkeitstermine automatisch zu extrahieren. Da die manuelle Dateneingabe reduziert wird, sinkt die Fehlerquote und die Verarbeitungszeit verkürzt sich. Finanzinstitute können damit Aufgaben wie die Rechnungsverarbeitung, den Abgleich von Belegen und die Scheckverrechnung optimieren, was zu schnelleren Transaktionen und einem besseren Kundenservice führt.

Abb. 6: Beispiel für die Extraktion von OCR aus Regionen mit Florence-2.
Regionsbasierte Segmentierung in industriellen Anwendungen#
Regionsbasierte Segmentierung, bei der ein Bild für eine gezielte Analyse und detaillierte Prüfung in sinnvolle Bereiche unterteilt wird, kann industrielle Anwendungen unterstützen, die Präzision und Effizienz in verschiedenen Prozessen verbessern. Durch die Fokussierung auf bestimmte Bildbereiche ermöglicht diese Technologie eine detaillierte Prüfung und Analyse von Komponenten und Produkten. In der Qualitätskontrolle kann sie Fehler oder Unregelmäßigkeiten in Materialien erkennen, etwa Risse oder Fehlstellungen, und so sicherstellen, dass nur Produkte höchster Qualität auf den Markt gelangen.

Abb. 7: Beispiel für eine regionsbasierte Segmentierung mit Florence-2.
Die Technologie verbessert außerdem automatisierte Montagelinien, indem sie robotische Greifarme zu bestimmten Teilen führt und die Platzierung und Montage von Komponenten optimiert. Ebenso hilft sie bei der Bestandsverwaltung, den Zustand und Standort von Waren zu verfolgen und zu überwachen, was zu einer effizienteren Logistik und weniger Ausfallzeiten führt. Insgesamt steigert die regionsbasierte Segmentierung die Genauigkeit und Produktivität und ermöglicht dadurch Kosteneinsparungen sowie eine höhere Produktqualität in industriellen Umgebungen.
Wichtige Erkenntnisse#
Wir beobachten zunehmend, dass KI-Modelle leichter werden und dabei eine hohe Leistung beibehalten. Florence-2 stellt einen bedeutenden Fortschritt bei visuellen Sprachmodellen dar. Das Modell kann Aufgaben wie Objekterkennung, Segmentierung, Bildbeschriftung und Grounding mit beeindruckender Zero-Shot-Leistung bewältigen. Trotz seiner geringeren Größe ist Florence-2 effizient und vielseitig, wodurch es sich besonders für Anwendungen in verschiedenen Branchen eignet. Modelle wie Florence-2 eröffnen neue Möglichkeiten und erweitern das Potenzial für Innovationen im Bereich der KI.
Erfahre mehr über KI, indem du unser GitHub-Repository besuchst und unserer Community beitrittst. Auf unseren Lösungsseiten erfährst du mehr über KI-Anwendungen in der Fertigung und Landwirtschaft. 🚀









