Ultralytics YOLO27:
Vision-KI

Florence-2: Microsofts neuestes Vision-Language-Modell

Lerne Florence-2 kennen, Microsofts Vision-Language-Modell, das eine verbesserte Objekterkennung, Segmentierung und Zero-Shot-Leistung bei hoher Effizienz bietet.

ABAbirami Vina7 min read
Florence-2, Microsofts Vision-Language-Modell

Im Juni 2024 stellte Microsoft Florence-2 vor, ein multimodales visuelles Sprachmodell (VLM), das für eine Vielzahl von Aufgaben wie Objekterkennung, Segmentierung, Bildbeschriftung und Grounding ausgelegt ist. Florence-2 setzt einen neuen Maßstab für die Zero-Shot-Leistung, das heißt, es kann Aufgaben ohne vorheriges spezifisches Training ausführen, und ist kleiner als andere hochmoderne visuelle Sprachmodelle.

Florence-2 ist mehr als nur ein weiteres Modell: Seine Vielseitigkeit und verbesserte Leistung können verschiedene Branchen erheblich beeinflussen, indem sie die Genauigkeit steigern und den Bedarf an umfangreichem Training reduzieren. In diesem Artikel untersuchen wir die innovativen Funktionen von Florence-2, vergleichen seine Leistung mit anderen VLMs und erörtern seine möglichen Einsatzgebiete.

Was ist Florence-2?#

Florence-2 kann eine Vielzahl von Aufgaben innerhalb eines einheitlichen Frameworks bearbeiten. Die beeindruckenden Fähigkeiten des Modells sind teilweise seinem umfangreichen Trainingsdatensatz FLD-5B zu verdanken. FLD-5B umfasst 5,4 Milliarden Annotationen zu 126 Millionen Bildern. Dieser umfassende Datensatz wurde speziell erstellt, um Florence-2 die für eine präzise und effiziente Bearbeitung verschiedenster Bildverarbeitungsaufgaben erforderlichen Fähigkeiten zu vermitteln.

Hier siehst du die von Florence-2 unterstützten Aufgaben im Überblick:

  • Objekterkennung: Das Modell kann Objekte in Bildern mit hoher Präzision erkennen und lokalisieren.
  • Segmentierung: Bei dieser Aufgabe wird ein Bild in sinnvolle Segmente unterteilt, um die Analyse und Interpretation zu erleichtern.
  • Bildbeschriftung: Florence-2 kann beschreibende Bildunterschriften erzeugen, die Kontext und Details zu Bildern liefern.
  • Visuelles Grounding: Das Modell kann bestimmte Ausdrücke oder Wörter in einer Bildunterschrift den entsprechenden Bereichen im Bild zuordnen.
  • Zero-Shot-Leistung: Das Modell kann Aufgaben ohne spezifisches Training ausführen.

Diagramm zum Training von Florence-2

Abb. 1: So wurde Florence-2 trainiert.

Das Modell unterstützt sowohl textbasierte als auch regionsbasierte Aufgaben. Für Aufgaben, die bestimmte Bildbereiche betreffen, werden spezielle Ortstoken zum Vokabular des Modells hinzugefügt. Diese Token helfen dem Modell, verschiedene Formen zu verstehen, etwa Rechtecke um Objekte (Darstellung durch Boxen), viereckige Formen (Darstellung durch Quad-Boxen) und Vielecke (Darstellung durch Polygone). Das Modell wird mit einer Methode namens Kreuzentropieverlust trainiert. Dabei lernt es, indem es seine Vorhersagen mit den korrekten Antworten vergleicht und seine internen Parameter entsprechend anpasst.

Erstellung des Datensatzes FLD-5B#

Der Datensatz FLD-5B umfasst verschiedene Annotationstypen: Textbeschreibungen, Paare aus Regionen und Text sowie Kombinationen aus Text, Ausdrücken und Regionen. Er wurde in einem zweistufigen Verfahren erstellt, das Datensammlung und Annotation umfasste. Die Bilder stammen aus bekannten Datensätzen wie ImageNet-22k, Object 365, Open Images, Conceptual Captions und LAION. Die Annotationen im Datensatz FLD-5B sind größtenteils synthetisch, das heißt, sie wurden automatisch statt manuell erstellt.

Diagramm zur Erstellung des Datensatzes FLD-5B

Abb. 2: Erstellung des Datensatzes FLD-5B.

Zunächst erstellten auf bestimmte Aufgaben spezialisierte Modelle, etwa für Objekterkennung oder Segmentierung, diese Annotationen. Anschließend wurde ein Filterungs- und Verbesserungsprozess eingesetzt, um sicherzustellen, dass die Annotationen detailliert und präzise waren. Nachdem Rauschen entfernt worden war, wurde der Datensatz iterativ verfeinert. Dabei wurden die Ausgaben von Florence-2 kontinuierlich genutzt, um die Annotationen zu aktualisieren und zu verbessern.

Die Modellarchitektur von Florence-2 verstehen#

Die Modellarchitektur von Florence-2 basiert auf einem Sequence-to-Sequence-Lernansatz. Das bedeutet, dass das Modell eine Eingabesequenz (etwa ein Bild mit einer Textaufforderung) verarbeitet und schrittweise eine Ausgabesequenz (etwa eine Beschreibung oder ein Label) erzeugt. Im Sequence-to-Sequence-Framework wird jede Aufgabe als Übersetzungsproblem behandelt: Das Modell erhält ein Eingabebild und eine aufgabenspezifische Aufforderung und erzeugt die entsprechende Ausgabe.

Diagramm der Architektur des visuellen Sprachmodells Florence-2

Abb. 3: Architektur des visuellen Sprachmodells Florence-2.

Im Zentrum der Modellarchitektur steht ein multimodaler Encoder-Decoder-Transformer, der einen Bild-Encoder und einen multimodalen Encoder-Decoder kombiniert. Der Bild-Encoder namens DaViT (dateneffizienter visueller Transformer) verarbeitet Eingabebilder, indem er sie in visuelle Token-Embeddings umwandelt – kompakte Darstellungen des Bildes, die sowohl räumliche Informationen (wo sich Dinge befinden) als auch semantische Informationen (was Dinge sind) erfassen. Diese visuellen Token werden anschließend mit Text-Embeddings (Darstellungen des Textes) kombiniert, sodass das Modell Text- und Bilddaten nahtlos zusammenführen kann.

Vergleich von Florence-2 mit anderen VLMs#

Florence-2 hebt sich durch seine beeindruckenden Zero-Shot-Fähigkeiten von anderen visuellen Sprachmodellen ab. Anders als Modelle wie PaliGemma, die auf umfangreiches Fine-Tuning angewiesen sind, um sich an verschiedene Aufgaben anzupassen, funktioniert Florence-2 direkt nach der Bereitstellung gut. Außerdem kann Florence-2 mit größeren Modellen wie GPT-4V und Flamingo konkurrieren, die häufig deutlich mehr Parameter besitzen, aber nicht immer die Leistung von Florence-2 erreichen. Florence-2 erzielt beispielsweise bessere Zero-Shot-Ergebnisse als Kosmos-2, obwohl Kosmos-2 mehr als doppelt so viele Parameter hat.

In Benchmarktests zeigte Florence-2 bemerkenswerte Leistungen bei Aufgaben wie der COCO-Bildbeschriftung und dem Verständnis referierender Ausdrücke. Bei Aufgaben zur Objekterkennung und Segmentierung auf dem COCO-Datensatz übertraf es Modelle wie PolyFormer und UNINEXT. Damit ist es eine äußerst konkurrenzfähige Wahl für reale Anwendungen, bei denen sowohl Leistung als auch Ressourceneffizienz entscheidend sind.

Einsatzgebiete von Florence-2#

Florence-2 kann in vielen verschiedenen Branchen eingesetzt werden, etwa in den Bereichen Unterhaltung, Barrierefreiheit und Bildung. Sehen wir uns einige Beispiele an, um das besser zu verstehen.

Einsatzgebiete der Bildbeschriftung#

Wenn du auf einer Streamingplattform entscheiden möchtest, was du ansehen willst, liest du vielleicht eine Zusammenfassung des Films, um deine Wahl zu treffen. Was wäre, wenn die Plattform zusätzlich eine ausführliche Beschreibung des Filmplakats bereitstellen könnte? Florence-2 macht das mit Bildbeschriftung möglich, bei der beschreibender Text für Bilder erzeugt wird. Florence-2 kann detaillierte Beschreibungen von Filmplakaten erstellen und Streamingplattformen dadurch für Menschen mit Sehbehinderungen zugänglicher machen. Durch die Analyse visueller Elemente eines Plakats, etwa Figuren, Umgebung und Text, kann Florence-2 ausführliche Beschreibungen erstellen, die Inhalt und Stimmung des Plakats vermitteln. Das folgende Bild zeigt, wie detailliert die von Florence-2 erzeugten Beschreibungen sein können.

Beispiel einer von Florence-2 erzeugten Bildbeschriftung

Abb. 4: Beispiel einer von Florence-2 erzeugten Bildbeschriftung.

Hier sind einige weitere Beispiele, bei denen Bildbeschriftung hilfreich sein kann:

  • E-Commerce: Bildbeschriftungen können detaillierte Beschreibungen von Produktbildern liefern und Kunden dabei helfen, Produktmerkmale und -details besser zu verstehen.
  • Reisen und Tourismus: Das Modell kann in Reiseführern und Apps detaillierte Beschreibungen von Sehenswürdigkeiten und Attraktionen bereitstellen.
  • Bildung: Bildbeschriftungen können Lernbilder und Diagramme beschriften und beschreiben und dadurch Lehren und Lernen unterstützen.
  • Immobilien: Das Modell kann detaillierte Beschreibungen von Immobilienbildern liefern, die Merkmale und Ausstattungsdetails für potenzielle Käufer hervorheben.

Visuelles Grounding beim Kochen einsetzen#

Florence-2 kann auch kulinarische Erlebnisse bereichern. So könnte ein Online-Kochbuch Florence-2 nutzen, um Teile eines komplexen Rezeptbildes visuell zuzuordnen und zu beschriften. Visuelles Grounding hilft dabei, indem bestimmte Bildbereiche mit den entsprechenden beschreibenden Texten verknüpft werden. Jede Zutat und jeder Schritt können präzise beschriftet und erklärt werden. Dadurch können Hobbyköche dem Rezept leichter folgen und die Rolle der einzelnen Bestandteile im Gericht verstehen.

Beispiel für visuelles Grounding mit Florence-2

Abb. 5: Beispiel für visuelles Grounding mit Florence-2.

Regionsbasierte OCR für Finanzdokumente#

OCR mit regionsbasierter Verarbeitung, bei der Text aus bestimmten Bereichen eines Dokuments extrahiert wird, kann in Bereichen wie dem Rechnungswesen hilfreich sein. Bestimmte Bereiche von Finanzdokumenten können analysiert werden, um wichtige Informationen wie Transaktionsdetails, Kontonummern und Fälligkeitstermine automatisch zu extrahieren. Da die manuelle Dateneingabe reduziert wird, sinkt die Fehlerquote und die Verarbeitungszeit verkürzt sich. Finanzinstitute können damit Aufgaben wie die Rechnungsverarbeitung, den Abgleich von Belegen und die Scheckverrechnung optimieren, was zu schnelleren Transaktionen und einem besseren Kundenservice führt.

Beispiel für OCR mit Regionen unter Verwendung von Florence-2

Abb. 6: Beispiel für die Extraktion von OCR aus Regionen mit Florence-2.

Regionsbasierte Segmentierung in industriellen Anwendungen#

Regionsbasierte Segmentierung, bei der ein Bild für eine gezielte Analyse und detaillierte Prüfung in sinnvolle Bereiche unterteilt wird, kann industrielle Anwendungen unterstützen, die Präzision und Effizienz in verschiedenen Prozessen verbessern. Durch die Fokussierung auf bestimmte Bildbereiche ermöglicht diese Technologie eine detaillierte Prüfung und Analyse von Komponenten und Produkten. In der Qualitätskontrolle kann sie Fehler oder Unregelmäßigkeiten in Materialien erkennen, etwa Risse oder Fehlstellungen, und so sicherstellen, dass nur Produkte höchster Qualität auf den Markt gelangen.

Beispiel für regionsbasierte Segmentierung mit Florence-2

Abb. 7: Beispiel für eine regionsbasierte Segmentierung mit Florence-2.

Die Technologie verbessert außerdem automatisierte Montagelinien, indem sie robotische Greifarme zu bestimmten Teilen führt und die Platzierung und Montage von Komponenten optimiert. Ebenso hilft sie bei der Bestandsverwaltung, den Zustand und Standort von Waren zu verfolgen und zu überwachen, was zu einer effizienteren Logistik und weniger Ausfallzeiten führt. Insgesamt steigert die regionsbasierte Segmentierung die Genauigkeit und Produktivität und ermöglicht dadurch Kosteneinsparungen sowie eine höhere Produktqualität in industriellen Umgebungen.

Wichtige Erkenntnisse#

Wir beobachten zunehmend, dass KI-Modelle leichter werden und dabei eine hohe Leistung beibehalten. Florence-2 stellt einen bedeutenden Fortschritt bei visuellen Sprachmodellen dar. Das Modell kann Aufgaben wie Objekterkennung, Segmentierung, Bildbeschriftung und Grounding mit beeindruckender Zero-Shot-Leistung bewältigen. Trotz seiner geringeren Größe ist Florence-2 effizient und vielseitig, wodurch es sich besonders für Anwendungen in verschiedenen Branchen eignet. Modelle wie Florence-2 eröffnen neue Möglichkeiten und erweitern das Potenzial für Innovationen im Bereich der KI.

Erfahre mehr über KI, indem du unser GitHub-Repository besuchst und unserer Community beitrittst. Auf unseren Lösungsseiten erfährst du mehr über KI-Anwendungen in der Fertigung und Landwirtschaft. 🚀

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens