YOLO Vision 2026:
Vision-KI

Arbeite praktisch mit Google Gemini 2.5 für Computer-Vision-Aufgaben

Erfahre, wie du praktisch mit Google Gemini 2.5 für Computer-Vision-Aufgaben wie Objekterkennung, Bildbeschriftung und OCR für Vision-AI-Lösungen arbeiten kannst.

ABAbirami Vina5 min read
Verwendung von Google Gemini 2.5 für Computer-Vision-Aufgaben

KI-Fortschritte entwickeln sich rasant, und fast täglich machen neue Innovationen Schlagzeilen. Ein solcher aktueller Durchbruch ist Gemini 2.5, das neueste multimodale Modell von Google DeepMind, das am 26. März auf den Markt kam. Während traditionelle Large Language Models (LLMs) aus riesigen Datenmengen lernen können, um menschenähnlichen Text zu generieren, geht Gemini 2.5 noch einen Schritt weiter.

Es ist als „Denkmodell“ konzipiert, das Bilder, Audio und Video verarbeiten kann. Es verfügt über verbesserte Argumentations- und Programmierfähigkeiten. Interessanterweise schneidet es auch bei computer vision tasks hervorragend ab, bei denen Maschinen visuelle Daten interpretieren und analysieren, wie etwa Objekterkennung, Bildbeschriftung und optische Zeichenerkennung (OCR).

Using Gemini 2.5 to understand the contents of an image

Abb. 1. Ein Beispiel für die Verwendung von Gemini 2.5, um die Inhalte eines Bildes zu verstehen.

In diesem Artikel gehen wir eines der Notebooks von Ultralytics durch, mit dem du praktische Erfahrungen mit den computer vision-Funktionen von Gemini 2.5 sammeln kannst. Wir schauen uns auch die Hauptmerkmale von Gemini 2.5 genauer an und zeigen, wie es zur Erstellung von computer vision solutions für reale Anwendungen genutzt werden kann. Fangen wir an!

Überblick über Gemini 2.5: Funktionen und Fähigkeiten#

Die erste Version der Gemini 2.5-Modellreihe, die gerade veröffentlicht wurde, ist eine experimentelle Version von Gemini 2.5 Pro. Sie ist darauf ausgelegt, komplexe Probleme zu bewältigen, indem sie ihre Antworten durchdenkt, bevor sie ein Ergebnis liefert. Dabei werden Methoden wie Reinforcement Learning (bei dem das Modell aus Feedback lernt) und Chain-of-Thought-Prompting (ein schrittweiser Ansatz zur Problemlösung) eingesetzt.

Eine der wichtigsten Funktionen ist das riesige Kontextfenster, das 1 Million Token (etwa eine Million Wörter oder Wortteile) aufnehmen kann und voraussichtlich auf 2 Millionen wachsen wird. Das bedeutet, dass das Modell eine große Menge an Informationen auf einmal verarbeiten kann, was zu detaillierteren und genaueren Ergebnissen führt.

Neben der Sprachverarbeitung kann Gemini 2.5 für die folgenden Computer-Vision-Aufgaben eingesetzt werden:

  • Object detection: Dies ist der Prozess des Identifizierens und Lokalisierens von Objekten innerhalb eines Bildes. Es kann in Anwendungen wie Überwachung oder selbstfahrenden Autos eingesetzt werden.

  • Bildbeschreibung: Diese Aufgabe beinhaltet die Generierung eines beschreibenden Textes für ein Bild. Sie macht visuelle Inhalte zugänglicher und leichter verständlich.

  • Optical character recognition: Diese Technologie konvertiert Text in Bildern in bearbeitbaren, maschinenlesbaren Text. Sie ist nützlich für die Digitalisierung von Dokumenten und die Automatisierung der Dateneingabe.

Benchmarking und Vergleich von Google Gemini 2.5 mit anderen Modellen#

Es gibt heute mehrere multimodale Modelle im KI-Bereich, daher ist es wichtig zu verstehen, wie Gemini 2.5 Pro im Vergleich zu diesen abschneidet. Basierend auf den von Google DeepMind geteilten Benchmark-Ergebnissen zeigt Gemini 2.5 Pro eine beeindruckende Leistung bei einer Vielzahl von Aufgaben.

Zum Beispiel erzielt Gemini 2.5 Pro bei einem Test namens „Humanity’s Last Exam“, der eine anspruchsvolle Prüfung zu vielen Themenbereichen simuliert und fortgeschrittenes logisches Denken sowie Allgemeinwissen abfragt, etwa 18,8 % und übertrifft damit Modelle wie das o3-mini von OpenAI, das bei etwa 14 % liegt.

An overview of Gemini 2.5 Pro's benchmark performance

Fig 2. Eine Übersicht über die Benchmark-Leistung von Gemini 2.5 Pro.

Es schneidet auch bei Mathematik- und Programmierherausforderungen sehr gut ab, wobei es die Leistung von Modellen wie OpenAI GPT-4.5, Claude 3.7 Sonnet, Grok 3 Beta und DeepSeek R1 oft erreicht oder übertrifft, was seine Fähigkeit unter Beweis stellt, komplexe Aufgaben zu bewältigen und große Datenmengen zu verarbeiten.

Praktische Erfahrung mit Gemini 2.5: So nutzt du die Google Gemini API#

Gemini 2.5 Pro ist auf mehreren Plattformen verfügbar. Du kannst in Google AI Studio damit experimentieren und über die Gemini App für Gemini Advanced-Nutzer darauf zugreifen. In seiner Ankündigung erwähnte Google DeepMind zudem, dass das Modell bald auf Vertex AI unterstützt wird. Diese Zugangspunkte erleichtern es Entwicklern, Gemini 2.5 Pro für reale KI-Anwendungen zu nutzen.

Wenn du jedoch die Google Gemini API nutzen und in nur wenigen Minuten ohne komplizierte Einrichtung loslegen möchtest und ein besseres Verständnis seiner computer vision-Funktionen erlangen willst, kannst du dir das Ultralytics notebook ansehen, das Aufgaben wie Objekterkennung und Bildbeschriftung mit Gemini 2.5 Pro demonstriert. Gehen wir im Detail durch, was dich im Notebook erwartet.

Einrichten der Inferenz mit dem Google Gemini 2.5 Notebook#

Um mit dem Ultralytics notebook zu beginnen und Google Gemini 2.5 zu nutzen, musst du zunächst über Google AI Studio einen API-Schlüssel generieren. Dieser Schlüssel gibt dir Zugriff auf die Gemini API, damit du das Modell verwenden kannst.

Sobald du deinen API-Schlüssel hast, stelle sicher, dass in deiner Umgebung die erforderlichen Bibliotheken installiert sind – dazu gehören Pakete von Ultralytics und dem KI-Toolkit von Google. Dieser Schritt wird im Notebook klar dargelegt, sodass du den Anweisungen zur Einrichtung deines Arbeitsbereichs problemlos folgen kannst.

Sobald alles konfiguriert ist, kannst du eine Verbindung zur Gemini API herstellen, indem du deinen API-Schlüssel eingibst (wie unten gezeigt), wodurch eine Verknüpfung zwischen deiner Arbeitsumgebung und dem Modell entsteht. Danach bist du bereit, Bilder und Text-Prompts an Gemini 2.5 zu senden.

Im Grunde kannst du ein Bild und eine einfache Anweisung (wie „erkenne Objekte in diesem Bild“ oder „beschreibe, was du siehst“) an das Modell geben, und es liefert die gewünschten Ergebnisse. Dieser unkomplizierte Prozess macht es einfach, die Computer-Vision-Fähigkeiten von Gemini 2.5 zu erkunden.

Objekterkennung mit Google Gemini 2.5#

Eines der Hauptbeispiele im Notebook ist die Objekterkennung mit Gemini 2.5 Pro. In diesem Beispiel gibst du dem Modell ein Bild und einen einfachen Prompt, um Objekte zu erkennen.

Das Modell verarbeitet das Bild und gibt einen Satz von Koordinaten und Labels für jedes gefundene Objekt zurück; diese Koordinaten werden in normalisierter Form angegeben. Funktionen aus dem Ultralytics Python package werden dann verwendet, um diese normalisierten Werte in die tatsächlichen Dimensionen des Bildes umzuwandeln und klare Bounding Boxes um jedes Objekt zu zeichnen, wie unten gezeigt.

Using Google Gemini 2.5 for object detection

Abb. 3. Verwendung von Google Gemini 2.5 zur Objekterkennung.

Bildbeschreibung mit Gemini 2.5#

Ein weiteres interessantes Beispiel im Notebook ist die image captioning mit Gemini 2.5 Pro. In diesem Beispiel gibst du dem Modell ein Bild und einen Prompt, in dem es aufgefordert wird, eine detaillierte Bildunterschrift zu generieren, die beschreibt, was auf dem Bild zu sehen ist.

Das Modell analysiert dann den visuellen Inhalt und gibt eine Erzählung zurück, die oft aus mehreren Sätzen besteht und sowohl den Inhalt als auch den Kontext des Bildes erfasst. Diese Funktion ist nützlich, um die Barrierefreiheit zu verbessern, visuelle Informationen zusammenzufassen und sogar kreatives Storytelling zu unterstützen.

Verbesserung der OCR-Genauigkeit mit Google Gemini Modellen#

Eine Computer-Vision-Aufgabe, die die Fähigkeit von Gemini 2.5 Pro nutzt, Text in Bildern zu lesen, ist OCR. Im Notebook kannst du dem Modell ein Bild mit Text zusammen mit einem Prompt geben, um diesen Text zu extrahieren. Das Modell verarbeitet das Bild und liefert sowohl den erkannten Text als auch die Koordinaten, an denen sich der Text befindet, wie unten dargestellt.

Funktionen aus dem Ultralytics Python package werden dann verwendet, um diese normalisierten Koordinaten in die tatsächlichen Dimensionen des Bildes umzuwandeln und bounding boxes um die Textregionen zu zeichnen. Diese annotierte Ausgabe verdeutlicht, wo sich der Text befindet, was nützlich ist für die Digitalisierung von Dokumenten, die Automatisierung der Dateneingabe und die Verbesserung der Barrierefreiheit.

Extracting textual data in an image using Google Gemini 2.5

Abb. 4. Extrahieren von Textdaten aus einem Bild mit Google Gemini 2.5.

Reale Anwendungen von Google Gemini 2.5#

Nachdem wir nun durchgegangen sind, wie Google Gemini 2.5 Pro für verschiedene Computer-Vision-Aufgaben eingesetzt werden kann, lass uns einige reale Anwendungen erkunden, in denen diese Fähigkeiten zum Einsatz kommen.

Die Objekterkennungsfähigkeit von Gemini 2.5 Pro kann beispielsweise dabei helfen, große Bildmengen automatisch zu beschriften und zu organisieren, wodurch Aufgaben wie die Erstellung von dataset oder das Content-Management viel schneller von der Hand gehen. Sie kann auch zur Analyse von Bildern in Bereichen wie Einzelhandel und Landwirtschaft eingesetzt werden – zum Beispiel beim Erkennen von Produkten in Regalen oder beim Identifizieren von Anzeichen von Pflanzenstress auf Fotos von Bauernhöfen.

Gemini 2.5 Pro analyzing a plant's health

Abb. 5. Gemini 2.5 Pro bei der Analyse der Pflanzengesundheit.

Währenddessen kann die Bildbeschreibungsfunktion des Modells sehbehinderten Nutzern helfen, zu verstehen, was auf einem Bild zu sehen ist. Wenn du beispielsweise ein Foto einer belebten Straße hast, könnte das Modell eine Beschreibung erstellen, die die Szene im Detail erläutert und die Art der Fahrzeuge, die Aktivität der Fußgänger und basierend auf Lichtverhältnissen sogar die Tageszeit erwähnt.

Darüber hinaus kann die OCR-Funktionalität von Gemini 2.5 in einer Vielzahl von Anwendungen eingesetzt werden. Zum Beispiel kannst du gedruckte Dokumente digitalisieren, indem du Seiten oder Quittungen scannst. Diese Fähigkeit ist ideal für die Automatisierung von Dateneingabeaufgaben, die Bearbeitung von Formularen oder sogar das Lesen von Texten von Visitenkarten und Schildern.

Insgesamt eröffnet Google Gemini 2.5 Pro die Tür zu einer breiten Palette praktischer KI-Anwendungen.

Wichtige Erkenntnisse#

Über das Generieren und Analysieren von Text hinaus kann Google Gemini 2.5 Pro für Computer-Vision-Aufgaben wie Objekterkennung, Bildbeschreibung und OCR verwendet werden. Mit seinem massiven Kontextfenster und den erweiterten Argumentationsfähigkeiten liefert es detaillierte, kontextbezogene Ergebnisse, die in realen Szenarien gut funktionieren.

Da sich KI-Modelle ständig weiterentwickeln, machen Tools wie Gemini 2.5 Pro es einfacher, komplexe Probleme branchenübergreifend zu lösen. Es ist wahrscheinlich, dass wir eine noch breitere Akzeptanz von KI sehen werden, da immer mehr Organisationen nach flexiblen, multimodalen Lösungen suchen, die eine Vielzahl von Aufgaben bewältigen können, von visuellem Verständnis bis hin zur Sprachverarbeitung.

Werde Teil von our community und erfahre mehr über hochmoderne KI-Projekte auf unserem GitHub repository. Sieh dir die Anwendungen von Vision AI in agriculture und die Rolle von AI in manufacturing auf unseren Lösungsseiten an. Entdecke our licensing plans und baue noch heute computer vision solutions!

Explore solutions

Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr

Lass uns gemeinsam die Zukunft der KI bauen!

Beginne deine Reise mit der Zukunft des maschinellen Lernens