Ultralytics YOLO27:
Vision-KI

Setze Google Gemini 2.5 praktisch für Computer-Vision-Aufgaben ein

Sieh dir an, wie du Google Gemini 2.5 praktisch für Computer-Vision-Aufgaben wie Objekterkennung, Bildbeschriftung und OCR für Vision-AI-Lösungen einsetzen kannst.

ABAbirami Vina8 min read
Google Gemini 2.5 für Computer-Vision-Aufgaben einsetzen

Die Fortschritte im Bereich der künstlichen Intelligenz entwickeln sich rasant, und fast täglich sorgen neue Innovationen für Schlagzeilen. Ein solcher aktueller Durchbruch ist Gemini 2.5, das neueste multimodale Modell von Google DeepMind, das am 26. März veröffentlicht wurde. Während herkömmliche große Sprachmodelle (LLMs) aus riesigen Datenmengen lernen können, um menschenähnlichen Text zu erzeugen, geht Gemini 2.5 darüber hinaus.

Es wurde als „Denkmodell“ entwickelt, das Bilder, Audio und Videos verarbeiten kann. Es verfügt über verbesserte Fähigkeiten zum logischen Schlussfolgern und Programmieren. Interessanterweise erzielt es auch bei Computer-Vision-Aufgaben hervorragende Ergebnisse, bei denen Maschinen visuelle Daten interpretieren und analysieren, etwa bei der Objekterkennung, der Bildbeschreibung und der optischen Zeichenerkennung (OCR).

Gemini 2.5 zum Verstehen des Inhalts eines Bildes verwenden

Abb. 1. Beispiel für die Verwendung von Gemini 2.5 zum Verstehen des Inhalts eines Bildes.

In diesem Artikel führen wir dich durch eines der Notebooks von Ultralytics, mit dem du die Computer-Vision-Funktionen von Gemini 2.5 praktisch ausprobieren kannst. Außerdem werfen wir einen genaueren Blick auf die wichtigsten Funktionen von Gemini 2.5 und zeigen, wie sich damit Computer-Vision-Lösungen für reale Anwendungen entwickeln lassen. Legen wir los!

Überblick über Gemini 2.5: Funktionen und Fähigkeiten#

Die gerade veröffentlichte erste Version der Modellreihe Gemini 2.5 ist eine experimentelle Veröffentlichung von Gemini 2.5 Pro. Sie wurde dafür entwickelt, komplexe Probleme zu bearbeiten, indem sie ihre Antworten durchdenkt, bevor sie eine Antwort gibt. Dabei kommen Methoden wie bestärkendes Lernen (bei dem das Modell aus Feedback lernt) und Chain-of-Thought-Prompting (ein schrittweiser Ansatz zur Problemlösung) zum Einsatz.

Eine der wichtigsten Funktionen ist das riesige Kontextfenster, das 1 Million Token (ungefähr eine Million Wörter oder Wortbestandteile) aufnehmen kann und voraussichtlich auf 2 Millionen anwachsen wird. Dadurch kann das Modell große Informationsmengen gleichzeitig verarbeiten, was zu detaillierteren und genaueren Ergebnissen führt.

Neben der Sprachverarbeitung kann Gemini 2.5 für die folgenden Computer-Vision-Aufgaben eingesetzt werden:

  • Objekterkennung: Dabei werden Objekte in einem Bild identifiziert und lokalisiert. Sie kann beispielsweise für Überwachungssysteme oder selbstfahrende Autos eingesetzt werden.

  • Bildbeschreibung: Bei dieser Aufgabe wird ein beschreibender Text für ein Bild erzeugt. Dadurch werden visuelle Inhalte zugänglicher und leichter verständlich.

  • Optische Zeichenerkennung: Diese Technologie wandelt Text aus Bildern in bearbeitbaren, maschinenlesbaren Text um. Sie ist nützlich, um Dokumente zu digitalisieren und die Dateneingabe zu automatisieren.

Google Gemini 2.5 mit anderen Modellen vergleichen und benchmarken#

Im Bereich der künstlichen Intelligenz sind heute mehrere multimodale Modelle verfügbar. Daher ist es wichtig zu verstehen, wie Gemini 2.5 Pro im Vergleich zu ihnen abschneidet. Auf Grundlage der von Google DeepMind veröffentlichten Benchmark-Ergebnisse zeigt Gemini 2.5 Pro eine beeindruckende Leistung bei einer Vielzahl von Aufgaben.

Beim Test Humanity’s Last Exam beispielsweise, der eine anspruchsvolle Prüfung mit vielen Fachgebieten simuliert und fortgeschrittenes logisches Schlussfolgern sowie Allgemeinwissen testet, erzielt Gemini 2.5 Pro etwa 18,8 % und übertrifft damit Modelle wie OpenAI o3-mini, das ungefähr 14 % erreicht.

Überblick über die Benchmark-Leistung von Gemini 2.5 Pro

Abb. 2. Überblick über die Benchmark-Leistung von Gemini 2.5 Pro.

Auch bei mathematischen und programmierbezogenen Herausforderungen erzielt es sehr gute Ergebnisse und erreicht häufig die Leistung von Modellen wie OpenAI GPT-4.5 und Claude 3.7 Sonnet oder übertrifft sie sogar. Dasselbe gilt für Grok 3 Beta und DeepSeek R1. Dies zeigt, dass es komplexe Aufgaben bearbeiten und große Datenmengen verarbeiten kann.

Gemini 2.5 praktisch ausprobieren: So verwendest du die Google Gemini API#

Gemini 2.5 Pro ist auf mehreren Plattformen verfügbar. Du kannst es in Google AI Studio ausprobieren und über die Gemini-App für Gemini-Advanced-Nutzer darauf zugreifen. In der Ankündigung zur Veröffentlichung erwähnte Google DeepMind außerdem, dass das Modell bald in Vertex AI unterstützt werden soll. Diese Zugriffsmöglichkeiten machen es Entwicklern leicht, Gemini 2.5 Pro für reale KI-Anwendungen zu nutzen.

Wenn du jedoch die Google Gemini API verwenden, ohne aufwendige Einrichtung in wenigen Minuten loslegen und die Computer-Vision-Funktionen besser verstehen möchtest, kannst du dir das Ultralytics-Notebook ansehen. Es zeigt Aufgaben wie Objekterkennung und Bildbeschreibung mit Gemini 2.5 Pro. Sehen wir uns im Detail an, was dich im Notebook erwartet.

Inferenz mit dem Google-Gemini-2.5-Notebook einrichten#

Um mit dem Ultralytics-Notebook zu beginnen und Google Gemini 2.5 zu verwenden, musst du zunächst über Google AI Studio einen API-Schlüssel erstellen. Mit diesem Schlüssel erhältst du Zugriff auf die Gemini API und kannst das Modell verwenden.

Sobald du deinen API-Schlüssel hast, stelle sicher, dass in deiner Umgebung die erforderlichen Bibliotheken installiert sind. Dazu gehören Pakete von Ultralytics und das KI-Werkzeugpaket von Google. Dieser Schritt wird im Notebook klar beschrieben, sodass du die Anweisungen zum Einrichten deines Arbeitsbereichs problemlos befolgen kannst.

Wenn alles konfiguriert ist, kannst du dich mit der Gemini API verbinden, indem du deinen API-Schlüssel eingibst (wie unten gezeigt). Dadurch wird eine Verbindung zwischen deinem Arbeitsbereich und dem Modell hergestellt. Danach kannst du Bilder und Textanweisungen an Gemini 2.5 senden.

Im Wesentlichen kannst du dem Modell ein Bild und eine einfache Anweisung geben, etwa „Erkenne Objekte in diesem Bild“ oder „Beschreibe, was du siehst“, und es liefert die benötigten Ergebnisse zurück. Dieser unkomplizierte Ablauf macht es leicht, die Computer-Vision-Funktionen von Gemini 2.5 zu erkunden.

Objekterkennung mit Google Gemini 2.5#

Eines der wichtigsten Beispiele im Notebook ist die Objekterkennung mit Gemini 2.5 Pro. In diesem Beispiel stellst du dem Modell ein Bild und eine einfache Eingabeaufforderung zur Erkennung von Objekten bereit.

Das Modell verarbeitet das Bild und gibt für jedes gefundene Objekt Koordinaten und Bezeichnungen zurück; diese Koordinaten werden in normalisierter Form angegeben. Anschließend werden Funktionen aus dem Ultralytics-Python-Paket verwendet, um diese normalisierten Werte an die tatsächlichen Abmessungen des Bildes anzupassen und wie unten gezeigt deutliche Begrenzungsrahmen um jedes Objekt zu zeichnen.

Google Gemini 2.5 für die Objekterkennung verwenden

Abb. 3. Google Gemini 2.5 für die Objekterkennung verwenden.

Bildbeschreibung mit Gemini 2.5#

Ein weiteres interessantes Beispiel im Notebook ist die Bildbeschreibung mit Gemini 2.5 Pro. In diesem Beispiel stellst du dem Modell ein Bild und eine Eingabeaufforderung bereit, mit der es eine detaillierte Beschreibung des Bildinhalts erzeugen soll.

Das Modell analysiert anschließend den visuellen Inhalt und gibt eine häufig aus mehreren Sätzen bestehende Beschreibung zurück, die sowohl den Inhalt als auch den Kontext des Bildes erfasst. Diese Funktion ist nützlich, um die Barrierefreiheit zu verbessern, visuelle Informationen zusammenzufassen und sogar kreatives Erzählen zu unterstützen.

OCR-Genauigkeit mit Google-Gemini-Modellen verbessern#

Eine Computer-Vision-Aufgabe, bei der die Fähigkeit von Gemini 2.5 Pro zum Lesen von Text in Bildern zum Einsatz kommt, ist OCR. Im Notebook kannst du dem Modell ein Bild mit Text und eine Eingabeaufforderung zum Extrahieren dieses Textes bereitstellen. Das Modell verarbeitet das Bild und gibt sowohl den erkannten Text als auch die Koordinaten der Textposition zurück, wie unten gezeigt.

Anschließend werden Funktionen aus dem Ultralytics-Python-Paket verwendet, um diese normalisierten Koordinaten in die tatsächlichen Abmessungen des Bildes umzuwandeln und Begrenzungsrahmen um die Textbereiche zu zeichnen. Die annotierte Ausgabe zeigt deutlich, wo sich der Text befindet. Das ist nützlich, um Dokumente zu digitalisieren, die Dateneingabe zu automatisieren und die Barrierefreiheit zu verbessern.

Textdaten in einem Bild mit Google Gemini 2.5 extrahieren

Abb. 4. Textdaten in einem Bild mit Google Gemini 2.5 extrahieren.

Praktische Anwendungen von Google Gemini 2.5#

Nachdem wir durchgegangen sind, wie Google Gemini 2.5 Pro für verschiedene Computer-Vision-Aufgaben eingesetzt werden kann, sehen wir uns nun einige praktische Anwendungen an, in denen diese Fähigkeiten genutzt werden können.

Die Fähigkeit von Gemini 2.5 Pro zur Objekterkennung kann beispielsweise dabei helfen, große Bildbestände automatisch zu beschriften und zu organisieren, wodurch Aufgaben wie die Erstellung von Datensätzen oder die Inhaltsverwaltung deutlich schneller werden. Außerdem kann das Modell Bilder in Bereichen wie Einzelhandel und Landwirtschaft analysieren, etwa um Produkte in Regalen zu erkennen oder Anzeichen von Pflanzenstress auf landwirtschaftlichen Aufnahmen zu identifizieren.

Gemini 2.5 Pro analysiert den Gesundheitszustand einer Pflanze

Abb. 5. Gemini 2.5 Pro analysiert den Gesundheitszustand einer Pflanze.

Die Bildbeschreibungsfunktion des Modells kann Menschen mit Sehbehinderungen helfen, den Inhalt eines Bildes zu verstehen. Wenn du beispielsweise ein Foto einer belebten Straße hast, könnte das Modell eine detaillierte Beschreibung der Szene erzeugen, in der es die Fahrzeugtypen, die Aktivitäten der Fußgänger und sogar die Tageszeit anhand der Lichtverhältnisse nennt.

Darüber hinaus kann die OCR-Funktion von Gemini 2.5 in zahlreichen Anwendungen eingesetzt werden. Du kannst beispielsweise gedruckte Dokumente digitalisieren, indem du Seiten oder Quittungen scannst. Diese Fähigkeit eignet sich ideal zur Automatisierung der Dateneingabe, zur Verarbeitung von Formularen oder sogar zum Lesen von Text auf Visitenkarten und Schildern.

Insgesamt eröffnet Google Gemini 2.5 Pro den Zugang zu einer großen Bandbreite praktischer KI-Anwendungen.

Wichtige Erkenntnisse#

Google Gemini 2.5 Pro kann nicht nur Text erzeugen und analysieren, sondern auch für Computer-Vision-Aufgaben wie Objekterkennung, Bildbeschreibung und OCR eingesetzt werden. Dank seines großen Kontextfensters und seiner verbesserten Fähigkeiten zum logischen Schlussfolgern erzeugt es detaillierte, kontextbezogene Ergebnisse, die sich gut für reale Szenarien eignen.

Während sich KI-Modelle weiterentwickeln, erleichtern Werkzeuge wie Gemini 2.5 Pro die Lösung komplexer Probleme in verschiedensten Branchen. Wahrscheinlich werden wir eine noch breitere Einführung von KI erleben, da immer mehr Organisationen nach flexiblen, multimodalen Lösungen suchen, die eine große Bandbreite an Aufgaben bewältigen können – vom visuellen Verständnis bis zur Sprachverarbeitung.

Werde Teil unserer Community und informiere dich in unserem GitHub-Repository über wegweisende KI-Projekte. Entdecke auf unseren Lösungsseiten die Anwendungen von Vision AI in der Landwirtschaft und die Rolle von KI in der Fertigung. Sieh dir unsere Lizenzmodelle an und entwickle noch heute Computer-Vision-Lösungen!

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens