YOLO Vision 2026:
Vision-KI

Eine ausführliche Analyse der Funktionen von OpenAI GPT-4o Mini

Entdecke die Funktionen und Anwendungen von GPT-4o Mini. Das neueste und kosteneffizienteste Modell von OpenAI bietet fortschrittliche KI-Funktionen und ist 60 % günstiger als GPT-3.5 Turbo.

ABAbirami Vina6 min read
Kosteneffizientes multimodales KI-Modell OpenAI GPT-4o Mini

Im Mai 2024 veröffentlichte OpenAI GPT-4o, und nun, nur drei Monate später, sind sie mit einem weiteren beeindruckenden Modell zurück: GPT-4o Mini. Am 18. Juli 2024 stellte OpenAI GPT-4o Mini vor. Sie bezeichnen es als ihr „kosteneffizientestes Modell“! GPT-4o Mini ist ein kompaktes Modell, das auf den Fähigkeiten früherer Modelle aufbaut und fortschrittliche KI zugänglicher und erschwinglicher machen soll.

GPT-4o Mini unterstützt derzeit Interaktionen mit Text und Bildern. Künftige Aktualisierungen sollen voraussichtlich Funktionen für die Verarbeitung von Bildern, Videos und Audio ergänzen. In diesem Artikel untersuchen wir, was GPT-4o Mini ist, welche herausragenden Funktionen es bietet, wie es eingesetzt werden kann, worin die Unterschiede zwischen GPT-4 und GPT-4o Mini liegen und wie es in verschiedenen Anwendungsfällen der Computer Vision eingesetzt werden kann. Sehen wir uns an, was GPT-4o Mini zu bieten hat!

Was ist GPT-4o Mini?#

GPT-4o Mini ist die neueste Ergänzung von OpenAIs Reihe von KI-Modellen und wurde entwickelt, um kosteneffizienter und zugänglicher zu sein. Es handelt sich um ein multimodales großes Sprachmodell (LLM), das verschiedene Datentypen wie Text, Bilder, Videos und Audio verarbeiten und erzeugen kann. Das Modell baut auf den Stärken früherer Modelle wie GPT-4 und GPT-4o auf und bietet leistungsstarke Funktionen in einer kompakten Form.

GPT-4o Mini ist 60 % günstiger als GPT-3.5 Turbo und kostet 15 Cent pro einer Million Eingabetoken (Einheiten aus Text oder Daten, die das Modell verarbeitet) sowie 60 Cent pro einer Million Ausgabetoken (Einheiten, die das Modell als Antwort erzeugt). Zur Einordnung: Eine Million Token entspricht ungefähr der Verarbeitung von 2.500 Textseiten. Mit einem Kontextfenster von 128K Token und der Möglichkeit, bis zu 16K Ausgabetoken pro Anfrage zu verarbeiten, ist GPT-4o Mini sowohl effizient als auch kostengünstig ausgelegt.

GPT-4o Mini ist 60 % günstiger als GPT-3.5 Turbo

Abb. 1. GPT-4o Mini ist 60 % günstiger als GPT-3.5 Turbo.

Wichtige Funktionen von GPT-4o Mini#

GPT-4o Mini unterstützt eine Reihe von Aufgaben und eignet sich damit für zahlreiche Anwendungen. Es kann eingesetzt werden, wenn mehrere Vorgänge gleichzeitig ausgeführt werden, etwa beim Aufrufen mehrerer APIs, beim Verarbeiten großer Datenmengen wie vollständiger Codebasen oder Gesprächsverläufe sowie beim Bereitstellen schneller Antworten in Echtzeit in Chatbots für den Kundensupport.

Hier sind einige weitere wichtige Funktionen:

  • Aktualisierte Wissensbasis: Das Modell enthält Informationen bis einschließlich Oktober 2023.
  • Verbesserter Tokenizer: GPT-4o Mini verarbeitet nicht englischsprachigen Text kostengünstiger.
  • Umfassende Sicherheitsmaßnahmen: Dazu gehören das Filtern schädlicher Inhalte und der Schutz vor Sicherheitsproblemen wie Prompt-Injection und Manipulationen des Systems.

Erste Schritte mit GPT-4o Mini#

Du kannst GPT-4o Mini über die ChatGPT-Oberfläche ausprobieren. Es ist für Nutzer mit kostenlosem Zugang, Plus- und Team-Nutzer verfügbar und ersetzt wie unten dargestellt GPT-3.5. Auch Enterprise-Nutzer erhalten bald Zugriff – im Einklang mit OpenAIs Ziel, allen die Vorteile von KI zugänglich zu machen. GPT-4o Mini ist außerdem über die API für Entwickler verfügbar, die seine Funktionen in ihre Anwendungen integrieren möchten. Derzeit sind die Bildverarbeitungsfunktionen nur über die API verfügbar.

Modelloptionen in ChatGPT

Abb. 2. Modelloptionen in ChatGPT.

Der Unterschied zwischen GPT-4o und GPT-4o Mini#

GPT-4o Mini und GPT-4o erzielen in verschiedenen Benchmarks beeindruckende Ergebnisse. Obwohl GPT-4o GPT-4o Mini im Allgemeinen übertrifft, ist GPT-4o Mini für alltägliche Aufgaben dennoch eine kostengünstige Lösung. Die Benchmarks umfassen Aufgaben zum logischen Schlussfolgern, mathematische Fähigkeiten und Programmierkenntnisse sowie multimodales Schlussfolgern. Wie das folgende Bild zeigt, erzielt GPT-4o Mini im Vergleich zu anderen beliebten Modellen recht hohe Benchmark-Ergebnisse.

Vergleich von GPT-4o Mini mit anderen beliebten Modellen

Abb. 3. Vergleich von GPT-4o Mini mit anderen beliebten Modellen.

GPT-4o und GPT-4o Mini in der Praxis#

Ein interessanter, online diskutierter Prompt betrifft beliebte LLMs, die Dezimalzahlen falsch vergleichen. Als wir GPT-4o und GPT-4o Mini auf die Probe stellten, zeigten sich deutliche Unterschiede bei ihren Fähigkeiten zum logischen Schlussfolgern. Im folgenden Bild fragten wir beide Modelle, welche Zahl größer ist: 9.11 oder 9.9. Anschließend sollten sie ihre Überlegung erläutern.

Testen der Schlussfolgerungsfähigkeiten von GPT-4o und GPT-4o Mini

Abb. 4. Testen von GPT-4o und GPT-4o Mini.

Beide Modelle antworten zunächst falsch und behaupten, dass 9.11 größer sei. GPT-4o kann sich jedoch zur richtigen Antwort vorarbeiten und stellt fest, dass 9.9 größer ist. Es liefert eine detaillierte Erklärung und vergleicht die Dezimalzahlen korrekt. GPT-4o Mini hält dagegen trotz der korrekten Herleitung, warum 9.9 größer ist, hartnäckig an seiner anfänglich falschen Antwort fest.

Beide Modelle zeigen starke Fähigkeiten zum logischen Schlussfolgern. GPT-4os Fähigkeit zur Selbstkorrektur macht es überlegen und für komplexere Aufgaben nützlich. GPT-4o Mini ist zwar weniger anpassungsfähig, bietet aber auch bei einfacheren Aufgaben klare und korrekte Schlussfolgerungen.

GPT-4o Mini für verschiedene Anwendungsfälle der Computer Vision einsetzen#

Wenn du die Bildverarbeitungsfunktionen von GPT-4o Mini lieber ohne Einstieg in den Code erkunden möchtest, kannst du die API ganz einfach im OpenAI Playground testen. Wir haben es selbst ausprobiert, um zu sehen, wie gut GPT-4o Mini verschiedene Anwendungsfälle im Bereich Computer Vision bewältigt.

Bildklassifizierung mit GPT-4o Mini#

Wir haben GPT-4o Mini gebeten, zwei Bilder zu klassifizieren: eines mit einem Schmetterling und eines mit einer Karte. Das KI-Modell identifizierte sowohl den Schmetterling als auch die Karte erfolgreich. Angesichts der deutlichen Unterschiede zwischen den Bildern ist dies eine relativ einfache Aufgabe.

Klassifizierung von Bildern eines Schmetterlings und einer Karte mit GPT-4o Mini

Abb. 5. Klassifizierung von Bildern mit GPT-4o Mini.

Anschließend ließen wir zwei weitere Bilder durch das Modell laufen: eines mit einem Schmetterling, der auf einer Pflanze ruht, und eines mit einem Schmetterling, der auf dem Boden ruht. Auch diesmal leistete die KI hervorragende Arbeit und erkannte korrekt den Schmetterling auf der Pflanze und den auf dem Boden. Also gingen wir noch einen Schritt weiter.

Klassifizierung ähnlicher Schmetterlingsbilder mit GPT-4o Mini

Abb. 6. Klassifizierung ähnlicher Bilder mit GPT-4o Mini.

Anschließend baten wir GPT-4o Mini, zwei Bilder zu klassifizieren: eines mit einem Schmetterling, der sich von den Blüten einer Sumpf-Seidenpflanze ernährt, und eines mit einem Schmetterling, der sich von einer Zinnienblüte ernährt. Es ist erstaunlich, dass das Modell ein derart spezifisches Label ohne weiteres Fine-Tuning klassifizieren konnte. Diese kurzen Beispiele zeigen, dass GPT-4o Mini möglicherweise für Aufgaben der Bildklassifizierung eingesetzt werden kann, ohne dass ein individuelles Training erforderlich ist.

Klassifizierung detaillierter Schmetterlingsbilder mit GPT-4o Mini

Abb. 7. Klassifizierung detaillierter Bilder mit GPT-4o Mini.

Posen mit GPT-4o Mini verstehen#

Derzeit können Aufgaben der Computer Vision wie Objekterkennung und Instanzsegmentierung mit GPT-4o Mini nicht ausgeführt werden. GPT-4o hat bei der Genauigkeit Schwierigkeiten, kann aber für solche Aufgaben eingesetzt werden. Was das Verstehen von Posen betrifft, können wir die Pose im Bild zwar nicht erkennen oder schätzen, aber klassifizieren und verstehen.

Verwenden von GPT-4o Mini zum Verstehen der Posen in einem Bild

Abb. 8. Verwenden von GPT-4o Mini zum Verstehen der Posen in einem Bild.

Das obige Bild zeigt, wie GPT-4o Mini Posen klassifizieren und verstehen kann, obwohl es die genauen Koordinaten der Pose weder erkennen noch schätzen kann. Das kann in verschiedenen Anwendungen hilfreich sein. Beispielsweise kann es in der Sportanalyse die Bewegungen von Athleten grob bewerten und dabei helfen, Verletzungen zu vermeiden. Ebenso kann es in der Physiotherapie die Überwachung von Übungen unterstützen und sicherstellen, dass Patienten während der Rehabilitation die korrekten Bewegungen ausführen. Auch bei der Überwachung kann es durch die Analyse der allgemeinen Körpersprache dabei helfen, verdächtige Aktivitäten zu erkennen. GPT-4o Mini kann zwar keine spezifischen Schlüsselpunkte erkennen, ist durch seine Fähigkeit zur Klassifizierung allgemeiner Posen aber in diesen und anderen Bereichen nützlich.

Geeignete Anwendungen für GPT-4o Mini#

Wir haben uns angesehen, was GPT-4o Mini leisten kann. Sehen wir uns nun die Anwendungen an, für die GPT-4o Mini am besten geeignet ist.

GPT-4o Mini eignet sich hervorragend für Anwendungen, die ein fortgeschrittenes Verständnis natürlicher Sprache und einen geringen Bedarf an Rechenressourcen erfordern. Dadurch wird es möglich, KI in Anwendungen zu integrieren, für die dies normalerweise zu teuer wäre. Eine detaillierte Analyse von Artificial Analysis zeigt tatsächlich, dass GPT-4o Mini im Vergleich zu den meisten anderen Modellen hochwertige Antworten mit extrem hoher Geschwindigkeit liefert.

Qualität im Verhältnis zur Ausgabegeschwindigkeit von GPT-4o Mini

Abb. 9. Qualität im Verhältnis zur Ausgabegeschwindigkeit von GPT-4o Mini.

Hier sind einige zentrale Bereiche, in denen das Modell künftig seine Stärken ausspielen könnte:

  • Virtuelle Assistenten und Chatbots: GPT-4o Mini kann schnelle und intelligente Antworten liefern und so die Interaktion mit Nutzern verbessern.
  • Bildungswerkzeuge: Das Modell kann zum Erstellen von Werkzeugen für personalisiertes Lernen und die Generierung von Inhalten eingesetzt werden.
  • Produktivitätswerkzeuge: Es kann Aufgaben verbessern, etwa das Zusammenfassen von Dokumenten, das Verfassen von E-Mails und das Übersetzen von Sprachen, um die Effizienz zu steigern.
  • Sprachübersetzung: Die neueste GPT-Version kann zur Entwicklung von Übersetzern eingesetzt werden, die eine genaue Sprachübersetzung in Echtzeit ermöglichen und so die Kommunikation zwischen verschiedenen Sprachen verbessern.

GPT-4o Mini eröffnet neue Möglichkeiten#

GPT-4o Mini schafft neue Möglichkeiten für die Zukunft multimodaler KI. Die Kosten für die Verarbeitung jedes Text- oder Datenelements, auch als Kosten pro Token bezeichnet, sind seit 2022, als text-davinci-003, das GPT-3-Modell, veröffentlicht wurde, erheblich gesunken – um fast 99 %. Der Kostenrückgang zeigt einen klaren Trend hin zu einer erschwinglicheren fortschrittlichen KI. Da sich KI-Modelle weiter verbessern, wird es zunehmend wahrscheinlicher, dass die Integration von KI in jede App und Website wirtschaftlich sinnvoll wird!

Möchtest du praktische Erfahrungen mit KI sammeln? Besuche unser GitHub-Repository, um unsere Innovationen kennenzulernen und Teil unserer aktiven Community zu werden. Erfahre auf unseren Lösungsseiten mehr über KI-Anwendungen in der Fertigung und Landwirtschaft.

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens