Ein Deep Dive in die Fähigkeiten von OpenAIs GPT-4o Mini
Erkunde die Funktionen und Anwendungen von GPT-4o Mini. Das neueste und kosteneffizienteste Modell von OpenAI bietet fortschrittliche KI-Funktionen zu 60 % günstiger als GPT-3.5 Turbo.

Im Mai 2024 veröffentlichte OpenAI GPT-4o, und nun, nur drei Monate später, sind sie mit einem weiteren beeindruckenden Modell zurück: GPT-4o Mini. Am 18. Juli 2024 stellte OpenAI GPT-4o Mini vor. Sie nennen es ihr „kosteneffizientestes Modell“! GPT-4o Mini ist ein kompaktes Modell, das auf den Fähigkeiten vorheriger Modelle aufbaut und darauf abzielt, fortgeschrittene KI zugänglicher und erschwinglicher zu machen.
GPT-4o Mini unterstützt derzeit Text- und Vision-Interaktionen, wobei in zukünftigen Updates voraussichtlich Funktionen zur Handhabung von Bildern, Videos und Audio hinzukommen werden. In diesem Artikel untersuchen wir, was GPT-4o Mini ist, welche herausragenden Merkmale es besitzt, wie es verwendet werden kann, welche Unterschiede zwischen GPT-4 und GPT-4o Mini bestehen und wie es in verschiedenen Computer-Vision-Anwendungsfällen eingesetzt werden kann. Tauchen wir ein und sehen wir uns an, was GPT-4o Mini zu bieten hat!
Was ist GPT-4o Mini?#
GPT-4o Mini ist die neueste Ergänzung zu OpenAIs Reihe von KI-Modellen, die so konzipiert sind, dass sie kosteneffizienter und zugänglicher sind. Es ist ein multimodales Large Language Model (LLM), was bedeutet, dass es verschiedene Datentypen wie Text, Bilder, Videos und Audio verarbeiten und generieren kann. Das Modell baut auf den Stärken früherer Modelle wie GPT-4 und GPT-4o auf, um leistungsstarke Funktionen in einem kompakten Paket anzubieten.
GPT-4o Mini ist 60 % günstiger als GPT-3.5 Turbo und kostet 15 Cent pro Million Input-Token (Einheiten von Text oder Daten, die das Modell verarbeitet) und 60 Cent pro Million Output-Token (Einheiten, die das Modell als Antwort generiert). Um das ins Verhältnis zu setzen: Eine Million Token entsprechen in etwa der Verarbeitung von 2.500 Textseiten. Mit einem Kontextfenster von 128K Token und der Fähigkeit, bis zu 16K Output-Token pro Anfrage zu verarbeiten, ist GPT-4o Mini darauf ausgelegt, sowohl effizient als auch erschwinglich zu sein.

Abb. 1. GPT-4o Mini ist 60% günstiger als GPT-3.5 Turbo.
Hauptfunktionen von GPT-4o Mini#
GPT-4o Mini unterstützt eine Reihe von Aufgaben, die es zu einer großartigen Option für verschiedene Anwendungen machen. Es kann verwendet werden, wenn mehrere Vorgänge gleichzeitig ausgeführt werden, wie zum Beispiel das Aufrufen mehrerer APIs, der Umgang mit großen Datenmengen wie vollständigen Codebasen oder Gesprächsverläufen und die Bereitstellung schnelles Echtzeit-Antworten in Kundensupport-Chatbots.
Hier sind einige weitere Hauptfunktionen:
- Aktualisierte Wissensbasis: Das Modell enthält Informationen bis Oktober 2023.
- Verbesserter Tokenizer: GPT-4o Mini macht die Verarbeitung von nicht-englischsprachigem Text kostengünstiger.
- Robuste Sicherheitsmaßnahmen: Diese Maßnahmen umfassen das Filtern schädlicher Inhalte und den Schutz vor Sicherheitsproblemen wie Prompt-Injections und Systemmanipulationen.
Erste Schritte mit GPT-4o Mini#
Du kannst versuchen, GPT-4o Mini über die ChatGPT-Benutzeroberfläche zu verwenden. Es ist für Free-, Plus- und Team-Benutzer zugänglich und ersetzt GPT-3.5, wie unten gezeigt. Enterprise-Benutzer erhalten in Kürze ebenfalls Zugriff, entsprechend dem Ziel von OpenAI, alle an den Vorteilen der KI teilhaben zu lassen. GPT-4o Mini ist auch über die API für Entwickler verfügbar, die seine Funktionen in ihre Anwendungen integrieren möchten. Im Moment sind Vision-Funktionen nur über die API zugänglich.

Abb. 2 Modelloptionen in ChatGPT.
Der Unterschied zwischen GPT-4o und GPT-4o Mini#
Sowohl GPT-4o Mini als auch GPT-4o erzielen bei verschiedenen Benchmarks beeindruckende Ergebnisse. Während GPT-4o im Allgemeinen besser abschneidet als GPT-4o Mini, ist GPT-4o Mini dennoch eine kostengünstige Lösung für alltägliche Aufgaben. Die Benchmarks umfassen Schlussfolgerungsaufgaben, Mathe- und Programmierkenntnisse sowie multimodales Denken. Wie in der Abbildung unten zu sehen ist, schneidet GPT-4o Mini im Vergleich zu anderen beliebten Modellen sehr gut ab.

Abb. 3 Vergleich von GPT-4o Mini mit anderen beliebten Modellen.
Praktische Erfahrungen mit GPT-4o und GPT-4o Mini#
Ein interessanter Prompt, der online diskutiert wurde, betrifft beliebte LLMs, die Dezimalzahlen vergleichen, was zu falschen Ergebnissen führt. Als wir GPT-4o und GPT-4o Mini auf die Probe stellten, zeigten ihre Argumentationsfähigkeiten deutliche Unterschiede. Im Bild unten haben wir beide Modelle gefragt, welche Zahl größer ist: 9.11 oder 9.9, und sie dann gebeten, ihre Argumentation zu erklären.

Abb. 4. Testen von GPT-4o und GPT-4o Mini.
Beide Modelle antworten anfangs falsch und behaupten, dass 9.11 größer sei. GPT-4o schafft es jedoch, sich zur richtigen Antwort vorzuarbeiten und stellt fest, dass 9.9 größer ist. Es liefert eine detaillierte Erklärung und vergleicht die Dezimalzahlen korrekt. Im Gegensatz dazu beharrt GPT-4o Mini stur auf seiner ersten falschen Antwort, obwohl es die Überlegung dahinter, warum 9.9 größer ist, eigentlich korrekt herausgefunden hat.
Beide Modelle zeigen starke Denkfähigkeiten. Die Fähigkeit von GPT-4o, sich selbst zu korrigieren, macht es überlegen und nützlich für komplexere Aufgaben. GPT-4o Mini ist zwar weniger anpassungsfähig, bietet aber dennoch klare und genaue Schlussfolgerungen für einfachere Aufgaben.
Verwendung von GPT-4o Mini für verschiedene Computer-Vision-Anwendungsfälle#
Wenn du die Vision-Funktionen von GPT-4o Mini erkunden möchtest, ohne in den Code einzutauchen, kannst du die API ganz einfach im OpenAI Playground testen. Wir haben es selbst ausprobiert, um zu sehen, wie gut GPT-4o Mini verschiedene Computer-Vision-bezogene Anwendungsfälle bewältigen kann.
Bildklassifizierung mit GPT-4o Mini#
Wir baten GPT-4o Mini, zwei Bilder zu klassifizieren: eines von einem Schmetterling und eines von einer Landkarte. Das KI-Modell hat den Schmetterling und die Landkarte erfolgreich identifiziert. Dies ist eine recht einfache Aufgabe, da sich die Bilder stark voneinander unterscheiden.

Abb. 5. Klassifizierung von Bildern mit Hilfe von GPT-4o Mini.
Wir haben dann zwei weitere Bilder durch das Modell laufen lassen: eines, das einen Schmetterling zeigt, der auf einer Pflanze ruht, und ein weiteres, das einen Schmetterling zeigt, der auf dem Boden ruht. Die KI hat wieder großartige Arbeit geleistet und den Schmetterling auf der Pflanze sowie denjenigen auf dem Boden korrekt erkannt. Also sind wir noch einen Schritt weiter gegangen.

Abb. 6. Klassifizierung ähnlicher Bilder mit Hilfe von GPT-4o Mini.
Wir baten GPT-4o Mini daraufhin, zwei Bilder zu klassifizieren: eines, das einen Schmetterling zeigt, der sich von den Blüten einer Sumpf-Seidenpflanze ernährt, und das andere, das einen Schmetterling zeigt, der sich an einer Zinnienblüte labt. Es ist erstaunlich, dass das Modell in der Lage war, ein so spezifisches Label ohne weiteres Fine-Tuning zu klassifizieren. Diese schnellen Beispiele zeigen, dass GPT-4o Mini möglicherweise für Bildklassifizierungsaufgaben verwendet werden kann, ohne dass ein benutzerdefiniertes Training erforderlich ist.

Abb. 7. Klassifizierung detaillierter Bilder mit Hilfe von GPT-4o Mini.
Verständnis von Posen mittels GPT-4o Mini#
Stand jetzt können Computer-Vision-Aufgaben wie object detection und instance segmentation nicht mit GPT-4o Mini bewältigt werden. GPT-4o hat Schwierigkeiten mit der Genauigkeit, kann aber für solche Aufgaben verwendet werden. In diesem Sinne können wir in Bezug auf das Verstehen von Posen die Pose im Bild zwar nicht erkennen oder schätzen, aber wir können die Pose klassifizieren und verstehen.

Abb. 8. Verwendung von GPT-4o Mini zum Verständnis der Posen in einem Bild.
Das Bild oben zeigt, wie GPT-4o Mini Posen klassifizieren und verstehen kann, obwohl es nicht in der Lage ist, die genauen Koordinaten der Pose zu erkennen oder zu schätzen. Dies kann in verschiedenen Anwendungen hilfreich sein. Zum Beispiel kann es in der Sportanalytik die Bewegungen von Athleten im Großen und Ganzen bewerten und helfen, Verletzungen zu verhindern. Ähnlich kann es in der Physiotherapie dabei helfen, Übungen zu überwachen, um sicherzustellen, dass die Patienten während der Reha die korrekten Bewegungen ausführen. Auch für die Überwachung kann es helfen, verdächtige Aktivitäten zu identifizieren, indem es die allgemeine Körpersprache analysiert. Zwar kann GPT-4o Mini keine spezifischen Schlüsselpunkte erkennen, aber seine Fähigkeit, allgemeine Posen zu klassifizieren, macht es in diesen und anderen Bereichen nützlich.
Anwendungen, für die sich GPT-4o Mini eignet#
Wir haben uns angesehen, was GPT-4o Mini leisten kann. Lass uns nun die Anwendungen besprechen, bei denen es am sinnvollsten ist, GPT-4o Mini einzusetzen.
GPT-4o Mini eignet sich hervorragend für Anwendungen, die ein fortgeschrittenes natürliches Sprachverständnis erfordern und einen geringen Rechenaufwand benötigen. Es ermöglicht die Integration von KI in Anwendungen, in denen dies normalerweise zu teuer wäre. Tatsächlich zeigt eine detaillierte Analyse von Artificial Analysis, dass GPT-4o Mini im Vergleich zu den meisten anderen Modellen qualitativ hochwertige Antworten bei rasend schnellen Geschwindigkeiten liefert.

Abb. 9 Qualität vs. Ausgabegeschwindigkeit von GPT-4o Mini.
Hier sind einige Schlüsselbereiche, in denen es in Zukunft glänzen könnte:
- Virtuelle Assistenten und Chatbots: GPT-4o Mini kann schnelle und intelligente Antworten liefern, um die Benutzerinteraktion zu verbessern.
- Bildungstools: Das Modell kann verwendet werden, um Tools zu entwickeln, die personalisiertes Tutoring und die Generierung von Inhalten anbieten.
- Produktivitätstools: Es kann Aufgaben verbessern wie das Zusammenfassen von Dokumenten, das Verfassen von E-Mails und das Übersetzen von Sprachen, um die Effizienz zu steigern.
- Sprachübersetzung: Die neueste Version von GPT kann verwendet werden, um Übersetzer zu entwickeln, die genaue Echtzeit-Sprachübersetzungen für eine bessere Kommunikation in verschiedenen Sprachen bieten.
GPT-4o Mini öffnet neue Türen#
GPT-4o Mini schafft neue Möglichkeiten für die Zukunft der multimodalen KI. Die Kosten für die Verarbeitung jedes Text- oder Datenstücks, bekannt als Kosten pro Token, sind seit 2022, als text-davinci-003, das GPT-3-Modell, veröffentlicht wurde, erheblich gesunken – um fast 99 %. Der Kostenrückgang zeigt einen klaren Trend hin dazu, fortschrittliche KI erschwinglicher zu machen. Da sich KI-Modelle ständig weiterentwickeln, wird es immer wahrscheinlicher, dass die Integration von KI in jede App und Website wirtschaftlich sinnvoll sein wird!
Möchtest du selbst Hand an die KI legen? Besuche unser GitHub repository, um unsere Innovationen zu sehen und Teil unserer aktiven Community zu werden. Erfahre mehr über KI-Anwendungen in der Fertigung und in der Landwirtschaft auf unseren Lösungsseiten.






