YOLO Vision 2026:
Vision-KI

Die neuesten OpenAI-Updates: Canvas, Vision Fine-Tuning und mehr

Sei dabei, wenn wir uns die kürzlich von OpenAI veröffentlichten ChatGPT-Updates genauer ansehen. Wir erkunden Canvas, Fine-Tuning für Vision-Fähigkeiten und die neueste Suchfunktion.

ABAbirami Vina4 min read
Ein Überblick über die neuesten ChatGPT-Updates von OpenAI

Nachdem wir uns im September zuletzt die OpenAI's o1 models angesehen haben (die darauf ausgelegt sind, das logische Denken zu verbessern), wurden ChatGPT viele neue und spannende Funktionen hinzugefügt. Einige dieser Veröffentlichungen richten sich an Entwickler, während andere darauf abzielen, die Benutzererfahrung zu verbessern. Insgesamt trägt jedes Upgrade dazu bei, die Interaktionen mit ChatGPT intuitiver und effektiver zu gestalten.

Updates wie Canvas, das für kollaboratives writing and coding entwickelt wurde, und fine-tuning für vision capabilities, das die Funktionsweise von ChatGPT mit images verbessert, haben großes Interesse geweckt und die Benutzer dazu ermutigt, weitere kreative Möglichkeiten zu erkunden. Unterdessen adressieren technische Upgrades wie neue APIs und Fairness-Testberichte Aspekte wie Modell-integration und ethical AI-Praktiken. Tauchen wir ein und verschaffen wir uns ein besseres Verständnis der neuesten ChatGPT-Funktionen von OpenAI!

Ein Überblick über die Canvas-Funktion von OpenAI#

Canvas ist das erste große Update der Benutzeroberfläche (UI) von ChatGPT seit seiner Veröffentlichung. Es handelt sich um eine neue Oberfläche mit einem Zwei-Bildschirm-Layout: Prompts in der linken Seitenleiste und Antworten im rechten Fenster. Das neue UI eliminiert die übliche Arbeitsweise einer Chat-ähnlichen Einzelbildschirm-Struktur und wechselt zu einem Zwei-Bildschirm-Layout, das sich für Multitasking-Zwecke eignet, um die Produktivität zu steigern.

Canvas bringt UI-Updates zu ChatGPT

Abb. 1: Canvas bringt UI-Updates zu ChatGPT.

Bevor Canvas eingeführt wurde, bedeutete das Arbeiten mit langen documents auf ChatGPT, dass man ziemlich viel nach oben und unten scrollen musste. Im neuen Layout werden Prompts in der linken Seitenleiste angezeigt, während das Textdokument oder der code-Ausschnitt den Großteil des Bildschirms einnimmt. Bei Bedarf kannst du sogar die Größe der linken Seitenleiste und des Ausgabebildschirms anpassen. Außerdem kannst du einen Teil des Textes oder einen Code-Abschnitt auswählen und diesen spezifischen Bereich bearbeiten, ohne das gesamte Dokument zu verändern.

Bearbeiten bestimmter Textabschnitte mit Canvas

Abb. 2. Bearbeite spezifische Textabschnitte mit Canvas.

Wenn du Canvas verwendest, wirst du feststellen, dass es auf der ChatGPT-Oberfläche keine spezielle Schaltfläche oder keinen Umschalter gibt, um es zu öffnen. Wenn du stattdessen mit dem GPT-4o-Modell arbeitest, öffnet sich Canvas automatisch, sobald es erkennt, dass du editing, writing oder coding betreibst. Bei einfacheren Prompts bleibt es inaktiv. Wenn du es manuell öffnen möchtest, kannst du Prompts wie "Öffne die Canvas" oder "Gib mir das Canvas-Layout" verwenden.

Derzeit befindet sich Canvas in der Beta-Phase und ist nur mit GPT-4o verfügbar. OpenAI hat jedoch erwähnt, dass Canvas für alle kostenlosen Benutzer verfügbar sein wird, sobald es die Beta-Phase verlässt.

ChatGPTs API-Updates#

OpenAI hat drei neue ChatGPT-API-Updates veröffentlicht, die auf eine Verbesserung der Effizienz, Skalierbarkeit und Vielseitigkeit abzielen. Lass uns einen genaueren Blick auf jedes dieser Updates werfen.

Modell-Destillation#

Mit der Funktion Model Distillation über die OpenAI-APIs können Entwickler die Ausgaben von advanced models wie GPT-4o oder o1-preview nutzen, um die performance kleinerer, kosteneffizienter Modelle wie GPT-4o mini zu verbessern. Model Distillation ist ein Prozess, bei dem kleinere Modelle so trained werden, dass sie das Verhalten fortgeschrittenerer Modelle imitieren, wodurch sie für specific tasks effizienter werden.

Vor der Einführung dieser Funktion mussten Entwickler eine Vielzahl von Aufgaben manuell mit verschiedenen Tools koordinieren. Zu diesen Aufgaben gehörten das Generieren von datasets, das Messen der model performance und das fine-tuning von Modellen, was den Prozess oft komplex und fehleranfällig machte. Das Model Distillation-Update ermöglicht Entwicklern die Verwendung von Stored Completions, einem Tool, mit dem sie automatisch datasets generate können, indem sie die von fortgeschrittenen Modellen über die API erzeugten Eingabe-Ausgabe-Paare erfassen und speichern.

Eine weitere Funktion von Model Distillation, Evals (derzeit in der Beta-Phase), hilft dabei, zu messen, wie gut ein model performs bei bestimmten Aufgaben, ohne dass benutzerdefinierte evaluation-Skripte erstellt oder separate Tools verwendet werden müssen. Unter Verwendung von mit Stored Completions generated Datensätzen und der performance evaluation mit Evals können Entwickler ihre eigenen benutzerdefinierten GPT-Modelle feinabstimmen.

Verwendung von Evals zur Messung der Modellleistung

Abb. 3: Du kannst Evals verwenden, um die Modellleistung zu messen.

Prompt-Caching#

Häufig wird beim Erstellen von AI applications, insbesondere chatbots, derselbe context (die Hintergrundinformationen oder der vorherige Unterhaltungsverlauf, die zum Verständnis der aktuellen Anfrage erforderlich sind) wiederholt für mehrere API-Aufrufe verwendet. Prompt Caching ermöglicht es Entwicklern, kürzlich verwendete input tokens (Textabschnitte, die das Modell verarbeitet, um den Prompt zu verstehen und eine Antwort zu generieren) wiederzuverwenden, was dazu beiträgt, Kosten und Latenz zu reduzieren.

Seit dem 1. Oktober wendet OpenAI Prompt Caching automatisch auf Modelle wie GPT-4o, GPT-4o mini, o1-preview und o1-mini an. Das bedeutet, dass das System beim Verwenden der API zur Interaktion mit einem Modell mit einem langen prompt (über 1.024 Token) die bereits verarbeiteten Teile speichert.

Auf diese Weise kann die Neuberechnung dieser Teile übersprungen werden, wenn dieselben oder ähnliche Prompts erneut verwendet werden. Das System speichert automatisch den längsten Teil des Prompts, auf den es zuvor gestoßen ist, beginnend bei 1.024 Token und in 128-Token-Blöcken ergänzend, während der Prompt länger wird.

Realtime API#

Das Erstellen eines voice assistant erfordert im Allgemeinen die Transkription von audio to text, die Verarbeitung des Textes und die anschließende Rückumwandlung in audio to play als Antwort. Die Realtime API von OpenAI zielt darauf ab, diesen gesamten Prozess mit einer einzigen API-Anfrage zu bewältigen. Durch die Vereinfachung des Prozesses ermöglicht die API Echtzeitgespräche mit KI.

Beispielsweise kann ein in die Realtime API integrierter Sprachassistent basierend auf Benutzeranfragen bestimmte Aktionen ausführen, wie z. B. placing an order oder finding information. Die API macht den Sprachassistenten reaktionsschneller und fähig, sich schnell an die Bedürfnisse der Benutzer anzupassen. Die Realtime API wurde am 1. Oktober in einer öffentlichen Beta-Version mit sechs Stimmen verfügbar gemacht. Am 30. Oktober wurden fünf weitere Stimmen hinzugefügt, sodass insgesamt elf verfügbare Stimmen zur Verfügung stehen.

Verwendung der Realtime API zum Üben von Unterhaltungen in einer neuen Sprache

Abb. 4: Ein Beispiel für die Verwendung der Realtime API zum Üben von Unterhaltungen in einer neuen Sprache.

Fine-Tuning von ChatGPT für Vision-Aufgaben#

Ursprünglich konnte das GPT-4o Vision-Sprachmodell nur mit reinen Textdatensätzen feinabgestimmt und angepasst werden. Jetzt, mit der Veröffentlichung der Vision-Fine-Tuning-API, können Entwickler GPT-4o mithilfe von Bilddatensätzen trainieren und anpassen. Seit der Veröffentlichung ist das Vision-Fine-Tuning zu einem wichtigen Thema bei Entwicklern und Computer-Vision-Ingenieuren geworden.

Um die Vision-Fähigkeiten von GPT-4o feinabzustimmen, können Entwickler Bilddatensätze verwenden, die von nur 100 bis zu 50.000 Bildern reichen. Nachdem sichergestellt wurde, dass der Datensatz dem von OpenAI geforderten Format entspricht, kann er auf die OpenAI-Plattform hochgeladen werden und das Modell kann für spezifische Anwendungen feinabgestimmt werden.

Beispielsweise nutzte das Automatisierungsunternehmen Automat einen Screenshot-Datensatz, um GPT-4o zu train, UI-Elemente auf einem Bildschirm basierend auf einer Beschreibung zu identifizieren. Dies trägt zur Optimierung von Robotic Process Automation (RPA) bei, indem es Bots erleichtert, mit Benutzeroberflächen zu interagieren. Anstatt sich auf feste Koordinaten oder komplexe Selektorregeln zu verlassen, kann das Modell UI-Elemente anhand einfacher Beschreibungen identifizieren, wodurch Automatisierungseinrichtungen anpassungsfähiger und bei sich ändernden Schnittstellen leichter zu warten sind.

Verwendung eines feinabgestimmten GPT-4o-Modells zur Erkennung von UI-Elementen

Abb. 5: Verwendung einer feinabgestimmten Version des GPT-4o-Modells zur Erkennung von UI-Elementen.

ChatGPT-Fairness und Erkennung von Voreingenommenheit#

Ethical concerns im Zusammenhang mit AI applications sind ein prominentes Gesprächsthema, da KI immer fortgeschrittener wird. Da die Antworten von ChatGPT auf vom Benutzer bereitgestellten Prompts und im Internet verfügbaren Daten basieren, kann es eine Herausforderung sein, die Sprache so abzustimmen, dass sie stets verantwortungsbewusst ist. Berichten zufolge sind ChatGPT’s answers biased hinsichtlich Name, Geschlecht und Herkunft. Um dieses Problem anzugehen, führte das interne Team von OpenAI einen Fairness-Test aus der Ich-Perspektive durch.

Namen enthalten oft subtile Hinweise auf our culture und geografische Faktoren. In den meisten Fällen ignoriert ChatGPT diese subtilen Hinweise in den Namen. In einigen Fällen führen jedoch Namen, die Rasse oder Kultur widerspiegeln, zu unterschiedlichen Antworten von ChatGPT, wobei etwa 1 % davon harmful language widerspiegeln. Die Beseitigung von Verzerrungen und schädlicher Sprache ist eine herausfordernde Aufgabe für ein language model. Indem OpenAI diese Erkenntnisse jedoch öffentlich teilt und die Grenzen des Modells anerkennt, hilft das Unternehmen Benutzern dabei, ihre Prompts zu verfeinern, um neutralere, unvoreingenommene Antworten zu erzielen.

Ein Beispiel für abweichende ChatGPT-Antworten aufgrund des Namens des Benutzers

Abb. 6: Ein Beispiel für abweichende Antworten aufgrund des Namens des Benutzers.

ChatGPT-Suche verstehen#

Als ChatGPT erstmals eingeführt wurde, gab es in der KI-Community Diskussionen darüber, ob es das traditionelle Websurfen ersetzen könnte. Mittlerweile nutzen viele Benutzer ChatGPT anstelle der Google-Suche.

OpenAIs neues Update, die Suchfunktion, geht noch einen Schritt weiter. Mit der Suche generiert ChatGPT aktuelle Antworten und enthält Links zu relevanten Quellen. Seit dem 31. Oktober steht die Suchfunktion allen ChatGPT Plus- und Team-Benutzern zur Verfügung, wodurch ChatGPT eher wie eine KI-gestützte Suchmaschine funktioniert.

Ein Beispiel für die Nutzung der neuen Suchfunktion von ChatGPT

Abb. 7: Ein Beispiel für die Nutzung der neuen Suchfunktion von ChatGPT.

Der Weg nach vorne#

Die jüngsten Updates von ChatGPT konzentrieren sich darauf, KI nützlicher, flexibler und fairer zu machen. Die neue Canvas-Funktion hilft Benutzern, effizienter zu arbeiten, während Vision-Fine-Tuning es Entwicklern ermöglicht, Modelle anzupassen, um visuelle Aufgaben besser zu bewältigen. Die Adressierung von Fairness und die Reduzierung von Voreingenommenheit sind ebenfalls wichtige Prioritäten, um sicherzustellen, dass KI für jeden gut funktioniert, unabhängig davon, wer er ist. Egal, ob du ein Entwickler bist, der Modelle feinabstimmt, oder nur die neuesten Funktionen nutzt, ChatGPT entwickelt sich weiter, um eine breite Palette von Anforderungen zu erfüllen. Mit Echtzeit-Fähigkeiten, visueller Integration und einem Fokus auf verantwortungsvolle Nutzung schaffen diese Updates eine vertrauenswürdigere und zuverlässigere KI-Erfahrung für alle.

Erfahre mehr über KI, indem du unser GitHub repository besuchst und unserer community beitrittst. Erfahre mehr über KI-Anwendungen im Bereich self-driving und healthcare.

Explore solutions

Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr

Lass uns gemeinsam die Zukunft der KI bauen!

Beginne deine Reise mit der Zukunft des maschinellen Lernens