Die neuesten OpenAI-Updates: Canvas, Vision-Feinabstimmung und mehr
Wir werfen einen genaueren Blick auf die neuesten ChatGPT-Updates von OpenAI. Dabei geht es um Canvas, die Feinabstimmung von Vision-Funktionen und die neueste Suchfunktion.

Nachdem wir uns im September zuletzt OpenAIs o1-Modelle angesehen hatten (die zur Verbesserung der Schlussfolgerungsfähigkeit entwickelt wurden), wurden ChatGPT viele neue und spannende Funktionen hinzugefügt. Einige dieser Veröffentlichungen richten sich an Entwickler, andere dienen der Verbesserung der Benutzererfahrung. Insgesamt trägt jedes Update dazu bei, Interaktionen mit ChatGPT intuitiver und effektiver zu gestalten.
Updates wie Canvas für kollaboratives Schreiben und Programmieren sowie die Feinabstimmung der Vision-Funktionen, die verbessert, wie ChatGPT mit Bildern arbeitet, haben großes Interesse geweckt und Nutzer dazu angeregt, weitere kreative Möglichkeiten zu erkunden. Gleichzeitig adressieren technische Verbesserungen wie neue APIs und Berichte zu Fairness-Tests Aspekte wie die Integration von Modellen und Praktiken für ethische KI. Sehen wir uns die neuesten ChatGPT-Funktionen von OpenAI genauer an!
Ein Überblick über die Canvas-Funktion von OpenAI#
Canvas ist das erste größere Update der ChatGPT-Benutzeroberfläche (UI) seit der Veröffentlichung. Es handelt sich um eine neue Oberfläche mit einem zweigeteilten Bildschirm: Eingabeaufforderungen werden in der linken Seitenleiste und Antworten im rechten Fenster angezeigt. Die neue UI ersetzt den üblichen Arbeitsablauf mit einer chatähnlichen Struktur auf einem einzigen Bildschirm durch eine zweigeteilte Ansicht, die sich für Multitasking eignet und die Produktivität steigert.

Abb. 1 Canvas bringt UI-Updates für ChatGPT.
Bevor Canvas eingeführt wurde, bedeutete das Arbeiten mit umfangreichen Dokumenten in ChatGPT, dass man häufig nach oben und unten scrollen musste. In der neuen Ansicht werden Eingabeaufforderungen in der linken Seitenleiste angezeigt, während das Textdokument oder der Code den größten Teil des Bildschirms einnimmt. Bei Bedarf kannst du sogar die Größe der linken Seitenleiste und des Ausgabebereichs anpassen. Außerdem kannst du einen Textabschnitt oder einen Codebereich auswählen und gezielt bearbeiten, ohne das gesamte Dokument zu verändern.

Abb. 2 Bestimmte Textabschnitte mit Canvas bearbeiten.
Wenn du Canvas verwendest, wirst du feststellen, dass es in der ChatGPT-Oberfläche keine spezielle Schaltfläche und keinen Umschalter zum Öffnen gibt. Stattdessen wird Canvas bei der Arbeit mit dem GPT-4o-Modell automatisch geöffnet, wenn erkannt wird, dass du bearbeitest, schreibst oder programmierst. Bei einfacheren Eingabeaufforderungen bleibt die Funktion inaktiv. Wenn du Canvas manuell öffnen möchtest, kannst du Eingabeaufforderungen wie „Open the Canvas“ oder „Get me the Canvas layout“ verwenden.
Derzeit befindet sich Canvas in der Betaphase und ist nur mit GPT-4o verfügbar. OpenAI hat jedoch angekündigt, dass Canvas nach Ende der Betaphase allen kostenlosen Nutzern zur Verfügung stehen wird.
ChatGPT-API-Updates#
OpenAI hat drei neue ChatGPT-API-Updates veröffentlicht, die Effizienz, Skalierbarkeit und Vielseitigkeit verbessern sollen. Sehen wir uns jedes dieser Updates genauer an.
Destillation von Modellen#
Mit der Funktion Model Distillation über die OpenAI-APIs können Entwickler die Ausgaben fortschrittlicher Modelle wie GPT-4o oder o1-preview nutzen, um die Leistung kleinerer, kostengünstiger Modelle wie GPT-4o mini zu verbessern. Bei der Destillation von Modellen werden kleinere Modelle so trainiert, dass sie das Verhalten fortschrittlicherer Modelle nachahmen, wodurch sie sich effizienter für bestimmte Aufgaben einsetzen lassen.
Vor der Einführung dieser Funktion mussten Entwickler verschiedene Aufgaben mithilfe unterschiedlicher Tools manuell koordinieren. Dazu gehörten das Erstellen von Datensätzen, das Messen der Modellleistung und die Feinabstimmung von Modellen, was den Prozess häufig komplex und fehleranfällig machte. Das Update Model Distillation ermöglicht Entwicklern die Nutzung von Stored Completions, einem Tool, das automatisch Datensätze erzeugen kann, indem es die über die API von fortschrittlichen Modellen erzeugten Eingabe-Ausgabe-Paare erfasst und speichert.
Eine weitere Funktion von Model Distillation, Evals (derzeit in der Betaphase), hilft dabei zu messen, wie gut ein Modell abschneidet, ohne eigene Evaluierungsskripte erstellen oder separate Tools verwenden zu müssen. Mithilfe von mit Stored Completions erzeugten Datensätzen und der Leistungsbewertung mit Evals können Entwickler ihre eigenen benutzerdefinierten GPT-Modelle feinabstimmen.

Abb. 3 Mit Evals kannst du die Modellleistung messen.
Caching von Eingabeaufforderungen#
Beim Entwickeln von KI-Anwendungen, insbesondere von Chatbots, wird häufig derselbe Kontext (die Hintergrundinformationen oder der Verlauf vorheriger Unterhaltungen, die zum Verständnis der aktuellen Anfrage erforderlich sind) für mehrere API-Aufrufe wiederverwendet. Prompt Caching ermöglicht Entwicklern, kürzlich verwendete Eingabe-Tokens (Textabschnitte, die das Modell verarbeitet, um die Eingabeaufforderung zu verstehen und eine Antwort zu erzeugen) wiederzuverwenden, wodurch Kosten und Latenz reduziert werden.
Seit dem 1. Oktober wendet OpenAI Prompt Caching automatisch auf Modelle wie GPT-4o, GPT-4o mini, o1-preview und o1-mini an. Das bedeutet: Wenn Entwickler die API verwenden, um mit einem Modell anhand einer langen Eingabeaufforderung (mit mehr als 1.024 Tokens) zu interagieren, speichert das System die bereits verarbeiteten Teile.
Wenn dieselben oder ähnliche Eingabeaufforderungen erneut verwendet werden, müssen diese Teile daher nicht erneut berechnet werden. Das System speichert automatisch den längsten Teil der Eingabeaufforderung, den es zuvor verarbeitet hat. Dabei beginnt es mit 1.024 Tokens und fügt bei längeren Eingabeaufforderungen Blöcke von jeweils 128 Tokens hinzu.
Realtime API#
Die Erstellung eines Sprachassistenten umfasst in der Regel die Transkription von Audio in Text, die Verarbeitung des Textes und anschließend die Umwandlung in Audio zur Wiedergabe der Antwort. OpenAIs Realtime API soll diesen gesamten Prozess mit einer einzigen API-Anfrage abwickeln. Durch die Vereinfachung des Prozesses ermöglicht die API Echtzeitgespräche mit KI.
Ein in die Realtime API integrierter Sprachassistent kann beispielsweise auf Grundlage von Nutzeranfragen bestimmte Aktionen ausführen, etwa eine Bestellung aufgeben oder Informationen finden. Die API macht den Sprachassistenten reaktionsschneller und ermöglicht es ihm, sich schnell an die Bedürfnisse der Nutzer anzupassen. Die Realtime API wurde am 1. Oktober als öffentliche Betaversion mit sechs Stimmen verfügbar. Am 30. Oktober kamen fünf weitere Stimmen hinzu, sodass insgesamt elf Stimmen verfügbar waren.

Abb. 4 Ein Beispiel für die Verwendung der Realtime API zum Üben von Gesprächen in einer neuen Sprache.
ChatGPT für Vision-Aufgaben feinabstimmen#
Ursprünglich konnte das Vision-Sprachmodell GPT-4o nur mithilfe von reinen Textdatensätzen feinabgestimmt und angepasst werden. Mit der Veröffentlichung der API für die Feinabstimmung von Vision-Modellen können Entwickler GPT-4o nun mithilfe von Bilddatensätzen trainieren und anpassen. Seit ihrer Veröffentlichung ist die Feinabstimmung für Vision unter Entwicklern und Computer-Vision-Ingenieuren ein wichtiges Thema.
Um die Vision-Funktionen von GPT-4o feinabzustimmen, können Entwickler Bilddatensätze mit mindestens 100 und höchstens 50.000 Bildern verwenden. Nachdem sichergestellt wurde, dass der Datensatz dem von OpenAI geforderten Format entspricht, kann er auf die OpenAI-Plattform hochgeladen und das Modell für bestimmte Anwendungen feinabgestimmt werden.
Das Automatisierungsunternehmen Automat verwendete beispielsweise einen Datensatz mit Screenshots, um GPT-4o zu trainieren, damit das Modell UI-Elemente auf einem Bildschirm anhand einer Beschreibung identifizieren kann. Dies vereinfacht die robotergestützte Prozessautomatisierung (RPA), da Bots leichter mit Benutzeroberflächen interagieren können. Statt sich auf feste Koordinaten oder komplexe Regeln für Selektoren zu verlassen, kann das Modell UI-Elemente anhand einfacher Beschreibungen identifizieren. Dadurch werden Automatisierungskonfigurationen anpassungsfähiger und lassen sich bei Änderungen an Benutzeroberflächen leichter warten.

Abb. 5 Verwendung einer feinabgestimmten Version des GPT-4o-Modells zur Erkennung von UI-Elementen.
Fairness- und Verzerrungserkennung bei ChatGPT#
Ethische Bedenken im Zusammenhang mit KI-Anwendungen sind ein wichtiges Diskussionsthema, da KI immer fortschrittlicher wird. Da die Antworten von ChatGPT auf von Nutzern bereitgestellten Eingabeaufforderungen und im Internet verfügbaren Daten basieren, kann es schwierig sein, die Sprache des Modells jederzeit verantwortungsvoll zu gestalten. Berichten zufolge sind die Antworten von ChatGPT voreingenommen in Bezug auf Namen, Geschlecht und ethnische Zugehörigkeit. Um dieses Problem anzugehen, führte das interne Team von OpenAI einen Fairness-Test aus der Ich-Perspektive durch.
Namen enthalten häufig subtile Hinweise auf unsere Kultur und geografische Faktoren. In den meisten Fällen ignoriert ChatGPT die subtilen Hinweise in Namen. In einigen Fällen führen Namen, die eine ethnische Zugehörigkeit oder Kultur widerspiegeln, jedoch zu unterschiedlichen Antworten von ChatGPT; etwa 1 % dieser Antworten enthielten schädliche Sprache. Die Beseitigung von Verzerrungen und schädlicher Sprache ist eine anspruchsvolle Aufgabe für ein Sprachmodell. Indem OpenAI diese Ergebnisse öffentlich macht und die Grenzen des Modells anerkennt, hilft das Unternehmen Nutzern jedoch dabei, ihre Eingabeaufforderungen zu verfeinern und neutralere, unvoreingenommene Antworten zu erhalten.

Abb. 6 Ein Beispiel für unterschiedliche Antworten aufgrund des Namens des Nutzers.
Die ChatGPT-Suche verstehen#
Als ChatGPT erstmals veröffentlicht wurde, diskutierte die KI-Community darüber, ob es das herkömmliche Surfen im Internet ersetzen könnte. Heute verwenden viele Nutzer ChatGPT anstelle der Google-Suche.
OpenAIs neues Update, die Suchfunktion, geht noch einen Schritt weiter. Mit der Suche erzeugt ChatGPT aktuelle Antworten und fügt Links zu relevanten Quellen hinzu. Seit dem 31. Oktober steht die Suchfunktion allen ChatGPT-Plus- und Team-Nutzern zur Verfügung, wodurch ChatGPT eher wie eine KI-gestützte Suchmaschine funktioniert.

Abb. 7 Ein Beispiel für die Verwendung der neuen Suchfunktion von ChatGPT.
Der weitere Weg#
Die jüngsten Updates von ChatGPT konzentrieren sich darauf, KI nützlicher, flexibler und fairer zu machen. Die neue Canvas-Funktion hilft Nutzern, effizienter zu arbeiten, während die Feinabstimmung für Vision es Entwicklern ermöglicht, Modelle so anzupassen, dass sie visuelle Aufgaben besser bewältigen. Auch die Förderung von Fairness und die Verringerung von Verzerrungen gehören zu den wichtigsten Prioritäten, damit KI unabhängig von der jeweiligen Person für alle gut funktioniert. Ganz gleich, ob du als Entwickler Modelle feinabstimmst oder einfach die neuesten Funktionen nutzt: ChatGPT entwickelt sich weiter, um unterschiedlichsten Anforderungen gerecht zu werden. Mit Echtzeitfunktionen, visueller Integration und einem Fokus auf verantwortungsvolle Nutzung schaffen diese Updates eine vertrauenswürdigere und zuverlässigere KI-Erfahrung für alle.
Erfahre mehr über KI, indem du unser GitHub-Repository besuchst und unserer Community beitrittst. Erfahre mehr über KI-Anwendungen im Bereich autonomes Fahren und im Gesundheitswesen.









