OpenAI o1: Eine neue Reihe von OpenAI-Modellen für AI-Schlussfolgerungen
Erfahre mehr über die neu eingeführten OpenAI-o1-Modelle und was sie besonders macht. Wir betrachten außerdem ihre Funktionsweise und ihre Auswirkungen auf die Zukunft von AI.

Die KI-Community spekulierte eifrig über den nächsten Schritt für OpenAIs GPT-Modelle, wobei viele ihn als „Project Strawberry“ bezeichneten. Der Grund dafür ist, dass GPT-4o auf die Frage, wie viele R in dem Wort "strawberry" vorkommen, antwortet, dass das Wort zwei R enthält: "strawberry." Das mag angesichts der Leistungsfähigkeit von GPT-4o seltsam erscheinen. Das Modell ist jedoch darauf ausgelegt, den Subtext und nicht die exakten Wörter zu verarbeiten. Gerüchten zufolge sollte das nächste Modell dieses Problem lösen. Sam Altman heizte die Gerüchte weiter an, indem er Bilder von Erdbeeren auf seinem X-Konto (früher Twitter) veröffentlichte.
Mit OpenAIs jüngster Ankündigung vom Donnerstag, dem 12. September, haben wir endlich eine Antwort auf die Spekulationen! OpenAI o1, eine neue Reihe von KI-Modellen, die vor der Antwort langsamer arbeiten und nachdenken, wurde veröffentlicht. Interessanterweise kann OpenAI o1 besser schlussfolgern und die Frage zu Erdbeeren korrekt beantworten! In diesem Artikel besprechen wir, was OpenAI o1 ist, wie es funktioniert, wo es eingesetzt werden kann und was es für die Zukunft der KI bedeutet. Legen wir los!

Abb. 1 Ein Beispiel für eine Eingabeaufforderung an OpenAI o1 zu Erdbeeren.
Neue Fortschritte in der KI von OpenAI#
Im Juli 2024 teilten Führungskräfte von OpenAI mit, dass die Forschung von OpenAI sich einem menschlichen Niveau bei der Problemlösung nähert, das als Stufe 2 der KI bezeichnet wird. Es ist klar, dass diese Stufe den Schwerpunkt auf logisches Schlussfolgern legt, da OpenAI seine neue Modellreihe OpenAI o1 als eine Reihe vorstellt, die vor der Antwort nachdenkt. OpenAI o1 ist ein neues LLM (großes Sprachmodell), also ein KI-Modell, das menschenähnliche Texte versteht und erzeugt, indem es Muster aus riesigen Mengen an Sprachdaten lernt. Es wurde für den Umgang mit komplexen Problemen entwickelt, die tiefgehendes logisches Schlussfolgern erfordern.

Abb. 2 OpenAIs Perspektive auf die Entwicklungsstufen der KI.
Das Modell wurde durch Training mit bestärkendem Lernen trainiert, einer Technik, bei der das Modell durch Versuch und Irrtum bessere Entscheidungen trifft, indem es für seine Aktionen Belohnungen oder Strafen erhält. Der Algorithmus für bestärkendes Lernen hilft dem Modell, effektiver zu denken, indem er einer Gedankenkette folgt. OpenAI teilte außerdem mit, dass sich die Leistung von o1 durch mehr bestärkendes Lernen während des Trainings und durch mehr Zeit zum "Nachdenken" bei der Problemlösung weiter verbessert. Das zeigt, dass sowohl längeres Training als auch sorgfältige Verarbeitung die Fähigkeiten des Modells steigern.
OpenAI o1 stellt zwar einen bedeutenden Fortschritt beim logischen Schlussfolgern in komplexen Aufgaben dar, ist aber noch ein frühes Modell und verfügt nicht über einige Funktionen, die ChatGPT nützlich machen, etwa das Durchsuchen des Internets oder das Hochladen von Dateien und Bildern. Für viele alltägliche Aufgaben ist GPT-4o vorerst möglicherweise weiterhin leistungsfähiger. OpenAI o1 markiert jedoch einen großen Schritt nach vorn bei der Fähigkeit der KI, komplexe Schlussfolgerungen zu bewältigen. Deshalb startet OpenAI eine neue Reihe und nennt sie OpenAI o1.
Wie die neuen OpenAI-Modelle das logische Schlussfolgern in der KI verbessern#
OpenAI o1 kann für Aufgaben wie das Entschlüsseln von Chiffren, das Lösen von Programmieraufgaben, das Beantworten mathematischer Fragen, das Lösen von Kreuzworträtseln und sogar für komplexe Themen in Wissenschaft, Sicherheit und Gesundheitswesen eingesetzt werden. In einer amüsanten Anspielung auf den Codenamen des Projekts demonstrierte OpenAI die Fähigkeiten des Modells zum logischen Schlussfolgern, indem es eine Chiffre knackte, die die Nachricht "THERE ARE THREE R’S IN STRAWBERRY." enthüllte.
Neben dem Entschlüsseln von Chiffren ist OpenAI o1 auch beim Programmieren leistungsfähig. Bei Wettbewerben wie denen auf Codeforces, einer Plattform, auf der Programmierer unter Zeitdruck komplexe Programmieraufgaben lösen, erzielt es gute Ergebnisse. In diesen Wettbewerben erreicht das Modell hohe Elo-Wertungen (ein Bewertungssystem, das anhand der Leistung im Vergleich zu anderen Teilnehmern das Fähigkeitsniveau misst) und übertrifft frühere Modelle. Auch in Mathematik ist es sehr leistungsfähig und schneidet bei Prüfungen wie der American Invitational Mathematics Examination (AIME) gut ab.

Abb. 3 Benchmarking der Programmierfähigkeiten von o1.
Diese Fortschritte machen OpenAI o1 zu einer bedeutenden Weiterentwicklung gegenüber früheren Modellen wie GPT-4o. Dadurch eröffnen sich neue Möglichkeiten für KI in Bereichen wie Geschäftswelt, Entwicklung, Forschung und Gesundheitswesen. In der Genetikforschung kann OpenAI o1 beispielsweise schnell eine große Anzahl wissenschaftlicher Arbeiten durchsuchen und wichtige Erkenntnisse sowie Zusammenhänge zwischen genetischen Markern und Krankheiten herausarbeiten. Es versteht komplexe wissenschaftliche Sprache und kann wichtige Punkte zusammenfassen, sodass sich Forschende auf die relevantesten Informationen konzentrieren können.
Die Gedankenkette im Detail#
Wie bereits erwähnt, führt OpenAI o1 einen Prozess des logischen Schlussfolgerns mittels einer "Chain of Thought" ein. Dadurch kann das Modell komplexe Probleme ähnlich wie der Mensch mithilfe kognitiver Strategien bearbeiten. Das Modell kann Herausforderungen in kleinere, überschaubare Schritte zerlegen und seinen Ansatz schrittweise verfeinern. Im Gegensatz zu früheren Modellen, die sich auf unmittelbare Mustererkennung stützten, optimiert o1 seine Entscheidungsfindung, indem es mehrere Wege des logischen Schlussfolgerns untersucht und durch bestärkendes Lernen sowohl aus Erfolgen als auch aus Fehlern lernt.
OpenAI hat beschlossen, diese unveränderten Gedankengänge vor den Nutzern verborgen zu halten und stattdessen Zusammenfassungen bereitzustellen, die Einblicke in die Schlussfolgerungen des Modells geben, ohne jeden einzelnen Schritt offenzulegen. Diese Entscheidung trägt dazu bei, einen Missbrauch des Denkprozesses des Modells zu verhindern, und ermöglicht es Entwicklern zugleich, die Sicherheit und Ausrichtung der KI zu überwachen und zu verbessern. Durch die interne Beobachtung der verborgenen Gedankengänge können Entwickler sicherstellen, dass o1 ethische Richtlinien einhält und schädliches Verhalten vermeidet.
Benchmarking von OpenAI o1#
OpenAI o1 zeigt bei mehreren Benchmarks, die Fähigkeiten zum logischen Schlussfolgern und zur Problemlösung testen, deutliche Verbesserungen gegenüber GPT-4o. Bei der American Invitational Mathematics Examination (AIME) 2024, einer anspruchsvollen Mathematikprüfung für die besten Schülerinnen und Schüler an weiterführenden Schulen, erzielte o1 mit nur einer Stichprobe pro Aufgabe eine Genauigkeit von 74 %, verglichen mit 12 % bei GPT-4o. Bei einer Konsensbildung über 64 Stichproben stieg die Genauigkeit auf 83 %, und mit einer optimierten Neubewertungsmethode und 1.000 Stichproben erreichte sie 93 %. Damit gehörte o1 zu den 500 besten Schülerinnen und Schülern des Landes.
Auch in anderen Bereichen als Mathematik erzielte o1 bei Benchmarks zum wissenschaftlichen Wissen, etwa GPQA Diamond, hervorragende Ergebnisse. Dieser Benchmark umfasst Fragen auf Doktorandenniveau in Physik, Biologie und Chemie. Bemerkenswerterweise übertraf o1 dabei menschliche Experten mit Doktortitel und war damit das erste KI-Modell, dem dies gelang. Außerdem übertraf es GPT-4o in 54 von 57 Kategorien des MMLU-Benchmarks, der das Verständnis einer vielfältigen Auswahl an Themen prüft, darunter Geschichte, Recht und Naturwissenschaften.

Abb. 4 Benchmarking von OpenAI o1.
Sammle praktische Erfahrungen mit OpenAI o1#
OpenAI hat zwei neue KI-Modelle der o1-Reihe vorgestellt: o1-preview und o1-mini. Das Modell o1-preview ist darauf ausgelegt, vor der Antwort eingehender nachzudenken, und zeichnet sich bei komplexen Aufgaben zum logischen Schlussfolgern in Wissenschaft, Programmierung und Mathematik aus. Es bietet fortschrittliche Fähigkeiten zur Problemlösung für Nutzer, die an anspruchsvollen Projekten arbeiten. Im Gegensatz dazu ist o1-mini ein kleineres, schnelleres und kostengünstigeres Modell, das speziell für das logische Schlussfolgern in MINT-Fächern, insbesondere Mathematik und Programmierung, optimiert wurde. Zwar verfügt es möglicherweise über ein weniger umfassendes Weltwissen, doch bei wichtigen Bewertungen wie dem Mathematikwettbewerb AIME und Programmierwettbewerben auf Codeforces erreicht o1-mini fast die Leistung von o1-preview – und das bei 80 % geringeren Kosten.

Abb. 5 Vergleich der OpenAI-Modelle.
Du kannst diese Modelle über verschiedene OpenAI-Plattformen ausprobieren. Nutzer von ChatGPT Plus und Team können über die Modellauswahl sowohl auf o1-preview als auch auf o1-mini zugreifen und die erweiterten Fähigkeiten zum logischen Schlussfolgern direkt in ChatGPT erleben. Entwickler mit Zugriff auf Nutzungsstufe 5 der API können mit dem Prototyping dieser Modelle beginnen, auch wenn einige fortgeschrittene Funktionen noch entwickelt werden. OpenAI plant außerdem, o1-mini bald allen Nutzern von ChatGPT Free zur Verfügung zu stellen. Indem du diese Modelle ausprobierst, kannst du die Fortschritte beim logischen Schlussfolgern in der KI selbst erleben und das Modell auswählen, das am besten zu deinen Anforderungen passt.
Ethische Überlegungen zur KI bei OpenAI#
OpenAI legte bei der Entwicklung der o1-Modellreihe großen Wert auf Ethik und Sicherheit. Vor der Veröffentlichung der Modelle o1-preview und o1-mini führte das Unternehmen gründliche Bewertungen durch, darunter externe Tests und interne Prüfungen auf Risiken wie unzulässige Inhalte, Halluzinationen und Verzerrungen. Die Modelle wurden mit fortschrittlichen Fähigkeiten zum logischen Schlussfolgern entwickelt, damit sie Sicherheitsregeln besser verstehen und befolgen können.
OpenAI hat außerdem Schutzmaßnahmen wie Sperrlisten und Sicherheitsklassifikatoren zur Steuerung von Risiken eingeführt. Das o1-Modell weist insgesamt eine mittlere Risikobewertung auf. In Bereichen wie Cybersicherheit und Modellautonomie bestehen geringe Risiken, während die Risiken in Bereichen wie CBRN-Inhalten (chemische, biologische, radiologische und nukleare Inhalte) und Überzeugung mittelhoch sind. Die Safety Advisory Group und der Vorstand von OpenAI haben diese Sicherheitsmaßnahmen überprüft, um sicherzustellen, dass das Modell sicher und ethisch vertretbar eingesetzt werden kann.

Abb. 6 Bewertungskarte von OpenAI o1.
Von Gerüchten zur Realität: OpenAI o1 betritt die Bühne#
OpenAI o1 ist ein großer Schritt nach vorn beim logischen Schlussfolgern in der KI und macht einige der frühen Gerüchte zur Realität. Anders als GPT-4o denkt die o1-Reihe mithilfe eines "Chain of Thought"-Ansatzes eingehender nach und zerlegt komplexe Probleme in kleinere Schritte, um bessere Antworten zu liefern. Derzeit ist sie als frühe Vorschauversion in ChatGPT und der API verfügbar. OpenAI plant, Funktionen wie das Durchsuchen des Internets sowie das Hochladen von Dateien und Bildern hinzuzufügen. OpenAI teilte außerdem mit, dass das Unternehmen neben der neuen o1-Reihe weiterhin Modelle der GPT-Reihe entwickeln und veröffentlichen will. Während sich die KI weiterentwickelt, ebnen Fortschritte wie diese den Weg für leistungsfähigere, intuitivere und vielseitigere KI-Systeme, die menschliche Bedürfnisse besser verstehen und unterstützen können.
Bleib über die neuesten Entwicklungen in der KI auf dem Laufenden und werde Teil unserer Community! Besuche unser GitHub-Repository, um zu sehen, wie wir KI-Lösungen in Bereichen wie Fertigung und Gesundheitswesen voranbringen. 🚀









