OpenAI o1:AI推論のための新しいOpenAIモデルシリーズ
新しく発表されたOpenAI o1モデルについて、その特長をご紹介します。また、その仕組みとAIの未来への影響についても考察します。

AIコミュニティでは、OpenAI’s GPT modelsの次なる展開についての憶測が飛び交っており、多くの人がこれを「プロジェクト・ストロベリー」と呼んでいます。その理由は、prompt GPT-4oに対して「strawberry」という単語にRがいくつ含まれているかと尋ねると、「strawberry」という単語にはRが2つ含まれていると答えるからです。GPT-4oの強力さを考えると、これは奇妙に思えるかもしれません。しかし、このモデルは正確な単語ではなく、サブテキストを処理するように構築されています。次期モデルはこの問題を解決することを目指していると噂されていました。サム・アルトマンは自身のX (formerly known as Twitter) accountにイチゴの写真を知恵袋的に投稿し、こうした噂にさらに拍車をかけました。
9月12日木曜日のOpenAI’s latest announcementにより、ついにその憶測に対する答えが得られました!応答する前に立ち止まって思考するように設計された新しいAIモデルシリーズであるOpenAI o1がリリースされました。興味深いことに、OpenAI o1はより優れた推論を行い、イチゴに関する質問に正しく答えることができます!この記事では、OpenAI o1とは何か、どのように機能するか、どこで使用できるか、そしてそれがAIの将来にとって何を意味するかについて説明します。それでは始めましょう!

Fig 1. OpenAI o1にイチゴについてプロンプトを出した例。
OpenAIによるAIの新しい進歩#
2024年7月、OpenAIの幹部は、OpenAIの研究がlevel 2 of AIと呼ばれる人間レベルの問題解決に近づいていると共有しました。OpenAIが回答の前に思考する新しいモデルシリーズとしてOpenAI o1を導入したことから、このレベルが推論に焦点を当てていることは明らかです。OpenAI o1は新しいLLM (large language model)であり、膨大な言語データからパターンを学習して人間のようなテキストを理解し生成するAIモデルです。詳細な推論を必要とする複雑な問題に対処するように設計されています。

Fig 2. AIの段階に関するOpenAIの視点。
このモデルはreinforcement learningを使用してtrainedされており、これは、行動に対して報酬や罰を受けることで試行錯誤を通じてより良い決定を下すことをモデルが学習する技術です。強化学習アルゴリズムは、思考の連鎖に従うことで、モデルがより効果的に思考するのを助けます。また、OpenAIは、トレーニング中の強化学習の増加や、問題解決中に「思考」に費やす時間の増加に伴い、o1のperformanceが向上し続けることを共有しており、拡張されたトレーニングと思慮深い処理の両方がモデルの能力を高めるのに役立つことを示しています。
OpenAI o1は複雑な推論において重要な進歩ですが、まだ初期段階のモデルであり、ウェブブラウジングやファイル・画像のアップロードなど、ChatGPTを便利にするいくつかの機能が欠けています。多くの一般的なタスクにおいては、現時点ではGPT-4oの方が能力が高いかもしれません。しかし、OpenAI o1はAIが複雑な推論を処理する能力において大きな一歩前進を示すものであり、そのためOpenAIは新シリーズとしてOpenAI o1を打ち出しました。
新しいOpenAIモデルがAIの推論を強化する方法#
OpenAI o1は、暗号の解読、プログラミングの課題の解決、数学の問題への回答、クロスワードへの取り組み、さらにはscience、safety、healthcareにおける複雑なトピックの処理などのタスクに使用できます。プロジェクトのコード名へのユーモラスなうなずきとして、OpenAIは「THERE ARE THREE R’S IN STRAWBERRY」というメッセージを明らかにする暗号を解読することで、モデルのreasoning skillsを示しました。
暗号の解読を超えて、OpenAI o1はコーディングにも長けています。プログラマーが制限時間内で複雑なコーディングの問題を解決するプラットフォームであるCodeforcesなどの競技プログラミングの課題で優れたパフォーマンスを発揮します。これらの課題において、モデルは高いイロレーティング(他の競合相手に対するパフォーマンスに基づいてスキルレベルを測定するスコアリングシステム)を達成し、以前のモデルを上回ります。また、数学にも優れており、American Invitational Mathematics Examination (AIME)などのexamsで優れた成績を収めています。

Fig 3. o1のコーディング能力のベンチマーク。
これらの進歩により、OpenAI o1はGPT-4oのような以前のモデルからの大幅なアップグレードとして位置付けられます。これにより、business、開発、research、healthcareなどの分野でAIの新しい可能性が開かれます。たとえば、genetics researchにおいて、OpenAI o1は多数の研究論文をすばやく確認し、主要な発見や遺伝子マーカーとdiseasesの間の関連性を抽出することができます。複雑な科学的言語を理解し、重要なポイントを要約できるため、研究者は最も関連性の高い情報に集中できます。
思考の連鎖の深掘り#
先ほど見たように、OpenAI o1は「思考の連鎖」推論プロセスを導入しています。これにより、モデルは人間の認知的戦略に似た方法で複雑な問題に取り組むことができます。モデルは課題をより小さく管理しやすいステップに分解し、反復的にアプローチを洗練させることができます。即時のpattern recognitionに依存していた以前のmodelsとは異なり、o1は複数の推論パスを探索し、強化学習を通じて成功と失敗の両方から学ぶことで、意思決定を最適化します。
OpenAIは、これら生の思考の連鎖をユーザーには非公開にすることを決定し、代わりに、すべてのステップを公開することなくモデルの推論への洞察を提供する要約を提供しています。この決定は、モデルの思考プロセスの悪用を防ぐのに役立つと同時に、開発者がAIの安全性とアライメントを監視および洗練させることを可能にします。開発者は隠された連鎖を内部で観察することにより、o1がethical guidelinesを遵守し、有害な行動を回避することを保証できます。
OpenAI o1のベンチマーク#
OpenAI o1は、推論能力と問題解決能力をテストするいくつかのbenchmarksにおいて、GPT-4oに比べて大幅な改善を示しています。トップ高校生向けの挑戦的な数学の試験であるAmerican Invitational Mathematics Examination (AIME) 2024では、o1は問題ごとにわずか1つのサンプルで74%の精度率を達成しました。これはGPT-4oの12%と比較して高水準です。64のサンプルにわたるコンセンサスにより、その精度は83%に向上し、1,000のサンプルを使用した洗練された再ランキング方法を使用することで93%に達し、全国の上位500人の学生に入りました。
数学を超えて、o1は化学、physics、biologyの博士号レベルの質問をカバーするGPQA Diamondなどの科学的知識をテストするベンチマークでも非常に優れたパフォーマンスを発揮しました。驚くべきことに、o1はこのテストで博士号を持つ人間の専門家を上回り、そうした最初のAIモデルとなりました。history、law、科学を含む多様な科目にわたる理解をテストするMMLUベンチマークの57カテゴリのうち54カテゴリで、GPT-4oを凌駕しました。

Fig 4. OpenAI o1のベンチマーク。
OpenAI o1を実際に体験する#
OpenAIは、o1シリーズで2つの新しいAIモデル、o1-previewとo1-miniを導入しました。o1-previewモデルは、応答する前により深く思考するように設計されており、科学、コーディング、数学における複雑な推論タスクに優れています。困難なプロジェクトに取り組むユーザーに対して、高度な問題解決能力を提供します。対照的に、o1-miniはより小型で高速かつ費用対効果の高いモデルで、STEM推論、特に数学とコーディングに特化して最適化されています。世界に関する幅広い知識は少ないかもしれませんが、o1-miniはAIME数学コンペティションやCodeforcesのコーディング課題などの主要な評価において、o1-previewのパフォーマンスにほぼ匹敵し、コストは80%削減されています。

Fig 5. OpenAIモデルの比較。
これらのモデルは、さまざまなOpenAIプラットフォームを通じて試すことができます。ChatGPT PlusおよびTeamのユーザーは、モデルピッカーからo1-previewとo1-miniの両方にアクセスし、ChatGPT内で直接、強化された推論能力を体験できます。API利用ティア5にアクセスできる開発者は、これらのモデルでプロトタイピングを開始できますが、一部の高度な機能はまだ開発中です。OpenAIはまた、o1-miniをすべてのChatGPT Freeユーザーにも間もなく提供する予定です。これらのモデルを探求することで、AI推論の進歩を直接体験し、ニーズに最も合ったモデルを選択することができます。
OpenAIが行う倫理的なAIへの配慮#
OpenAIは、o1モデルシリーズの開発においてethics and safetyに焦点を当ててきました。o1-previewおよびo1-miniモデルをリリースする前に、外部テストや、許可されていないコンテンツ、ハルシネーション、バイアスなどのリスクに関する内部チェックを含む徹底的な評価を実施しました。モデルは、安全ルールをよりよく理解して従うための高度な推論能力を備えて設計されています。
また、OpenAIはリスクを管理するために、ブロックリストや安全性分類器などの保護策を実装しています。o1モデルの中程度の全体的なリスク評価を持っています。サイバーセキュリティやモデルの自律性などの領域では低リスクであり、CBRN(化学、生物、放射性、核)コンテンツや説得などの領域では中程度のリスクを持っています。OpenAIの安全性諮問グループと取締役会は、モデルの安全で倫理的な使用を確実にするために、これらのsafety measuresをレビューしました。

Fig 6. OpenAI o1スコアカード。
噂から現実へ:OpenAI o1の登場#
OpenAI o1はAI推論における大きな前進であり、初期の噂の一部を現実に変えました。GPT-4oとは異なり、o1シリーズは「思考の連鎖」アプローチを使用することで、より深く思考し、複雑な問題をより小さなステップに分解してより良い回答を導き出します。現在、ChatGPTとAPIで早期プレビューとして利用可能であり、OpenAIはウェブブラウジングやファイル・画像のアップロードなどの機能を追加する予定です。また、OpenAIは新しいOpenAI o1シリーズに加えて、GPTシリーズのモデルの開発とリリースを継続する意向も共有しました。AIが進化し続ける中で、このような進歩は、人間のニーズをより深く理解しサポートできる、より強力で直感的かつ多機能なAIシステムへの道を切り拓いています。
our communityに参加して、AIの最新情報を入手してください!manufacturingやhealthcareなどのセクターでAIソリューションをどのように開拓しているかを確認するために、GitHub repositoryに向かってください。 🚀






