OpenAI o1:AI推論のためのOpenAIの新しいシリーズ
新たに発表されたOpenAI o1モデルと、その特徴について紹介します。また、その仕組みとAIの未来への影響についても見ていきます。

AIコミュニティでは、次世代のOpenAIのGPTモデルについて憶測が飛び交い、多くの人がこれを「Project Strawberry」と呼んでいました。その理由は、GPT-4oにプロンプトを入力して、"strawberry"という単語にRがいくつあるか尋ねると、"strawberry"にはRが2つあると答えるためです。GPT-4oの性能を考えると、不思議に思えるかもしれません。しかし、このモデルは正確な単語ではなく、文脈や含意を処理するように構築されています。次のモデルでは、この問題の解決を目指すとうわさされていました。Sam Altmanは、自身のX(旧Twitter)アカウントにイチゴの写真を投稿し、さらにこのうわさを広めました。
9月12日木曜日のOpenAIによる最新の発表により、ついにこの憶測への答えが明らかになりました。応答する前に時間をかけて考えるよう設計された新しいAIモデルシリーズ、OpenAI o1がリリースされました。興味深いことに、OpenAI o1はより優れた推論を行い、イチゴに関する質問にも正しく答えられます。この記事では、OpenAI o1とは何か、どのように動作するのか、どこで利用できるのか、そしてAIの未来にどのような意味を持つのかを説明します。さっそく始めましょう。

図1. OpenAI o1にイチゴについてプロンプトを入力する例。
OpenAIによるAIの新たな進歩#
2024年7月、OpenAIの幹部は、OpenAIの研究が人間レベルの問題解決能力に近づいており、これをAIのレベル2と呼んでいると明らかにしました。このレベルが推論に重点を置いていることは明らかです。OpenAIは、新しいモデルシリーズであるOpenAI o1を、回答前に思考するモデルとして紹介しています。OpenAI o1は新しいLLM(大規模言語モデル)です。これは、大量の言語データからパターンを学習することで、人間らしいテキストを理解・生成するAIモデルです。深い推論を必要とする複雑な問題に対応できるよう設計されています。

図2. AIの段階に関するOpenAIの見解。
このモデルは、強化学習を用いて訓練されています。強化学習とは、行動に対して報酬またはペナルティを受けることで、試行錯誤を通じてより適切な意思決定を学習する手法です。強化学習アルゴリズムは、思考の連鎖に従うことで、モデルがより効果的に考えられるよう支援します。OpenAIは、訓練中に強化学習を増やすこと、また問題解決時に「思考」にかける時間を増やすことで、o1の性能が継続的に向上すると説明しています。これは、訓練の長期化と熟考した処理の両方がモデルの能力向上に役立つことを示しています。
OpenAI o1は複雑な推論における大きな進歩ですが、まだ初期段階のモデルであり、Web閲覧やファイル・画像のアップロードなど、ChatGPTを便利にする一部の機能を備えていません。多くの一般的なタスクでは、現時点ではGPT-4oのほうが高い能力を発揮する可能性があります。しかし、OpenAI o1は複雑な推論に対応するAIの能力を大きく前進させるものであり、そのためOpenAIは新しいシリーズを開始し、OpenAI o1と名付けています。
新しいOpenAIモデルがAI推論を強化する仕組み#
OpenAI o1は、暗号の解読、プログラミング課題の解決、数学問題への回答、クロスワードへの挑戦、さらには科学、安全性、ヘルスケアに関する複雑なテーマへの対応などに利用できます。プロジェクトのコードネームを意識したユーモラスな演出として、OpenAIは、"THERE ARE THREE R’S IN STRAWBERRY."というメッセージを明らかにする暗号を解読させ、モデルの推論能力を示しました。
暗号解読に加えて、OpenAI o1はコーディングにも優れています。プログラマーが時間制限の中で複雑なコーディング問題を解くプラットフォーム、Codeforcesのような競技プログラミング課題で高い性能を発揮します。こうした課題では、モデルは高いEloレーティング(他の競技者との対戦結果に基づいてスキルレベルを測定するスコアリングシステム)を達成し、従来のモデルを上回ります。数学にも優れており、アメリカ数学招待試験(AIME)のような試験でも高い性能を発揮します。

図3. o1のコーディング能力のベンチマーク。
これらの進歩により、OpenAI o1はGPT-4oのような従来モデルから大幅にアップグレードされたモデルとなっています。AIをビジネス、開発、研究、ヘルスケアなどの分野で活用する新たな可能性が広がります。たとえば遺伝学研究では、OpenAI o1は大量の研究論文を迅速に調べ、重要な発見や遺伝マーカーと疾患の関連性を抽出できます。複雑な科学用語を理解して重要な点を要約できるため、研究者は最も関連性の高い情報に集中できます。
思考の連鎖を詳しく見る#
先ほど見たように、OpenAI o1は「Chain of Thought」という推論プロセスを導入しています。これにより、モデルは人間の認知戦略に似た方法で複雑な問題に取り組めます。モデルは課題を小さく扱いやすい手順に分解し、アプローチを反復的に改善できます。即時のパターン認識に依存していた従来のモデルとは異なり、o1は複数の推論経路を探索し、強化学習を通じて成功と失敗の両方から学習することで、意思決定を最適化します。
OpenAIは、思考の各ステップをすべて明らかにするのではなく、モデルの推論を理解できる要約を提供する方針として、こうした生の思考の連鎖をユーザーから隠すことにしました。この判断により、モデルの思考プロセスの悪用を防ぎながら、開発者はAIの安全性とアラインメントを監視・改善できます。開発者は内部に隠された思考の連鎖を観察することで、o1が倫理ガイドラインを遵守し、有害な行動を避けることを確認できます。
OpenAI o1のベンチマーク#
OpenAI o1は、推論能力と問題解決能力を検証する複数のベンチマークで、GPT-4oを大きく上回る改善を示しています。優秀な高校生を対象とする難度の高い数学試験、2024年のアメリカ数学招待試験(AIME)では、問題ごとに1サンプルのみを使用した場合、o1の正答率は74%に達し、GPT-4oの12%を上回りました。64サンプルのコンセンサスを用いると正答率は83%に上昇し、1,000サンプルによる改良型の再ランキング手法を使うと93%に達し、全国の上位500人の生徒に相当する成績となりました。
数学に加えて、o1は、化学、物理学、生物学の博士課程レベルの問題を扱うGPQA Diamondなど、科学的知識を評価するベンチマークでも非常に優れた性能を発揮しました。注目すべきことに、o1はこのテストで博士号を持つ人間の専門家を上回り、これを達成した初のAIモデルとなりました。また、歴史、法律、科学など、多様な分野にわたる理解度を評価するMMLUベンチマークでは、57カテゴリ中54カテゴリでGPT-4oを上回りました。

図4. OpenAI o1のベンチマーク。
OpenAI o1を実際に試す#
OpenAIは、o1シリーズでo1-previewとo1-miniという2つの新しいAIモデルを導入しました。o1-previewは、応答前により深く考えるよう設計されており、科学、コーディング、数学における複雑な推論タスクで高い性能を発揮します。難しいプロジェクトに取り組むユーザーに、高度な問題解決能力を提供します。一方、o1-miniは、STEM推論、特に数学とコーディングに特化して最適化された、より小型で高速かつ費用対効果の高いモデルです。幅広い世界知識は少ない可能性がありますが、o1-miniはAIME数学競技やCodeforcesのコーディング課題など主要な評価でo1-previewにほぼ匹敵する性能を、80%低いコストで実現します。

図5. OpenAIモデルの比較。
これらのモデルは、さまざまなOpenAIプラットフォームを通じて試すことができます。ChatGPT PlusおよびTeamのユーザーは、モデルピッカーからo1-previewとo1-miniの両方にアクセスし、ChatGPT内で強化された推論能力を直接体験できます。API利用ティア5にアクセスできる開発者は、これらのモデルでプロトタイプの作成を始められますが、一部の高度な機能はまだ開発中です。OpenAIは、まもなくすべてのChatGPT Freeユーザーにo1-miniを提供する予定です。これらのモデルを試すことで、AI推論の進歩を実際に体験し、ニーズに最も適したモデルを選択できます。
OpenAIが考慮した倫理的なAI#
OpenAIは、o1モデルシリーズの開発において倫理と安全性を重視しました。o1-previewとo1-miniをリリースする前に、外部テストや、禁止コンテンツ、幻覚、バイアスなどのリスクに関する内部チェックを含む、徹底した評価を実施しました。これらのモデルは、安全ルールをより適切に理解して従えるよう、高度な推論能力を備えて設計されています。
OpenAIは、リスクを管理するために、ブロックリストや安全性分類器などの安全対策も導入しています。o1モデルの総合的なリスク評価は中程度です。サイバーセキュリティやモデルの自律性などの分野ではリスクが低く、CBRN(化学・生物・放射性物質・核)コンテンツや説得などの分野ではリスクが中程度です。OpenAIのSafety Advisory Groupと取締役会は、モデルが安全かつ倫理的に使用できることを確認するため、これらの安全対策をレビューしました。

図6. OpenAI o1のスコアカード。
うわさから現実へ:OpenAI o1が登場#
OpenAI o1はAI推論における大きな前進であり、初期のうわさの一部を現実のものにしました。GPT-4oとは異なり、o1シリーズは「Chain of Thought」アプローチを使用し、複雑な問題を小さな手順に分解することで、より深く考えて優れた回答を導きます。現在はChatGPTとAPIで初期プレビューとして利用でき、OpenAIはWeb閲覧やファイル・画像のアップロードなどの機能を追加する予定です。OpenAIは、新しいOpenAI o1シリーズと並行して、GPTシリーズのモデルの開発とリリースも継続する予定だと説明しています。AIが進化し続ける中、このような進歩は、より強力で直感的かつ多用途なAIシステムへの道を切り開き、人間のニーズをより適切に支援・理解できるようにしています。
私たちのコミュニティに参加して、AIの最新情報を追いかけましょう。GitHubリポジトリにアクセスして、製造やヘルスケアなどの分野でAIソリューションを先導する取り組みをご覧ください。🚀









