OpenAIのGPT-4oが示すAIの可能性
リアルなインタラクションを実現する高度なAIを搭載したOpenAIの新しいGPT-4oを紹介します。テクノロジーとのコミュニケーション方法を変える革新的な機能をご覧ください。

2024年5月13日(月)、OpenAIは新しいフラッグシップモデル、GPT-4oのリリースを発表しました。「o」は「omni」を意味します。GPT-4oは、リアルタイムのテキスト、音声、ビジョンによるインタラクションに対応した高度なマルチモーダルAIモデルで、より高速な処理、多言語サポート、強化された安全性を提供します。
これまでに見たことのない生成AI機能をもたらします。ChatGPTの対話能力を基盤として、GPT-4oの機能は、人々がAIをどのように捉えるかにおいて大きな前進を示しています。GPT-4oとは、まるで実在する人と話すように会話できるようになりました。GPT-4oで何ができるのか、詳しく見ていきましょう。
GPT-4oを知る#
OpenAIの春のアップデートで、GPT-4oはGPT-4と同等の知能を備えながら、より高速にデータを処理でき、テキスト、ビジョン、音声の処理能力も向上していることが明らかにされました。モデルの知能向上に重点を置いていたこれまでのリリースとは異なり、今回のリリースでは、一般のユーザーにとってAIをより使いやすくする必要性が考慮されています。

図1 OpenAIの春のアップデート
昨年末にリリースされたChatGPTの音声モードでは、音声入力の文字起こし、書面による応答の理解と生成、ユーザーが応答を聞けるようにするテキストの音声変換という処理を、3つの異なるモデルが連携して行っていました。このモードにはレイテンシの問題があり、あまり自然には感じられませんでした。GPT-4oはテキスト、ビジョン、音声を一度にネイティブ処理できるため、ユーザーは自然な会話に参加しているような感覚を得られます。
また、音声モードとは異なり、GPT-4oが話している途中でも割り込めるようになり、人間と同じように反応します。いったん話を止めて聞き、ユーザーの発言に基づいてリアルタイムで応答します。音声で感情を表現したり、ユーザーの声のトーンを理解したりすることもできます。
GPT-4oの注目機能#
GPT-4oのモデル評価から、その高度な性能がわかります。特に興味深い結果の一つは、GPT-4oがすべての言語でWhisper-v3と比べて音声認識を大幅に改善しており、特に使用頻度の低い言語でその効果が顕著だったことです。
オーディオASR(自動音声認識)の性能は、モデルが話し言葉をどれだけ正確にテキストへ文字起こしできるかを測定します。GPT-4oの性能は単語誤り率(WER)で評価されます。これは誤って文字起こしされた単語の割合を示す指標で、WERが低いほど品質が高いことを意味します。以下のグラフは、さまざまな地域におけるGPT-4oの低いWERを示しており、リソースの少ない言語の音声認識改善における有効性を示しています。

図2 GPT-4oは複数の言語で優れた音声認識を実現します。
GPT-4oのその他の独自機能をいくつか見てみましょう。
- 高速 - GPT-4 Turboの2倍の速度です。音声入力にはわずか232ミリ秒で応答でき、人間の会話における応答時間に近い速度です。
- 費用対効果 - GPT-4oのAPI版はGPT-4 Turboより50%安価です。
- メモリ - GPT-4oは、異なる会話間で会話の文脈を維持できます。複数のチャットで何について話していたかを記憶できます。
- 多言語対応 - GPT-4oは、50の異なる言語で速度と品質が向上するようにトレーニングされています。
GPT-4oでできることの例#
スマートフォンでGPT-4oを起動し、カメラをオンにして、友人に尋ねるように、顔の表情から自分の気分を推測するようGPT-4oに頼めるようになりました。GPT-4oはカメラを通してユーザーを見て、回答できます。

図3 GPT-4oが動画を通じて人の気分を理解します。
GPT-4oに動画を通じて書いている内容を見せることで、数学の問題を解く手助けをしてもらうこともできます。あるいは画面を共有すれば、以下に示すように、Khan Academyで役立つチューターとして、幾何学における三角形のさまざまな部分を指し示すよう求めることもできます。

図4 GPT-4oがKhan Academyでチューターとして機能します。
子どもの数学学習を支援するだけでなく、開発者はGPT-4oと会話しながらコードをデバッグできます。これは、ChatGPTがデスクトップアプリとして導入されたことで可能になりました。デスクトップ版GPT-4oの音声アプリで話しながら、CTRL “C”を使ってコードをハイライトしてコピーすると、コードを読み取らせることができます。また、異なる言語を話す開発者同士の会話を翻訳するために使うこともできます。
GPT-4oの可能性は無限に広がっているようです。OpenAIによる特に興味深いデモの一つでは、2台のスマートフォンを使い、GPT-4oが自身の異なるインスタンスと会話し、一緒に歌う様子が示されました。

図5 AIがAIと会話し、一緒に歌う様子。
GPT-4oのアプリケーション#
デモで示されたように、GPT-4oは視覚障害のある人々にとって、世界をより利用しやすいものにできます。より安全かつ自立して周囲と関わり、移動できるよう支援します。たとえば、ユーザーはビデオをオンにして、通りの様子をGPT-4oに見せることができます。GPT-4oは、障害物の特定、道路標識の読み取り、特定の場所への誘導など、周囲の状況をリアルタイムで説明できます。近づいてくるタクシーを知らせることで、タクシーを呼ぶことも支援できます。

図6 GPT-4oがタクシーの接近を知らせる様子。
同様に、GPT-4oは高度な機能によってさまざまな業界を変革できます。小売では、リアルタイムの支援、質問への回答、オンラインと店舗の両方での商品探しを通じて、カスタマーサービスを改善できます。商品棚を見ていて、探している商品を見つけられない場合を考えてみましょう。GPT-4oがサポートできます。
ヘルスケアでは、GPT-4oは患者データを分析し、症状に基づいて考えられる疾患を提案し、治療の選択肢について案内することで、診断を支援できます。また、患者記録の要約、医学文献への迅速なアクセス、異なる言語を話す患者とのコミュニケーションのためのリアルタイム翻訳などにより、医療従事者を支援することもできます。これらはほんの一例にすぎません。GPT-4oのアプリケーションは、ユーザーに合わせた文脈を考慮した支援を提供し、情報やコミュニケーションの障壁を取り除くことで、日常生活をより便利にします。
GPT-4oとモデルの安全性#
数億人の生活に影響を与えてきた従来のGPTモデルと同様に、GPT-4oは世界中でリアルタイムの音声やビデオを扱うことになると考えられるため、これらのアプリケーションでは安全性が重要な要素になります。OpenAIは、潜在的なリスクの軽減を重視してGPT-4oを構築するため、細心の注意を払っています。
安全性と信頼性を確保するため、OpenAIは厳格な安全対策を実施しています。これには、トレーニングデータのフィルタリング、トレーニング後のモデルの動作改善、音声出力を管理する新しい安全システムの導入が含まれます。さらに、GPT-4oは社会心理学、バイアスと公平性、偽情報などの分野における70人を超える外部専門家によって、広範にテストされています。外部テストにより、新機能によって生じたり増幅されたりするリスクを特定し、対処できます。
高い安全基準を維持するため、OpenAIは今後数週間にわたってGPT-4oの機能を段階的にリリースします。段階的な展開により、OpenAIは性能を監視し、問題に対処し、ユーザーからのフィードバックを収集できます。慎重なアプローチによって、GPT-4oは最高水準の安全性と倫理的な利用を維持しながら、高度な機能を提供できます。
GPT-4oを試してみる#
GPT-4oは無料で利用できます。上記で説明したリアルタイム会話機能を試すには、ChatGPTアプリをGoogle Play StoreまたはApple App Storeからスマートフォンに直接ダウンロードしてください。
ログイン後、画面右上の3つのドットをタップして表示されるリストからGPT-4oを選択できます。GPT-4oに対応したチャットを開いた後、画面左下のプラス記号をタップすると、複数の入力オプションが表示されます。画面右下にはヘッドフォンのアイコンがあります。ヘッドフォンのアイコンを選択すると、GPT-4oのハンズフリー版を体験するかどうかを尋ねられます。同意すると、以下に示すようにGPT-4oを試せます。

図7. ChatGPTモバイルアプリでGPT-4oを試す様子。
GPT-4oの高度な機能を独自のプロジェクトに統合したい場合、開発者向けのAPIとして利用できます。GPT-4oの強力な音声認識、多言語サポート、リアルタイムの会話機能をアプリケーションに組み込めます。APIを利用することで、ユーザー体験を向上させ、よりスマートなアプリを構築し、最先端のAIテクノロジーをさまざまな分野に導入できます。
GPT-4o:まだ完全に人間のようではない#
GPT-4oは従来のAIモデルよりはるかに高度ですが、GPT-4oには固有の制限があることを忘れてはなりません。OpenAIによると、会話中に英語からフランス語へ移るなど、ランダムに言語を切り替えることがあります。また、GPT-4oが言語間の翻訳を誤ることも確認されています。より多くの人がこのモデルを試すことで、GPT-4oが得意とすることや、さらなる改善が必要な点が明らかになるでしょう。
要点#
OpenAIのGPT-4oは、高度なテキスト、ビジョン、音声処理によってAIに新たな可能性を開き、自然で人間らしいインタラクションを実現します。速度、費用対効果、多言語サポートの面で優れています。GPT-4oは、教育、アクセシビリティ、リアルタイム支援に活用できる汎用性の高いツールです。ユーザーがGPT-4oの機能を探求する中で、フィードバックがその進化を促します。GPT-4oは、AIが真に世界を変え、私たちの日常生活の一部になりつつあることを示しています。
GitHubリポジトリを確認し、コミュニティに参加して、AIについてさらに詳しく学びましょう。ソリューションのページを訪れて、AIが製造や農業などの業界をどのように変革しているかをご覧ください。









