OpenAIのGPT-4o Miniの機能についての詳細解説
GPT-4o Miniの機能とアプリケーションを探求しましょう。OpenAIの最新で最もコスト効率の高いこのモデルは、GPT-3.5 Turboより60%安価でありながら高度なAI機能を提供します。

2024年5月にOpenAIは GPT-4o をリリースしましたが、わずか3か月後の現在、別の印象的なモデルであるGPT-4o Miniとともに戻ってきました。2024年7月18日、OpenAIは GPT-4o Mini を発表しました。彼らはこれを「最もコスト効率の高いモデル」と呼んでいます!GPT-4o Miniは、これまでのモデルの機能を基盤として構築されたコンパクトなモデルであり、高度なAIをより身近で手頃な価格にすることを目指しています。
GPT-4o Miniは現在 テキストとビジョンのインタラクション をサポートしており、今後のアップデートでは画像、動画、音声の処理機能が追加される予定です。この記事では、GPT-4o Miniとは何か、その優れた機能、使用方法、GPT-4とGPT-4o Miniの違い、そしてさまざまなコンピュータービジョンのユースケースでどのように使用できるかを探ります。それでは早速、GPT-4o Miniの提供内容を見ていきましょう!
GPT-4o Miniとは?#
GPT-4o Miniは、コスト効率とアクセシビリティを高めるように設計された、OpenAIのAIモデルラインナップへの最新の追加です。これはマルチモーダルな 大規模言語モデル (LLM) であり、テキスト、画像、動画、音声などのさまざまなタイプのデータを処理および生成できることを意味します。このモデルは、GPT-4やGPT-4oなどの従来モデルの強みを活かし、コンパクトなパッケージで強力な機能を提供します。
GPT-4o MiniはGPT-3.5 Turboよりも60%安価で、100万入力トークン(モデルが処理するテキストやデータの単位)あたり15セント、100万出力トークン(モデルが応答として生成する単位)あたり60セントのコストです。これを具体的に説明すると、100万トークンはテキスト約2,500ページ分を処理する量に相当します。128Kトークンのコンテキストウィンドウと、リクエストごとに最大16Kの出力トークンを処理できる機能を備えたGPT-4o Miniは、効率的かつ手頃な価格になるよう設計されています。

図1. GPT-4o MiniはGPT-3.5 Turboより60%安価です。
GPT-4o Miniの主な機能#
GPT-4o Miniは、さまざまなアプリケーションに最適なオプションとなる一連のタスクをサポートしています。複数のAPIの呼び出し、コードベース全体や会話履歴などの膨大なデータの処理、カスタマーサポートチャットボット での迅速なリアルタイム応答の提供など、複数の操作を同時に実行する場合に使用できます。
その他の主な機能は以下の通りです。
- 更新された知識ベース: このモデルには2023年10月までの情報が含まれています。
- 改良されたトークナイザー: GPT-4o Miniは、英語以外のテキスト処理をより費用対効果の高いものにします。
- 堅牢な安全対策: これらの対策には、有害なコンテンツのフィルタリングや、プロンプトインジェクションやシステム操作などのセキュリティ問題からの保護が含まれます。
GPT-4o Miniを使い始める#
ChatGPTインターフェイスを通じてGPT-4o Miniを試すことができます。Free、Plus、Teamのユーザーがアクセスでき、以下に示すようにGPT-3.5に置き換わります。Enterprise ユーザーも、すべての人にAIの恩恵をもたらすというOpenAIの目的に沿って、まもなくアクセスできるようになります。GPT-4o Miniは、その機能をアプリケーションに統合したい開発者向けにAPI経由でも利用できます。現在、ビジョン機能はAPI経由でのみアクセス可能です。

Fig 2. Models Options Within ChatGPT.
GPT-4oとGPT-4o Miniの違い#
GPT-4oとGPT-4o Miniはどちらも、様々なベンチマークで素晴らしいパフォーマンスを発揮します。一般的にGPT-4oの方がGPT-4o Miniを上回りますが、GPT-4o Miniは日常的なタスクにおいて依然として費用対効果の高いソリューションです。ベンチマークには、推論タスク、数学とコーディングの習熟度、マルチモーダル推論が含まれます。以下の画像に示すように、GPT-4o Miniは他の人気モデルと比較しても非常に高いスコアを記録しています。

Fig 3. Comparing GPT-4o Mini With Other Popular Models.
GPT-4oとGPT-4o Miniを実際に試す#
オンラインで議論されている興味深いプロンプトには、人気のあるLLMが小数点を比較する 際の誤りがあります。GPT-4oとGPT-4o Miniをテストしたところ、それらの推論能力に明確な違いが見られました。次の画像では、両方のモデルに9.11と9.9のどちらが大きいかを尋ね、その理由を説明させました。

図4. GPT-4oとGPT-4o Miniのテスト。
両モデルとも最初は誤った回答をし、9.11の方が大きいと主張します。しかし、GPT-4oは推論を経て正しい答えにたどり着き、9.9の方が大きいと述べます。詳細な説明を提供し、小数値を正確に比較しています。対照的に、GPT-4o Miniは、9.9の方が大きい理由を正しく導き出せたにもかかわらず、頑固に最初の誤った回答を維持します。
どちらのモデルも強力な推論能力を示しています。GPT-4oの自己修正能力は、より複雑なタスクにおいて優れており有用です。GPT-4o Miniは適応力は劣るものの、単純なタスクに対しては依然として明確かつ正確な推論を提供します。
GPT-4o Miniを様々なコンピュータビジョンのユースケースに使用する#
コードに踏み込むことなくGPT-4o Miniのビジョン機能を探索したい場合は、OpenAI Playground でAPIを簡単にテストできます。GPT-4o Miniがさまざまなコンピュータービジョン関連のユースケースをどれほどうまく処理できるかを確認するために、実際に試してみました。
GPT-4o Miniを使用した画像分類#
GPT-4o Miniに 2つの画像を分類する ように依頼しました。1つは蝶、もう1つは地図の画像です。AIモデルは蝶と地図を正常に識別しました。画像が大きく異ることを考えると、これはかなり簡単なタスクです。

図5. GPT-4o Miniを使用した画像分類。
さらに2つの画像、つまり植物の上で休んでいる蝶の画像と、地面で休んでいる蝶の画像を入力しました。AIはまたしても素晴らしい働きをし、植物の上にいる蝶と地面にいる蝶を正しく見つけました。そこで、さらにもう一段階進めてみました。

図6. GPT-4o Miniを使用した類似画像の分類。
次に、GPT-4o Miniに2つの画像を分類するように依頼しました。1つはスワンプ・ミルクウィードの花の蜜を吸っている蝶、もう1つはジニアの花の蜜を吸っている蝶の画像です。モデルが追加のファインチューニングなしでこれほど具体的なラベルを分類できたことは驚きです。これらの簡単な例は、GPT-4o Miniがカスタムトレーニングを必要とせずに 画像分類 タスクに使用できる可能性があることを示しています。

図7. GPT-4o Miniを使用した詳細画像の分類。
GPT-4o Miniを使用した姿勢の理解#
現在、物体検出 や インスタンスセグメンテーション などのコンピュータービジョンタスクは、GPT-4o Miniでは処理できません。GPT-4oは精度に苦戦しますが、そのようなタスクに使用できます。これに関連して、ポーズの理解 に関しては、画像内のポーズを検出または推定することはできませんが、ポーズを分類して理解することは可能です。

図8. GPT-4o Miniを使用した画像内の姿勢の理解。
上の画像は、ポーズの正確な座標を検出または推定できないにもかかわらず、GPT-4o Miniがポーズを分類して理解できることを示しています。これはさまざまなアプリケーションで役立ちます。たとえば、スポーツ分析 では、アスリートの動きを大まかに評価し、怪我の予防に役立ちます。同様に、理学療法 では、リハビリテーション中に患者が正しい動きを行っていることを確認するために、エクササイズのモニタリングを支援できます。また、監視 においても、一般的なボディランゲージを分析することで 不審な行動の特定 に役立ちます。GPT-4o Miniは特定のキーポイントを検出することはできませんが、一般的なポーズを分類する能力があるため、これらやその他の分野で有用です。
GPT-4o Miniが適しているアプリケーション#
GPT-4o Miniで何ができるかを見てきました。次に、GPT-4o Miniの使用が最適となるアプリケーションについて説明しましょう。
GPT-4o Miniは、高度な自然言語理解を必要とし、計算フットプリントが小さいアプリケーションに最適です。通常であればコストが高すぎるようなアプリケーションにAIを統合することを可能にします。実際、Artificial Analysis による詳細な分析によると、GPT-4o Miniは他のほとんどのモデルと比較して、驚異的な速さで高品質な応答を提供します。

Fig 9. Quality Vs. Output Speed of GPT-4o Mini.
将来的に活躍が期待される 主要な分野 は以下の通りです:
- バーチャルアシスタントとチャットボット: GPT-4o Miniは、迅速かつスマートな応答を提供し、ユーザーのやり取りを改善できます。
- 教育ツール: このモデルを使用して、パーソナライズされた指導やコンテンツ生成 を提供するツールを構築できます。
- 生産性向上ツール: ドキュメントの要約、メールの下書き、言語の翻訳などの タスクを改善 し、効率を高めることができます。
- 言語翻訳: 最新バージョンのGPTは、異なる言語間でのより良いコミュニケーションのために、正確でリアルタイムの言語翻訳を提供する翻訳エンジンの開発に使用できます。
GPT-4o Miniが開く新しい扉#
GPT-4o Miniは、マルチモーダルAIの未来に新たな可能性を生み出しています。GPT-3モデルであるtext-davinci-003がリリースされた2022年以来、トークンあたりのコストとして知られる各テキストやデータの処理費用は、99%近くまで大幅に減少しました。コストの減少は、高度なAIをより手頃な価格にするという明確な傾向を示しています。AIモデルが進化し続けるにつれ、あらゆるアプリやウェブサイトにAIを統合することが経済的に現実的になる可能性が高まっています!
AIを実際に体験してみたいですか?GitHubリポジトリ にアクセスして私たちのイノベーションを確認し、活発な コミュニティ に参加してください。製造業 および 農業 におけるAIの応用に関する詳細については、ソリューションページをご覧ください。






