OpenAIのGPT-4o Miniの機能を詳しく解説
GPT-4o Miniの機能と用途をご紹介します。OpenAIの最新かつ最もコスト効率に優れたモデルで、GPT-3.5 Turboより60%低コストで高度なAI機能を提供します。

2024年5月、OpenAIはGPT-4oをリリースしました。そしてわずか3か月後、またも印象的なモデル「GPT-4o Mini」を発表しました。2024年7月18日、OpenAIはGPT-4o Miniを発表しました。同社はこれを「最もコスト効率に優れたモデル」と呼んでいます。GPT-4o Miniは、従来のモデルの機能を基盤として構築されたコンパクトなモデルであり、高度なAIをより利用しやすく、手頃な価格で提供することを目指しています。
GPT-4o Miniは現在、テキストとビジョンのインタラクションをサポートしており、今後のアップデートでは画像、動画、音声を扱う機能の追加が予定されています。この記事では、GPT-4o Miniとは何か、その主な機能、使用方法、GPT-4とGPT-4o Miniの違い、そしてさまざまなコンピュータービジョンのユースケースでの活用方法について説明します。GPT-4o Miniがどのような機能を提供するのか、詳しく見ていきましょう。
GPT-4o Miniとは何ですか?#
GPT-4o Miniは、OpenAIのAIモデルシリーズに加わった最新モデルで、よりコスト効率に優れ、利用しやすいように設計されています。これはマルチモーダルな大規模言語モデル(LLM)であり、テキスト、画像、動画、音声など、さまざまな種類のデータを処理および生成できます。このモデルは、GPT-4やGPT-4oなど従来のモデルの強みを基盤として、コンパクトなパッケージで高い性能を提供します。
GPT-4o MiniはGPT-3.5 Turboより60%安価で、入力トークン(モデルが処理するテキストやデータの単位)100万個あたり15セント、出力トークン(モデルが応答として生成する単位)100万個あたり60セントです。これを具体的に示すと、100万トークンは約2,500ページのテキスト処理に相当します。128Kトークンのコンテキストウィンドウと、リクエストあたり最大16K個の出力トークンを処理する機能を備えたGPT-4o Miniは、効率性と手頃な価格を両立するよう設計されています。

図1. GPT-4o MiniはGPT-3.5 Turboより60%安価です。
GPT-4o Miniの主な機能#
GPT-4o Miniは、さまざまなアプリケーションに適した幅広いタスクをサポートしています。複数のAPIの呼び出し、完全なコードベースや会話履歴など大量のデータの処理、カスタマーサポートチャットボットでの高速なリアルタイム応答の提供など、複数の処理を同時に実行する場合に利用できます。
その他の主な機能は次のとおりです。
- 更新された知識ベース: モデルには2023年10月までの情報が含まれています。
- 改善されたTokenizer: GPT-4o Miniでは、英語以外のテキストをより低コストで処理できます。
- 堅牢な安全対策: これには、有害なコンテンツのフィルタリングや、プロンプトインジェクションやシステム操作などのセキュリティ上の問題からの保護が含まれます。
GPT-4o Miniを始める#
GPT-4o MiniはChatGPTのインターフェースから試すことができます。無料、Plus、Teamのユーザーが利用でき、以下に示すようにGPT-3.5に置き換わります。Enterpriseユーザーも近日中に利用できるようになる予定で、これはAIの恩恵をすべての人に提供するというOpenAIの目標に沿ったものです。GPT-4o Miniは、機能をアプリケーションに統合したい開発者向けに、APIからも利用できます。現時点では、ビジョン機能はAPI経由でのみ利用できます。

図2. ChatGPT内のモデルオプション
GPT-4oとGPT-4o Miniの違い#
GPT-4o MiniとGPT-4oは、さまざまなベンチマークでいずれも優れた性能を発揮します。GPT-4oは通常、GPT-4o Miniを上回りますが、GPT-4o Miniも日常的なタスクに適したコスト効率の高いソリューションです。ベンチマークには、推論タスク、数学およびコーディングの能力、マルチモーダル推論が含まれます。下の画像に示すように、GPT-4o Miniは他の人気モデルと比較してもかなり高いベンチマーク結果を示しています。

図3. GPT-4o Miniと他の人気モデルの比較
GPT-4oとGPT-4o Miniを実際に試す#
オンラインで議論されている興味深いプロンプトの一つに、人気のLLMが小数の比較を誤る問題があります。GPT-4oとGPT-4o Miniを実際に試したところ、推論能力には明確な違いが見られました。下の画像では、両方のモデルに9.11と9.9のどちらが大きいかを尋ね、その推論を説明させています。

図4. GPT-4oとGPT-4o Miniのテスト
両方のモデルは最初、誤って9.11のほうが大きいと回答します。しかしGPT-4oは推論を進めて正しい答えにたどり着き、9.9のほうが大きいと述べます。詳細な説明を提供し、小数を正確に比較します。一方、GPT-4o Miniは、9.9のほうが大きいという推論を正しく導き出しているにもかかわらず、最初の誤った回答を頑固に維持します。
両方のモデルは高い推論能力を示します。GPT-4oは自己修正できるため、より複雑なタスクに適しており有用です。GPT-4o Miniは適応性では劣るものの、より単純なタスクでは明確で正確な推論を提供します。
さまざまなコンピュータービジョンのユースケースでGPT-4o Miniを使用する#
コードに取り組まずにGPT-4o Miniのビジョン機能を試したい場合は、OpenAI PlaygroundでAPIを簡単にテストできます。私たちも実際に試し、GPT-4o Miniがさまざまなコンピュータービジョン関連のユースケースをどの程度処理できるかを確認しました。
GPT-4o Miniによる画像分類#
GPT-4o Miniに、蝶の画像と地図の画像の2枚の画像を分類させました。AIモデルは蝶と地図を正しく識別しました。画像が大きく異なるため、これは比較的単純なタスクです。

図5. GPT-4o Miniを使用した画像分類
続いて、さらに2枚の画像をモデルに入力しました。1枚は植物の上で休む蝶、もう1枚は地面の上で休む蝶を写したものです。AIは再び優れた性能を発揮し、植物の上の蝶と地面の上の蝶を正しく見つけました。そこで、さらに一歩進めてみました。

図6. GPT-4o Miniを使用した類似画像の分類
次に、GPT-4o Miniに2枚の画像を分類させました。1枚はトウワタの花を食べる蝶、もう1枚はヒャクニチソウの花を食べる蝶を写したものです。追加のファインチューニングなしに、これほど具体的なラベルを分類できたことは驚くべきことです。これらの簡単な例から、GPT-4o Miniはカスタムトレーニングなしで画像分類タスクに利用できる可能性が示されます。

図7. GPT-4o Miniを使用した詳細画像の分類
GPT-4o Miniによるポーズの理解#
現時点では、物体検出やインスタンスセグメンテーションなどのコンピュータービジョンタスクをGPT-4o Miniで処理することはできません。GPT-4oは精度に課題があるものの、このようなタスクに利用できます。同様に、ポーズの理解については、画像内のポーズを検出または推定することはできませんが、ポーズを分類して理解することはできます。

図8. GPT-4o Miniを使用した画像内のポーズの理解
上の画像は、GPT-4o Miniがポーズの正確な座標を検出または推定できない一方で、ポーズを分類して理解できることを示しています。これはさまざまなアプリケーションで役立ちます。たとえば、スポーツ分析では、アスリートの動きを大まかに評価し、けがの予防に役立てることができます。同様に、理学療法では、リハビリテーション中に患者が正しい動きを行っていることを確認するため、運動のモニタリングを支援できます。また、監視では、一般的なボディランゲージを分析して不審な活動を特定するのに役立ちます。GPT-4o Miniは特定のキーポイントを検出できませんが、一般的なポーズを分類する能力により、これらの分野やその他の分野で役立ちます。
GPT-4o Miniに適したアプリケーション#
GPT-4o Miniでできることを見てきました。ここでは、GPT-4o Miniの利用に最も適したアプリケーションについて説明します。
GPT-4o Miniは、高度な自然言語理解を必要とし、計算リソースの使用量を小さく抑える必要があるアプリケーションに適しています。通常であればコストが高すぎるアプリケーションにも、AIを統合できるようになります。実際、Artificial Analysisによる詳細な分析では、GPT-4o Miniは他のほとんどのモデルと比較して、非常に高速で高品質な応答を提供することが示されています。

図9. GPT-4o Miniの品質と出力速度
将来的に大きな可能性を発揮すると考えられる主な分野は次のとおりです。
- バーチャルアシスタントとチャットボット: GPT-4o Miniは、高速で賢い応答を提供し、ユーザーとのインタラクションを改善できます。
- 教育ツール: このモデルを使用して、個別指導とコンテンツ生成を提供するツールを構築できます。
- 生産性向上ツール: ドキュメントの要約、メールの下書き、言語の翻訳などのタスクを改善し、効率を高めることができます。
- 言語翻訳: GPTの最新バージョンを使用して、正確かつリアルタイムの言語翻訳を提供する翻訳ツールを開発し、異なる言語間のコミュニケーションを改善できます。
GPT-4o Miniが新たな可能性を開く#
GPT-4o Miniは、マルチモーダルAIの未来に向けた新たな可能性を生み出しています。トークンあたりのコストとして知られる、テキストやデータ1単位の処理費用は、GPT-3モデルであるtext-davinci-003がリリースされた2022年以降、大幅に、ほぼ99%低下しました。コストの低下は、高度なAIをより手頃な価格にする明確な傾向を示しています。AIモデルが継続的に改善されるにつれ、あらゆるアプリやWebサイトにAIを統合することが経済的に実現可能になる可能性はますます高まっています。
AIを実際に試してみませんか?私たちのGitHubリポジトリにアクセスして、イノベーションを確認し、活発なコミュニティに参加してください。製造および農業におけるAIアプリケーションの詳細は、ソリューションページをご覧ください。









