OpenAIの最新アップデート:Canvas、ビジョンのファインチューニングなど
OpenAIがリリースしたChatGPTの最近のアップデートを詳しく見ていきます。Canvas、ビジョン機能のファインチューニング、最新のSearch機能について解説します。

9月にOpenAIのo1モデル(推論能力の向上を目的に設計されています)を取り上げて以来、ChatGPTには多くの新しく興味深い機能が追加されました。これらのリリースには、開発者向けのものもあれば、ユーザーエクスペリエンスの改善を目的としたものもあります。全体として、各アップグレードはChatGPTとのやり取りをより直感的かつ効果的にするのに役立ちます。
共同での執筆とコーディング向けに設計されたCanvasや、ChatGPTの画像処理を改善するビジョン機能向けのファインチューニングなどのアップデートは大きな関心を集め、ユーザーがより創造的な可能性を探るきっかけとなっています。一方、新しいAPIや公平性テストのレポートなどの技術的なアップグレードは、モデルの統合や倫理的なAIの実践といった側面に対応しています。それでは、OpenAIによるChatGPTの最新機能について詳しく見ていきましょう。
OpenAIのCanvas機能の概要#
Canvasは、リリース以来初めてのChatGPTのユーザーインターフェース(UI)に関する大規模なアップデートです。これは、左側のサイドバーにプロンプトを表示し、右側のウィンドウに応答を表示する、2画面レイアウトの新しいインターフェースです。新しいUIでは、チャットのような従来の単一画面構成をなくし、生産性を高めるマルチタスクに適した2画面レイアウトへ移行しています。

図1. CanvasがChatGPTにUIのアップデートをもたらします。
Canvasが導入される前は、ChatGPTで長文のドキュメントを扱う際、かなり頻繁に上下へスクロールする必要がありました。新しいレイアウトでは、左側のサイドバーにプロンプトが表示され、テキストドキュメントまたはコードスニペットが画面の大部分を占めます。必要に応じて、左側のサイドバーと出力画面のサイズをカスタマイズすることもできます。また、テキストの一部やコードのセクションを選択し、ドキュメント全体を変更せずに特定の部分だけを編集できます。

図2. Canvasを使用してテキストの特定のセクションを編集します。
Canvasを使用すると、ChatGPTのインターフェース上にCanvasを開くための専用ボタンやトグルがないことに気付きます。代わりに、GPT-4oモデルで作業しているときに編集、執筆、またはコーディングを検出すると、Canvasが自動的に開きます。より簡単なプロンプトの場合は非アクティブのままです。手動で開く場合は、「Open the Canvas」や「Get me the Canvas layout」のようなプロンプトを使用できます。
現在、Canvasはベータ版であり、GPT-4oでのみ利用できます。ただし、OpenAIは、Canvasがベータ版を終了した時点で、すべての無料ユーザーが利用できるようになると述べています。
ChatGPTのAPIアップデート#
OpenAIは、効率性、スケーラビリティ、汎用性の向上を目的としたChatGPT APIの新しいアップデートを3つリリースしました。これらのアップデートをそれぞれ詳しく見ていきましょう。
モデルの蒸留#
OpenAI APIを通じてModel Distillation機能を使用すると、開発者はGPT-4oやo1-previewなどの高度なモデルの出力を利用して、GPT-4o miniなどの小型でコスト効率の高いモデルのパフォーマンスを向上させることができます。モデルの蒸留とは、より高度なモデルの動作を模倣するように小型モデルをトレーニングし、特定のタスクでより効率的にするプロセスです。
この機能が導入される前は、開発者はさまざまなツールを使って、多様なタスクを手動で調整する必要がありました。これらのタスクには、データセットの生成、モデルのパフォーマンスの測定、モデルのファインチューニングなどが含まれ、プロセスが複雑でエラーが発生しやすくなることがありました。Model Distillationのアップデートにより、開発者はStored Completionsを使用して、APIを通じて高度なモデルが生成した入出力ペアを取得・保存し、データセットを自動生成できるようになります。
Model Distillationのもう1つの機能であるEvals(現在ベータ版)は、カスタムの評価スクリプトを作成したり、別のツールを使用したりせずに、特定のタスクでモデルがどの程度の性能を発揮するかを測定するのに役立ちます。Stored Completionsで生成したデータセットと、Evalsでのパフォーマンス評価を使用して、開発者は独自のカスタムGPTモデルをファインチューニングできます。

図3. Evalsを使用してモデルのパフォーマンスを測定できます。
プロンプトキャッシュ#
AIアプリケーション、特にチャットボットを構築する場合、同じコンテキスト(現在のリクエストを理解するために必要な背景情報や過去の会話履歴)が複数のAPI呼び出しで繰り返し使用されることがよくあります。Prompt Cachingにより、開発者は最近使用した入力トークン(プロンプトを理解して応答を生成するためにモデルが処理するテキストのまとまり)を再利用でき、コストとレイテンシーの削減に役立ちます。
10月1日以降、OpenAIはGPT-4o、GPT-4o mini、o1-preview、o1-miniなどのモデルにPrompt Cachingを自動的に適用しています。つまり、開発者が長いプロンプト(1,024トークン超)を使用してAPI経由でモデルとやり取りすると、システムはすでに処理した部分を保存します。
これにより、同じ、または類似したプロンプトが再び使用された場合、それらの部分の再計算を省略できます。システムは、以前に処理したプロンプトの最も長い部分を自動的にキャッシュします。1,024トークンから始まり、プロンプトが長くなるにつれて128トークン単位で追加されます。
Realtime API#
音声アシスタントの作成には通常、音声をテキストに変換し、テキストを処理してから、応答を再生する音声に変換する作業が必要です。OpenAIのRealtime APIは、このプロセス全体を1回のAPIリクエストで処理することを目指しています。プロセスを簡素化することで、このAPIはAIとのリアルタイムの会話を可能にします。
たとえば、Realtime APIと統合された音声アシスタントは、ユーザーのリクエストに基づいて、注文を行うや情報を検索するといった特定のアクションを実行できます。このAPIにより、音声アシスタントの応答性が向上し、ユーザーのニーズにすばやく適応できるようになります。Realtime APIは10月1日にパブリックベータで利用可能になり、6種類の音声に対応しました。10月30日にはさらに5種類の音声が追加され、利用可能な音声は合計11種類になりました。

図4. Realtime APIを使用して新しい言語で会話を練習する例です。
ビジョンタスク向けのChatGPTのファインチューニング#
当初、GPT-4oのビジョン言語モデルは、テキストのみのデータセットを使用してファインチューニングおよびカスタマイズすることしかできませんでした。現在は、ビジョンファインチューニングAPIのリリースにより、開発者は画像データセットを使用してGPT-4oをトレーニングおよびカスタマイズできます。リリース以来、ビジョンファインチューニングは開発者やコンピュータービジョンエンジニアの間で大きな関心を集めるテーマとなっています。
GPT-4oのビジョン機能をファインチューニングするために、開発者は100枚から最大50,000枚までの画像を含む画像データセットを使用できます。データセットがOpenAIで必要とされる形式に適合していることを確認した後、OpenAIプラットフォームにアップロードし、特定のアプリケーション向けにモデルをファインチューニングできます。
たとえば、自動化企業のAutomatは、スクリーンショットのデータセットを使用して、説明に基づいて画面上のUI要素を識別できるようGPT-4oをトレーニングしました。これにより、ボットがユーザーインターフェースを操作しやすくなり、ロボティック・プロセス・オートメーション(RPA)の効率化に役立ちます。固定座標や複雑なセレクタールールに頼る代わりに、モデルは簡単な説明に基づいてUI要素を識別できるため、自動化の設定がより柔軟になり、インターフェースが変更された場合も保守しやすくなります。

図5. ファインチューニングしたGPT-4oモデルを使用してUI要素を検出します。
ChatGPTの公平性とバイアス検出#
AIがますます高度化する中、AIアプリケーションを取り巻く倫理的懸念は、重要な議論のテーマとなっています。ChatGPTの応答はユーザーが提供したプロンプトとインターネット上で利用可能なデータに基づいているため、常に責任ある言葉遣いになるようファインチューニングすることは容易ではありません。ChatGPTの回答には偏りがあるという報告があり、名前、性別、人種などがその要因となっています。この問題に対処するため、OpenAIの社内チームは初の一人称視点による公平性テストを実施しました。
名前には、私たちの文化や地理的要因に関する微妙な手がかりが含まれていることがよくあります。ほとんどの場合、ChatGPTは名前に含まれるこうした微妙な手がかりを無視します。しかし、場合によっては、人種や文化を反映する名前によってChatGPTの応答が異なり、その約1%には有害な言語表現が含まれていました。バイアスや有害な言語表現を排除することは、言語モデルにとって難しい課題です。しかし、これらの知見を公開し、モデルの限界を認めることで、OpenAIはユーザーがより中立的で偏りのない回答を得られるようプロンプトを改善するのを支援しています。

図6. ユーザーの名前によって応答が異なる例です。
ChatGPT検索を理解する#
ChatGPTが初めてリリースされた当時、従来のウェブブラウジングに取って代わる可能性があるかどうかについて、AIコミュニティでは議論が交わされました。現在では、多くのユーザーがGoogle Searchの代わりにChatGPTを使用しています。
OpenAIの新しいアップデートであるSearch機能は、これをさらに一歩進めるものです。Searchを使用すると、ChatGPTは最新情報に基づく回答を生成し、関連する情報源へのリンクを含めます。10月31日時点で、Search機能はすべてのChatGPT PlusおよびTeamユーザーが利用でき、ChatGPTはAIを搭載した検索エンジンに近い動作をするようになっています。

図7. ChatGPTの新しいSearch機能の使用例です。
これからの展望#
ChatGPTの最近のアップデートは、AIをより便利で柔軟かつ公平にすることに重点を置いています。新しいCanvas機能はユーザーのより効率的な作業を支援し、ビジョンファインチューニングによって開発者はモデルをカスタマイズして、ビジュアルタスクへの対応を改善できます。公平性への対応とバイアスの削減も重要な優先事項であり、誰であるかにかかわらず、AIがすべての人に適切に機能することを目指しています。モデルをファインチューニングする開発者であっても、最新機能を使用するだけのユーザーであっても、ChatGPTは幅広いニーズに対応できるよう進化しています。リアルタイム機能、ビジュアル統合、責任ある利用への注力により、これらのアップデートは、すべての人にとってより信頼性の高いAI体験を構築しています。
GitHubリポジトリにアクセスし、コミュニティに参加して、AIについてさらに詳しく学びましょう。自動運転やヘルスケアにおけるAIアプリケーションについても詳しくご覧いただけます。






