GPQA
GPQAベンチマークで測定される内容、GPQA Diamondのスコアの仕組み、AIにおける高度な科学的推論を評価する際の結果の解釈方法について説明します。
GPQAは、大学院レベルのGoogle検索では解けない質問応答を意味するベンチマークであり、AIシステムが難しい科学的な質問にどれだけ適切に回答できるかを評価します。専門家が作成した選択式の問題を通じて、生物学、化学、物理学に関する専門知識と推論能力を測定します。簡単に言えば、GPQAはシステムが科学的な理解を応用できるか、つまり、よく知られた事実を認識したり、該当する文章を検索したりするだけではないかを確かめます。
言語を処理して生成する大規模言語モデルにとって、GPQAは高度な科学的質問応答能力を測るための重点的な指標となります。これは評価ツールであり、モデルアーキテクチャや学習手法、科学的能力の認定ではありません。
GPQAの仕組み#
各問題には4つの選択肢があり、正解が1つ、不正解の選択肢が3つ含まれます。不正解の選択肢は、もっともらしく見えるものの誤った回答です。問題を解くには、前提を解釈したり、複数の原則を結び付けたり、一見妥当に思える説明を退けたりする必要がある場合があります。
たとえば、化学に関する問題では、競合する反応経路が示され、特定の条件下でどの生成物が優勢になるかを問われる場合があります。反応の名称を知っているだけでは十分とは限らず、システムは関連する制約を応用する必要があります。これはベンチマーク問題を再現するものではなく、問題の形式を示す例です。
「Google検索では解けない」という表現は、知識のある非専門家にとっても、Webにアクセスできる状態で難問となるよう設計するというベンチマークの目標を表しています。これは、答えをオンラインで見つけることが不可能であることや、すべての評価でブラウジングが禁止されていることを意味するものではありません。ツールの使用が許可されるかどうかはテストプロトコルの一部であり、報告する必要があります。
GPQA Diamondと関連概念#
GPQAの本体セットには448問が含まれています。GPQA Diamondは、専門家間の合意と非専門家にとっての難易度を重視して、より厳選された198問のサブセットです。GPQA Diamondの評価ドキュメントでは、4択形式と対象となる科学分野について説明しています。Diamondは独立したモデルでも汎用的な知能テストでもなく、そのスコアを本体セットのスコアと同等に扱うべきではありません。
SuperGPQAは、GPQAの3つの科学分野だけでなく、多数の学問分野を対象とする、より幅広い大学院レベルの独立した評価です。名称が似ていても、結果を直接比較できるわけではありません。
GPQAは、質問に回答を生成する一般的なタスクである質問応答とも異なります。GPQAは、その能力を評価する特定の評価方法の1つです。視覚的質問応答とは異なり、質問に答えるために画像を解釈する能力は評価しません。そのため、科学的なテキスト処理で高い性能を示しても、視覚認識の精度が高いとは限りません。
GPQAスコアの意味#
主な指標は回答精度で、正しく回答した問題の割合です。選択肢が4つの場合、均等な確率でランダムに推測すると、期待される精度は25%です。198問中150問に正解したと仮定すると、約75.8%になります。
ただし、割合だけでは十分ではありません。比較する際は、サブセット、モデルのバージョン、プロンプト、ツールへのアクセス、推論に使える計算量、試行回数を明示する必要があります。各問題に1つの回答を出す設定と、複数の回答を生成してその中から選ぶ設定では、測定しているものが異なります。
スコアのわずかな差にも注意が必要です。Diamondでは正解が1問増えると、精度は約0.5ポイント上がります。二項信頼区間は不確実性を伝えるのに役立ちますが、データセットの偏りやプロトコルの違いを解消するものではありません。
正しい選択肢を選んでも、説明が正しいとは限りません。システムは正解を選びながら、もっともらしく聞こえるものの根拠のない説明、つまりハルシネーションを生成することがあります。そのため、GPQAスコアは用途に応じたテストを補完するものとして使い、置き換えるものとはしないでください。
実用的な活用例2つ#
**科学アシスタントの選定。**予期しない酵素活性について説明するアシスタントを比較する研究室を考えてみましょう。GPQAは、科学的能力を判断するための初期的な指標になります。その後、チームは独自の実験シナリオでテストし、専門家に説明を確認してもらう必要があります。ベンチマークのスコアが高くても、相関関係を作用機序と取り違えると、その後の実験の方向を誤る可能性があります。
**顕微鏡検査の支援。**細胞検出器と、細胞数の変化を説明するアシスタントを組み合わせたシステムを考えてみましょう。GPQAは言語コンポーネントの科学的推論を評価する際の参考になりますが、検出器が重なり合った細胞を見逃したかどうかは示しません。検出と解釈を個別に評価してから、ワークフロー全体をテストしてください。このような状況に応じたアプローチは、NIST AIリスクマネジメントフレームワークに沿ったものです。
実践的な評価ガイダンス#
学習用、検証用、テスト用のデータセットを分けて、評価の信頼性を確保してください。データリーク、つまり評価情報が開発に影響して見かけ上の性能が高くなることを避けてください。公開ベンチマークに関する情報が広く知られていることも、結果の解釈を難しくする場合があります。
視覚と言語を組み合わせたアプリケーションでは、視覚コンポーネントを独自の指標で評価してください。ultralyticsをpip install ultralyticsとともにインストールした後、このドキュメントに記載されているUltralytics YOLOの検証ワークフローでYOLO26を評価できます。
from ultralytics import YOLO
if __name__ == "__main__":
# 事前学習済みの物体検出器を読み込みます。
model = YOLO("yolo26n.pt")
# 予測結果をラベル付き検証画像と比較します。
metrics = model.val(data="coco8.yaml")
# 科学的推論ではなく、検出性能を報告します。
print("mAP50-95:", metrics.box.map)COCO8のサンプルデータセットはAPIの使い方を示すものであり、デプロイに関する結論を導くには規模が小さすぎます。出力されるのは平均適合率であり、GPQAスコアではなく、バウンディングボックスの重なりのしきい値を変えながら検出性能を評価します。重要なのは、各性能の主張を、実際に測定した能力に対応させることです。









