Humanity's Last Exam (HLE)
人類最後の試験(HLE)が何を測定するのか、AIベンチマークで専門家レベルの推論能力と確信度をどのように評価するのか、そしてその結果から何が明らかになり、何が明らかにならないのかをご紹介します。
人類最後の試験(HLE)は、検証可能な回答を伴う難問を通じて、専門家レベルの学術知識と推論能力を測るAIベンチマークです。一般知識クイズではなく、多くの専門分野にまたがる難関試験と考えるとよいでしょう。AIシステムが難しい問題を解ける領域と、流暢で自信に満ちた回答が誤りを覆い隠す領域を明らかにするのに役立ちます。(labs.scale.com)
人類最後の試験(HLE)の仕組み#
HLEはベンチマークデータセットです。これは、定められた条件下でシステムを比較するために使用される標準化されたデータセットです。Center for AI SafetyとScale AIが開発した当初の最終版公開コレクションには、数学、自然科学、工学、人文科学など、100を超える分野にわたる2,500問が収録されています。(agi.safe.ai)
問題には、多肢選択問題と短答式問題があります。問題は閉じた形式であり、解答にかなりの推論が必要な場合でも、正解を判定できます。専門家の執筆者と査読者が、難易度と解答の品質の確保に協力しています。HLEはマルチモーダルです。一部の問題では、言語だけを処理するのではなく、テキストとともに画像を解釈する必要があります。(labs.scale.com)
そのためHLEは、言語を処理・生成する大規模言語モデルや、画像を扱えるシステムに関係します。HLEの視覚問題は、システムが画像に関する質問に答える視覚的質問応答と重なる部分があります。ただし、図の構成要素を認識することは、専門的な学術問題を解くために必要な要素の一つにすぎません。(labs.scale.com)
スコアと信頼度を理解する#
特に重要な指標は次の2つです。
- 回答精度: 正しく回答した問題の割合です。これは正解できたかを測る指標であり、説明のすべての段階が妥当かどうかを測るものではありません。
- 信頼度の較正: 信頼度が実際の正答率にどの程度一致しているかを示します。適切に較正されたシステムでは、信頼度を80%とした回答のうち、約80%が正解となるはずです。(scikit-learn.org)
HLEの評価では、最終回答と信頼度の推定値を求める場合があります。これらは異なる特性を捉えます。システムは精度を向上させながら、誤答時にも過信したままである可能性があります。そのため、提示された信頼度のパーセンテージが、必ずしも信頼できる確率とは限りません。(agi.safe.ai)
HLEの評価方法を確認する際は、問題のバージョン、テキストのみかマルチモーダルかの範囲、プロンプト、採点手順を確認してください。また、外部ツールの使用が許可されていたかどうかも確認してください。ツールを使った結果と使わなかった結果は、異なるシステムを示しています。(labs.scale.com)
HLEと関連概念の違い#
HLEはベンチマークの飽和に対応します。多くのシステムがテストの上限に近いスコアを取ると、そのテストでは各システムの能力を区別しにくくなります。より難しい問題を使うことで、差を測定する余地が広がります。この名称にはそうした意図が込められていますが、この試験をもってAI評価が終わるという意味ではありません。(labs.scale.com)
HLEは、幅広いタスクに適用できる知能を意味する汎用人工知能の証明ではありません。学術的な問題に優れた回答を示しても、自律的な発見、信頼できる計画立案、安全な振る舞いができることの証明にはなりません。NIST AIリスクマネジメントフレームワークは、信頼性や状況に応じたリスクなど、より幅広い懸念に対処します。(agi.safe.ai)
HLEは、画像内の物体を識別して位置を特定する物体検出とも異なります。学術問題の回答精度は、デプロイ環境の画像で検出器が正しい物体を見つけるかどうかを測る指標の代わりにはなりません。(docs.ultralytics.com)
実用的な活用例2つ#
科学分野のアシスタント選定。 高度な物理問題を説明するアシスタントをチームが選ぶ場面を考えてみましょう。HLEは学術能力を判断する初期的な手掛かりになりますが、チーム自身の業務から選んだ代表的な問題でもテストする必要があります。自信に満ちた誤答は計算や実験を誤った方向に導くおそれがあるため、専門家によるレビューが引き続き重要です。これはスクリーニングの例として扱い、特定のアシスタントが適切であることの証明とは見なさないでください。(agi.safe.ai)
ビジュアルエンジニアリング支援。 機器の図面を解釈するアシスタントを考えてみましょう。HLEの画像ベースの問題は、記号を視認することと、その関係を理解することが別々の課題である理由を示しています。システムが構成部品を正しく特定しても、動作を誤って推測する可能性があります。そのため、評価では視覚認識だけでなく、解釈やその結果を含むタスク全体を対象にする必要があります。(labs.scale.com)
実践的な評価ガイダンス#
学習用、検証用、テスト用のデータセットを分離して、評価の完全性を保ってください。評価情報がモデル開発に影響し、汎化性能以上に良い結果に見せるデータリークを避けてください。HLEの公開問題についても、事前に問題を見たことがあるかどうかに同様の注意が必要です。(developers.google.com)
コンピュータビジョンでは、推論ベンチマークに加えて、タスク固有の評価を使用してください。ultralyticsをインストールした後、こちらのドキュメントに記載されたUltralytics YOLOの検証ワークフローでは、小規模なCOCO8サンプルデータセットを使用してYOLO26を評価します。(docs.ultralytics.com)
from ultralytics import YOLO
if __name__ == "__main__":
model = YOLO("yolo26n.pt")
# データセットの検証用ラベルと検出結果を比較します。
metrics = model.val(data="coco8.yaml")
# 検出器の位置特定および分類の指標を報告します。
print("mAP50-95:", metrics.box.map)出力されるのは、複数のバウンディングボックスの重なりしきい値における平均適合率であり、HLEのスコアではありません。COCO8はワークフローを示すものであり、デプロイ評価を有意義なものにするには、代表性のある保留済みアプリケーションデータが必要です。中心となる教訓は、それぞれの性能に関する主張を、実際にテストした能力に対応させることです。(docs.ultralytics.com)









