LiveCodeBench
LiveCodeBenchは、AIコーディングモデルを対象とした日付付きベンチマークです。コード生成、修正、実行に関する推論、新しい問題への対応能力をテストします。
LiveCodeBenchは、AI言語モデルがプログラミング問題をどの程度解決できるかを評価する、継続的に更新されるベンチマークです。モデルが動作するコードを生成し、誤りを修正し、プログラムの動作を推論できるかをテストします。最大の特徴は時間軸です。問題には公開日が付与されているため、評価者はモデルの学習データの最終日、つまり学習資料に含まれる最新の日付より後に公開された課題でモデルをテストできます。これにより、真の問題解決能力と、以前に遭遇した解答の想起とを区別しやすくなります。
起源とベンチマーク設計#
2024年の論文「LiveCodeBench:大規模言語モデルの包括的かつ汚染のないコード評価」で発表されたLiveCodeBenchは、Naman Jainを中心とするUC Berkeley、MIT、Cornell Universityの研究者によって作成されました。LeetCode、AtCoder、Codeforcesから競技プログラミングの問題を収集しています。初期の代表的なベースラインにはGPT-4 TurboとClaude 3 Opusが含まれ、評価タスク全般で高い性能を示しました。初期比較では、DeepSeek-Instruct-33BとPhind-34Bがオープンアクセスのベースラインとして優れた性能を示しました。これらは過去の参考値であり、常にリーダーボードの上位にあるわけではありません。
初期バージョンのrelease_v1には、2023年5月から2024年3月までに公開された400問が含まれていました。その後、Hugging Faceでのリリースによってコレクションが拡充されたため、LiveCodeBenchの規模は一定ではありません。再現可能な結果を得るには、使用したリリースと評価期間を明記する必要があります。
他のベンチマークデータセットと同様に、モデルを比較するための共通タスクと採点手順を提供します。また、日付付きの評価設計により、評価者は新たに公開された問題の共通期間を選択できます。
LiveCodeBenchが測定する内容#
LiveCodeBenchは、ソースコードを含むテキストを生成・解釈するシステムである大規模言語モデルの、相互に関連する4つの能力を評価します。
- コード生成: 問題文と入出力例からプログラムを生成します。評価者は追加のテストで解答を実行します。
- 自己修正: 例外やテスト失敗などの実行フィードバックを受け取り、誤った解答を修正します。
- コード実行: 指定された入力に対して、提示されたプログラムの出力を予測します。ここでの「実行」とはモデルの推論タスクを指し、評価者は予測を実際の実行結果と照合します。
- テスト出力の予測: 実装を提示されずに、問題の仕様と与えられた入力から期待される出力を推論します。
最後の2つのタスクの違いは重要です。コード実行では既存のプログラムが何をするかを問うのに対し、テスト出力の予測では正しい実装が何をすべきかを問います。自己修正では、AIシステムが計画、コード作成、実行、修正を行うエージェント型コーディングでも用いられる、フィードバックを受けて修正する動作を評価します。
コード生成において、機能的な正しさとは、必須のテストすべてに合格することです。プログラムが正常に実行されても誤った答えを出す場合があり、実行エラーによって答えを出せない場合もあります。どちらの失敗もベンチマークの性能に影響します。
スコアの読み方と汚染の理解#
Pass@1は、生成された解答が1回ですべての必須テストに合格する可能性を、問題全体で平均した指標です。報告値が60%の場合、指定された評価手順のもとで、約10問中6問が解けたことを意味します。各プログラムがテストの60%に合格するという意味ではありません。
公平に比較するには、データセットのリリース、日付範囲、タスク、生成設定を一致させる必要があります。プロンプトエンジニアリング、サンプリング設定、出力上限、修正の機会によって結果が変わることがあります。易・中・難の内訳を見ると、全体平均では分からない違いも明らかになります。
ベンチマーク汚染とは、評価問題や解答がモデルの学習データに含まれている状態です。この種のデータリークがあると、モデルがすでに内容に触れているため、スコアが高くなる可能性があります。モデルの学習 cutoff より後に公開された問題を選ぶことで、このリスクを軽減できますが、cutoffの信頼性や、その後のモデル更新も考慮する必要があります。
そのため、特定のモデルが「LiveCodeBenchで首位」と主張するには、日付の明記されたリーダーボードのスナップショットと、一致する評価設定が必要です。その背景情報がないランキングは解釈が困難です。
活用方法と関連ベンチマーク#
LiveCodeBenchは、コーディングモデルの比較や、解答の生成、コードの理解、失敗の修正のどこに弱点があるかの診断に役立ちます。コンテスト形式のタスクはアルゴリズムプログラミング能力を評価する材料になりますが、より広範なソフトウェア開発の評価には、リポジトリの操作、依存関係の管理、統合時の動作に関するテストも必要です。
LiveBenchは、推論、数学、言語、コーディングなどを対象とする、別のより広範なベンチマークです。名前が似ていても、スコアを相互に置き換えられるわけではありません。
Ultralytics YOLOを使って開発する場合、LiveCodeBenchはコーディングアシスタントを評価する際の一つの指標になります。補完的な具体例として、Ultralytics Agent Skillsを使用するワークフローがあります。Ultralytics Agent Skillsは、互換性のあるコーディングエージェントに、データセットの準備、トレーニング、推論、エクスポートの手順を提供します。
そのアシスタントがYOLO26アプリケーションの構築を支援する場合は、生成されたコードをビジョンモデルとは別に評価してください。検証モードでは予測品質を測定し、ベンチマークモードではデプロイ形式ごとの精度と推論速度を比較します。










