GPQA
了解 GPQA 基准测试衡量什么、GPQA Diamond 的评分机制,以及在评估 AI 高级科学推理能力时如何解读结果。
GPQA 是 研究生级谷歌难以搜索获取答案的问题解答(Graduate-Level Google-Proof Question Answering)的缩写,这是一项评估 AI 系统回答高难度科学问题能力的基准测试。它通过领域专家编写的选择题,考查系统在生物学、化学和物理学方面的专业知识与推理能力。直观来说,GPQA 要考查的是系统能否运用科学知识,而不仅仅是识别熟悉的事实或检索匹配的句子。
对于处理并生成语言的大型语言模型,GPQA 提供了一种专门衡量高级科学问答能力的方法。它是一种评估工具,而不是模型架构、训练技术或科学能力认证。
GPQA 的工作原理#
每道题都提供四个选项,其中一个正确,另外三个是干扰项:看似合理但实际错误的答案。解题可能需要理解假设、联系多项原理,或排除乍看之下似乎合理的解释。
例如,一道化学类问题可能会描述相互竞争的反应路径,并询问在特定条件下哪种产物更占优势。仅仅知道某个反应的名称未必足够;系统必须运用相关限制条件。这个例子展示的是任务类型,并非复现基准测试中的题目。
“谷歌难以搜索获取答案”描述的是这项基准测试的设计目标:即使能访问网络,具备相关知识的非专业人士也应觉得题目有挑战性。这并不意味着答案无法在网上找到,也不意味着每次评估都禁止浏览网络。是否允许使用工具属于测试协议的一部分,必须予以说明。
GPQA Diamond 与相关概念#
GPQA 主测试集包含 448 道题。GPQA Diamond 是经过更严格筛选的子集,共 198 道题,侧重考查专家意见的一致性,以及对非专业人士的难度。GPQA Diamond 评估文档介绍了其四选一题型和科学领域。Diamond 不是独立模型或通用智力测试,其得分也不应与主测试集的得分视为可以互换。
SuperGPQA 是一项独立且覆盖面更广的研究生级评估,涵盖多个学科,而不只是 GPQA 的三个科学领域。名称相似并不意味着两者的结果可以直接比较。
GPQA 也不同于一般意义上的问答,后者是针对问题生成答案的一般任务。GPQA 是对这项能力的一种特定评估。与视觉问答不同,GPQA 不考查通过解读图像来回答问题的能力。因此,科学文本任务表现出色,并不能证明视觉感知准确。
GPQA 分数的含义#
核心指标是答案准确率:答对题目的比例。四选一时,均匀随机猜测的预期准确率为 25%。假设答对 198 道题中的 150 道,准确率约为 75.8%。
不过,仅看百分比并不完整。比较时应说明所用子集、模型版本、提示词、工具访问权限、推理预算和尝试次数。每题只给出一个答案,与生成多个答案后再从中选择,衡量的是不同的设置。
对细微的分数差异也应谨慎看待。Diamond 多答对一道题,准确率就会变化约 0.5 个百分点。二项置信区间有助于表达不确定性,但无法消除数据集偏差或协议差异的影响。
选对答案并不能保证解释正确。系统可能选对选项,却给出幻觉——听起来合理但缺乏依据的解释。因此,GPQA 分数应作为应用特定测试的补充,而不能取代此类测试。
两个实际应用示例#
**科学助手的选择。**设想某实验室正在比较能够解释酶活性异常变化的助手。GPQA 可以初步反映其科学能力。团队随后应使用自己的实验场景进行测试,并请专家审查解释。即使基准测试得分很高,如果把相关性误认为作用机制,也可能导致后续实验方向错误。
**显微镜分析辅助。**设想一个系统将细胞检测器与能够解释细胞计数变化的助手结合起来。GPQA 可以用于评估语言组件的科学推理能力,但无法说明检测器是否漏掉了重叠细胞。应分别评估检测和解读能力,再测试完整工作流程。这种结合具体场景的方法符合NIST AI 风险管理框架。
实用评估指南#
通过划分独立的训练集、验证集和测试集来维护评估的完整性。避免数据泄漏,即评估信息影响开发过程并抬高表面性能的情况。基准测试内容公开也可能使结果更难解读。
对于视觉与语言结合的应用,应使用专属指标评估视觉组件。使用 ultralytics 和 pip install ultralytics 安装后,可以按照这套有文档说明的 Ultralytics YOLO 验证工作流评估 YOLO26:
from ultralytics import YOLO
if __name__ == "__main__":
# 加载预训练的目标检测器。
model = YOLO("yolo26n.pt")
# 将预测结果与带标签的验证图像进行比较。
metrics = model.val(data="coco8.yaml")
# 报告检测性能,而不是科学推理能力。
print("mAP50-95:", metrics.box.map)COCO8 示例数据集用于演示 API;它规模太小,无法据此得出部署结论。输出指标是平均精度均值,用于评估不同边界框重叠阈值下的检测效果,而不是 GPQA 分数。核心原则是,每项性能声明都应对应实际测量的能力。









