Humanity's Last Exam (HLE)
了解人类最后的考试(HLE)衡量什么、这项 AI 基准测试如何评估专家级推理能力和置信度,以及其结果揭示了什么——又没有揭示什么。
人类终极考试(HLE)是一项 AI 基准测试,通过难度较高且答案可验证的问题,检验专家级学术知识和推理能力。你可以把它看作一场涵盖多个专业领域的高难度考试,而不是普通的常识测验。它有助于揭示 AI 系统能解决哪些棘手问题,以及哪些时候流畅、自信的回答掩盖了错误。 (labs.scale.com)
人类终极考试的运作方式#
HLE 是一个基准数据集:它是一套标准化数据集合,用于在明确的条件下比较不同系统。该数据集由人工智能安全中心和 Scale AI 开发,最初定稿并公开发布的版本包含 2,500 道题,涵盖 100 多个学科,包括数学、自然科学、工程学和人文学科。 (agi.safe.ai)
题目包括选择题和简答题。这些题目都是封闭式的,也就是说,答案可以核验,即使得出答案需要大量推理。领域专家和审阅者会协助确定题目难度并把控答案质量。HLE 是一个多模态基准:有些题目需要结合图像和文本进行理解,而不只是处理语言。 (labs.scale.com)
因此,HLE 与处理和生成语言的大型语言模型以及具备图像处理能力的系统有关。HLE 的视觉题目与视觉问答有交集,视觉问答要求系统回答有关图像的问题。不过,识别图表中的组成部分,只是解决专业学术问题的一部分。 (labs.scale.com)
理解分数与置信度#
有两个指标尤为重要:
- **答案准确率:**答对题目的比例。它衡量答案是否正确,而不衡量解释中的每一步是否合理。
- **置信度校准:**置信度与实际正确率的吻合程度。在校准良好的系统中,被标为 80% 置信度的答案,约有 80% 应该是正确的。 (scikit-learn.org)
HLE 评估可以要求系统给出最终答案和置信度估计。这两者反映的是不同属性:系统可能提高了准确率,但答错时仍然过度自信。因此,给出的置信度百分比并不一定代表可靠的概率。 (agi.safe.ai)
阅读HLE 评估方法时,请检查题目版本、纯文本与多模态题目的覆盖范围、提示词和评分流程。还要检查是否允许使用外部工具;使用工具和不使用工具的结果描述的是不同的系统。 (labs.scale.com)
HLE 与相关概念的区别#
HLE 针对的是基准测试饱和现象:当许多系统的得分都接近测试上限时,该测试就不太能区分它们的能力。更难的题目能提供更大的空间来衡量差异。这个名称表达了这样的目标;它并不意味着 AI 评估会随着这场考试而终结。 (labs.scale.com)
HLE 并不是通用人工智能的认证;通用人工智能指能广泛应用于各种任务的智能。学术题目表现出色,并不能证明系统能够自主发现、可靠规划或安全行事。NIST 人工智能风险管理框架关注的是更广泛的问题,例如可信度和特定情境下的风险。 (agi.safe.ai)
HLE 也不同于目标检测,后者用于识别并定位图像中的物体。学术题目的答题准确率不能替代对检测器在实际部署图像中能否找到正确物体的评估。 (docs.ultralytics.com)
两个实际应用示例#
**选择科学助手。**设想一个团队要选择一款能讲解高等物理题的助手。HLE 可以初步反映其学术能力,但团队还应使用自身工作中有代表性的问题进行测试。自信却错误的回答可能会误导计算或实验,因此专家审查仍然很重要。请把这看作筛选示例,而不是某款助手适用性的证明。 (agi.safe.ai)
**视觉工程辅助。**设想一款能够解读设备图纸的助手。HLE 的图像题说明了为什么看见符号与理解符号之间的关系是两种不同的挑战。系统可能正确识别某个组件,却错误推断其运行方式。因此,评估应覆盖完整任务,包括解读结果及其影响,而不仅仅是视觉识别。 (labs.scale.com)
实用评估指南#
通过将训练集、验证集和测试集分开来保障评估的完整性。避免数据泄漏:评估信息影响模型开发,使模型表现看起来比实际泛化能力更好。对于 HLE 的公开题目,也需要类似地谨慎处理模型此前是否接触过这些题目。 (developers.google.com)
对于计算机视觉,应结合任务专用评估来使用任何推理基准。安装 ultralytics 后,这个有文档说明的 Ultralytics YOLO 验证工作流会在小型 COCO8 示例数据集上评估 YOLO26: (docs.ultralytics.com)
from ultralytics import YOLO
if __name__ == "__main__":
model = YOLO("yolo26n.pt")
# 将检测结果与数据集的验证标签进行比较。
metrics = model.val(data="coco8.yaml")
# 报告检测器的定位和分类指标。
print("mAP50-95:", metrics.box.map)输出是多个边界框重叠阈值下的平均精度均值,而不是 HLE 分数。COCO8 用于演示工作流;要进行有意义的部署评估,还需要有代表性的留出应用数据。核心要点是,每项性能声明都应对应实际测试的能力。 (docs.ultralytics.com)









