Humanity's Last Exam (HLE)
Узнай, что измеряет «Последний экзамен человечества» (HLE), как этот тест для ИИ оценивает экспертное мышление и уверенность и что показывают его результаты — и чего они не показывают.
Последний экзамен человечества (HLE) — это тест для ИИ, который проверяет знания на уровне экспертов и навыки рассуждения с помощью сложных вопросов с проверяемыми ответами. Его можно представить как сложный экзамен по множеству специальностей, а не викторину на общие знания. Он помогает понять, в каких сложных задачах система ИИ находит решение, а где беглые и уверенные ответы скрывают ошибки. (labs.scale.com)
Как устроен Последний экзамен человечества#
HLE — это набор данных для тестирования моделей: стандартизированная коллекция данных, с помощью которой сравнивают системы в заданных условиях. Первоначальную окончательную публичную коллекцию из 2500 вопросов по более чем 100 предметным областям, включая математику, естественные науки, инженерное дело и гуманитарные дисциплины, разработали Центр безопасности ИИ и Scale AI. (agi.safe.ai)
Вопросы включают задания с выбором ответа и задачи с кратким ответом. Они закрытые, то есть правильность ответа можно проверить, даже если для его получения нужны серьезные рассуждения. Эксперты-авторы и рецензенты помогают определить сложность вопросов и качество ответов. HLE — мультимодальный тест: для некоторых вопросов нужно интерпретировать изображения вместе с текстом, а не только обрабатывать язык. (labs.scale.com)
Поэтому HLE актуален для больших языковых моделей, которые обрабатывают и генерируют язык, а также для систем, способных работать с изображениями. Вопросы с изображениями пересекаются с задачей ответов на вопросы по изображениям, в которой система отвечает на вопросы об изображении. Однако распознать элементы диаграммы — лишь часть решения специализированной академической задачи. (labs.scale.com)
Как понимать баллы и уверенность#
Особенно важны два показателя:
- Точность ответов: доля вопросов, на которые дан правильный ответ. Она показывает, насколько успешно система отвечает, но не говорит о том, верен ли каждый шаг объяснения.
- Калибровка уверенности: соответствие уровня уверенности фактической доле правильных ответов. Если система хорошо откалибрована, то среди ответов с уверенностью 80% примерно 80% должны быть правильными. (scikit-learn.org)
В рамках оценки HLE можно запросить окончательный ответ и оценку уверенности. Эти данные отражают разные свойства: точность системы может повыситься, хотя она по-прежнему будет чрезмерно уверена в ошибочных ответах. Поэтому указанная оценка уверенности в процентах не обязательно является надежной вероятностью. (agi.safe.ai)
Изучая методологию оценки HLE, проверь версию вопросов, охват только текста или мультимодальных данных, формулировки запросов и процедуру оценивания. Также выясни, разрешалось ли использовать внешние инструменты: результаты с помощью инструментов и без них характеризуют разные системы. (labs.scale.com)
Чем HLE отличается от смежных понятий#
HLE призван решить проблему насыщения тестов: когда многие системы набирают почти максимальный балл, тест хуже различает их возможности. Более сложные вопросы дают больше возможностей измерить различия. Название отражает эту амбицию, но не означает, что на этом экзамене оценка ИИ заканчивается. (labs.scale.com)
Это не сертификат искусственного общего интеллекта, то есть интеллекта, применимого к широкому кругу задач. Успешные ответы на академические вопросы не подтверждают способность к автономным открытиям, надежному планированию или безопасному поведению. Рамочная структура NIST по управлению рисками ИИ рассматривает более широкий круг вопросов, таких как надежность и риски в конкретных условиях. (agi.safe.ai)
HLE также отличается от обнаружения объектов, при котором объекты на изображениях определяются и локализуются. Точность академических ответов не заменяет оценку того, правильно ли детектор находит объекты на изображениях, полученных при эксплуатации. (docs.ultralytics.com)
Два практических примера применения#
Выбор научного ассистента. Представь, что команда выбирает ассистента для объяснения сложных задач по физике. HLE может дать предварительное представление об академических способностях ассистента, но команде также стоит проверить его на типичных задачах из собственной практики. Уверенный, но неверный ответ может привести к ошибкам в расчетах или экспериментах, поэтому проверка экспертом по-прежнему важна. Рассматривай этот пример как предварительный отбор, а не доказательство пригодности конкретного ассистента. (agi.safe.ai)
Помощь в проектировании по изображениям. Представь, что ассистент интерпретирует схемы оборудования. Вопросы HLE с изображениями показывают, почему распознавание символов и понимание их взаимосвязей — это разные задачи. Система может правильно определить компонент, но сделать неверный вывод о его работе. Поэтому оценка должна охватывать всю задачу, включая интерпретации и их последствия, а не только распознавание изображений. (labs.scale.com)
Практические рекомендации по оценке#
Чтобы сохранить достоверность оценки, разделяй обучающую, валидационную и тестовую выборки. Избегай утечки данных, когда информация из оценки влияет на разработку модели и ее результаты кажутся лучше, чем ее способность обобщать. При работе с общедоступными вопросами HLE нужно так же внимательно учитывать, не встречались ли они системе раньше. (developers.google.com)
Для компьютерного зрения используй оценку, ориентированную на конкретную задачу, наряду с любым тестом на навыки рассуждения. После установки ultralytics этот документированный процесс валидации Ultralytics YOLO позволяет оценить YOLO26 на небольшом демонстрационном наборе данных COCO8: (docs.ultralytics.com)
from ultralytics import YOLO
if __name__ == "__main__":
model = YOLO("yolo26n.pt")
# Сравни результаты обнаружения с метками валидационной выборки.
metrics = model.val(data="coco8.yaml")
# Выведи метрику локализации и классификации детектора.
print("mAP50-95:", metrics.box.map)Результат — это средняя точность по нескольким порогам перекрытия ограничивающих рамок, а не балл HLE. COCO8 демонстрирует принцип работы процесса; для содержательной оценки перед развертыванием нужны репрезентативные отложенные данные из целевого приложения. Главный вывод: каждое утверждение о производительности должно соответствовать проверяемой способности. (docs.ultralytics.com)









