Humanity's Last Exam (HLE)
인류 최후의 시험(HLE)이 무엇을 측정하는지, AI 벤치마크가 전문가 수준의 추론과 확신도를 어떻게 평가하는지, 그리고 결과가 무엇을 보여 주고 무엇을 보여 주지 않는지 알아보세요.
인류 최후의 시험(HLE)은 검증 가능한 답이 있는 어려운 질문을 통해 전문가 수준의 학술 지식과 추론 능력을 평가하는 AI 벤치마크입니다. 여러 전문 분야를 아우르는 까다로운 시험으로, 일반 상식 퀴즈와는 다릅니다. AI 시스템이 어려운 문제를 해결할 수 있는 영역과 유창하고 확신에 찬 답변 속에 실수가 감춰지는 영역을 파악하는 데 도움이 됩니다. (labs.scale.com)
인류 최후의 시험(HLE) 작동 방식#
HLE는 벤치마크 데이터셋입니다. 벤치마크 데이터셋은 정의된 조건에서 시스템을 비교하는 데 사용하는 표준화된 데이터 모음입니다. AI 안전 센터(Center for AI Safety)와 Scale AI가 개발했으며, 처음 공개된 최종 데이터 모음에는 수학, 자연과학, 공학, 인문학 등 100개가 넘는 주제에 걸쳐 2,500개의 질문이 포함되어 있습니다. (agi.safe.ai)
질문에는 객관식 문항과 단답형 문제가 포함됩니다. 질문은 정답이 정해져 있어, 답을 찾는 데 상당한 추론이 필요하더라도 정답 여부를 확인할 수 있습니다. 전문가 기여자와 검토자가 난이도와 답변 품질을 확립하는 데 도움을 줍니다. HLE는 멀티모달 방식입니다. 일부 질문은 텍스트만 처리하는 것이 아니라 텍스트와 함께 이미지를 해석해야 합니다. (labs.scale.com)
따라서 HLE는 언어를 처리하고 생성하는 대규모 언어 모델 및 이미지를 처리할 수 있는 시스템과 관련이 있습니다. HLE의 시각 관련 질문은 시스템이 이미지에 관한 질문에 답하는 시각 질의응답과 겹치는 부분이 있습니다. 그러나 도식의 구성 요소를 인식하는 것은 전문적인 학술 문제를 푸는 과정의 일부일 뿐입니다. (labs.scale.com)
점수와 신뢰도 이해하기#
특히 중요한 측정 지표는 다음 두 가지입니다.
- 답변 정확도: 정답을 맞힌 질문의 비율입니다. 이 지표는 성공적으로 답변한 비율을 측정하며, 설명의 모든 단계가 타당한지는 측정하지 않습니다.
- 신뢰도 보정: 신뢰도가 실제 정답률과 얼마나 일치하는지를 나타냅니다. 보정이 잘 된 시스템이라면 신뢰도 80%로 평가한 답변 중 약 80%가 정답이어야 합니다. (scikit-learn.org)
HLE 평가에서는 최종 답변과 신뢰도 추정치를 요청할 수 있습니다. 이 두 가지는 서로 다른 특성을 보여 줍니다. 시스템은 정확도가 향상되더라도 오답을 낼 때 과신하는 상태로 남아 있을 수 있습니다. 따라서 명시된 신뢰도 백분율이 반드시 신뢰할 수 있는 확률인 것은 아닙니다. (agi.safe.ai)
HLE 평가 방법론을 살펴볼 때는 질문 버전, 텍스트 전용과 멀티모달 평가 범위, 프롬프트, 채점 절차를 확인하세요. 외부 도구 사용이 허용되었는지도 확인해야 합니다. 도구를 사용한 결과와 사용하지 않은 결과는 서로 다른 시스템을 설명합니다. (labs.scale.com)
HLE와 관련 개념의 차이#
HLE는 벤치마크 포화 문제를 다룹니다. 여러 시스템이 시험에서 거의 만점에 가까운 점수를 받으면 해당 시험은 시스템 간 역량을 구별하는 데 덜 유용해집니다. 더 어려운 질문을 사용하면 차이를 측정할 여지가 커집니다. 이 이름은 그러한 목표를 나타내며, AI 평가가 이 시험으로 끝난다는 뜻은 아닙니다. (labs.scale.com)
HLE는 여러 작업에 폭넓게 적용할 수 있는 지능을 뜻하는 범용 인공지능 인증서가 아닙니다. 학술 문제에 훌륭하게 답한다고 해서 자율적인 발견 능력, 신뢰할 수 있는 계획 수립 능력 또는 안전한 행동이 입증되는 것은 아닙니다. NIST AI 위험 관리 프레임워크는 신뢰성과 맥락별 위험과 같은 더 폭넓은 우려 사항을 다룹니다. (agi.safe.ai)
HLE는 이미지에서 객체를 식별하고 위치를 찾는 객체 탐지와도 다릅니다. 학술 문제의 답변 정확도로는 배포 환경의 이미지에서 탐지기가 올바른 객체를 찾는지 측정하는 일을 대신할 수 없습니다. (docs.ultralytics.com)
실제 적용 사례 두 가지#
과학 분야 보조 시스템 선정. 고급 물리학 문제를 설명할 보조 시스템을 선정하는 팀을 생각해 보겠습니다. HLE는 학술 역량을 가늠하는 초기 신호를 제공할 수 있지만, 팀은 자체 업무를 대표하는 질문도 테스트해야 합니다. 확신에 찬 오답은 계산이나 실험을 잘못된 방향으로 이끌 수 있으므로 전문가 검토가 여전히 중요합니다. 이 사례는 선별을 위한 예시이지, 특정 보조 시스템이 적합하다는 증거로 보아서는 안 됩니다. (agi.safe.ai)
시각 기반 엔지니어링 지원. 장비 도면을 해석하는 보조 시스템을 생각해 보겠습니다. HLE의 이미지 기반 질문은 기호를 보는 것과 기호 간 관계를 이해하는 것이 별개의 과제인 이유를 보여 줍니다. 시스템이 구성 요소는 올바르게 식별하더라도 작동 방식을 잘못 추론할 수 있습니다. 따라서 평가는 시각적 인식만이 아니라 해석과 그에 따른 결과를 포함한 전체 작업을 다루어야 합니다. (labs.scale.com)
실제 평가 지침#
학습, 검증, 테스트 세트를 분리하여 평가의 무결성을 보호하세요. 평가 정보가 모델 개발에 영향을 미쳐 일반화 성능보다 실제 성능이 더 좋아 보이게 만드는 데이터 누출을 방지하세요. HLE의 공개 질문도 사전 노출 여부와 관련해 비슷한 주의가 필요합니다. (developers.google.com)
컴퓨터 비전에서는 추론 벤치마크와 함께 작업별 평가를 사용하세요. ultralytics을 설치한 후, 문서화된 Ultralytics YOLO 검증 워크플로를 통해 YOLO26을 소규모 COCO8 예제 데이터셋에서 평가할 수 있습니다. (docs.ultralytics.com)
from ultralytics import YOLO
if __name__ == "__main__":
model = YOLO("yolo26n.pt")
# 탐지 결과를 데이터셋의 검증 라벨과 비교합니다.
metrics = model.val(data="coco8.yaml")
# 탐지기의 위치 추정 및 분류 지표를 보고합니다.
print("mAP50-95:", metrics.box.map)출력값은 여러 바운딩 박스 중첩 임계값에 걸쳐 계산한 평균 정밀도이며, HLE 점수가 아닙니다. COCO8은 워크플로를 보여 주는 예시이며, 의미 있는 배포 평가를 위해서는 실제 환경을 대표하는 홀드아웃 애플리케이션 데이터가 필요합니다. 핵심은 각 성능 주장을 실제로 평가한 역량에 맞추는 것입니다. (docs.ultralytics.com)









