GPQA
AI에서 고급 과학적 추론을 평가할 때 GPQA 벤치마크가 무엇을 측정하는지, GPQA Diamond 점수가 어떻게 산출되는지, 결과를 어떻게 해석하는지 알아보세요.
GPQA는 대학원 수준의 Google 검색 방지 질의응답을 뜻하는 벤치마크로, AI 시스템이 어려운 과학 질문에 얼마나 잘 답하는지 평가합니다. 이 벤치마크는 해당 분야 전문가가 작성한 객관식 질문을 통해 생물학, 화학, 물리학의 전문 지식과 추론 능력을 테스트합니다. 쉽게 말해, GPQA는 시스템이 익숙한 사실을 알아보거나 일치하는 문장을 검색하는 데 그치지 않고 과학적 이해를 적용할 수 있는지 묻습니다.
언어를 처리하고 생성하는 대규모 언어 모델의 경우, GPQA는 고급 과학 질의응답 능력을 집중적으로 측정합니다. GPQA는 평가 도구이지, 모델 아키텍처나 학습 기법 또는 과학적 역량을 인증하는 수단은 아닙니다.
GPQA 작동 방식#
각 질문에는 정답 하나와 오답 선택지 세 개, 즉 그럴듯하지만 틀린 대안이 포함된 네 가지 답변 선택지가 제시됩니다. 문제를 풀려면 가정을 해석하고 여러 원리를 연결하거나 처음에는 타당해 보이는 설명을 배제해야 할 수 있습니다.
예를 들어, 화학 문제에서는 서로 경쟁하는 반응 경로를 설명하고 특정 조건에서 어떤 생성물이 우세한지 물을 수 있습니다. 반응 이름을 아는 것만으로는 충분하지 않을 수 있으며, 시스템은 관련 제약 조건을 적용해야 합니다. 이는 벤치마크 문제를 그대로 재현하는 것이 아니라 문제 유형을 보여주는 예시입니다.
“Google 검색 방지”라는 표현은 벤치마크의 설계 목표를 설명합니다. 즉, 지식이 있는 비전문가도 웹에 접근할 수 있는 상황에서 질문이 여전히 어렵도록 설계한다는 뜻입니다. 이는 답을 온라인에서 찾을 수 없거나 모든 평가에서 검색이 금지된다는 의미가 아닙니다. 도구 사용 허용 여부는 테스트 프로토콜의 일부이며 보고해야 합니다.
GPQA Diamond 및 관련 개념#
기본 GPQA 세트에는 448개의 질문이 포함되어 있습니다. GPQA Diamond는 전문가 간 합의와 비전문가가 느끼는 난도를 중점적으로 고려해 더욱 엄격하게 선별한 198개 질문의 하위 집합입니다. GPQA Diamond 평가 문서에는 네 가지 선택지 형식과 과학 분야가 설명되어 있습니다. Diamond는 별도의 모델이나 보편적인 지능 테스트가 아니며, 점수를 기본 세트 점수와 서로 바꾸어 해석해서는 안 됩니다.
SuperGPQA는 GPQA의 세 가지 과학 분야에 한정되지 않고 여러 학문 분야를 다루는 별도의 광범위한 대학원 수준 평가입니다. 이름이 비슷하다고 해서 결과를 직접 비교할 수 있는 것은 아닙니다.
GPQA는 질문에 답변을 생성하는 일반적인 과제인 질의응답과도 다릅니다. GPQA는 그 능력을 평가하는 특정 평가입니다. 시각 질의응답과 달리, 질문에 답하기 위해 이미지를 해석하는 능력은 테스트하지 않습니다. 따라서 과학 분야의 텍스트 처리 성능이 우수하더라도 시각적 인식 정확도가 입증되는 것은 아닙니다.
GPQA 점수의 의미#
주요 지표는 정답률, 즉 올바르게 답한 질문의 비율입니다. 선택지가 네 개이므로 무작위로 균등하게 추측할 경우 기대 정답률은 25%입니다. 198개 질문 중 150개를 맞힌 가상 결과는 약 75.8%입니다.
그러나 백분율만으로는 충분하지 않습니다. 비교 시에는 하위 집합, 모델 버전, 프롬프트, 도구 접근 권한, 추론 예산, 시도 횟수를 명시해야 합니다. 질문마다 답변을 하나씩 생성하는 설정은 여러 답변을 생성한 다음 그중 하나를 선택하는 설정과 다른 조건을 측정합니다.
점수 차이가 작을 때도 신중하게 해석해야 합니다. Diamond에서 정답이 하나 늘면 정답률이 약 0.5%포인트 변합니다. 이항 신뢰 구간은 불확실성을 전달하는 데 도움이 되지만, 데이터 세트 편향이나 프로토콜 차이를 해결해 주지는 않습니다.
정답을 골랐다고 해서 설명까지 정확한 것은 아닙니다. 시스템은 올바른 선택지를 고르면서도 근거가 없지만 그럴듯하게 들리는 설명인 환각을 생성할 수 있습니다. 따라서 GPQA 점수는 애플리케이션별 테스트를 대체하는 것이 아니라 보완해야 합니다.
실제 적용 사례 두 가지#
과학 분야 어시스턴트 선정. 예상치 못한 효소 활성에 대해 설명하는 어시스턴트를 비교하는 실험실을 가정해 보겠습니다. GPQA는 과학적 역량을 가늠하는 초기 신호를 제공할 수 있습니다. 그런 다음 팀은 자체 실험 시나리오를 테스트하고 전문가에게 설명을 검토하도록 해야 합니다. 상관관계를 메커니즘으로 혼동하면 벤치마크 점수가 높더라도 후속 실험의 방향을 잘못 설정할 수 있습니다.
현미경 분석 지원. 세포 검출기와 세포 수의 변화를 설명하는 어시스턴트를 결합한 시스템을 가정해 보겠습니다. GPQA는 언어 구성 요소의 과학적 추론을 평가하는 데 참고가 될 수 있지만, 검출기가 겹쳐 있는 세포를 놓쳤는지는 알려주지 않습니다. 검출과 해석을 별도로 평가한 다음 전체 워크플로를 테스트해야 합니다. 이러한 맥락에 맞춘 접근 방식은 NIST AI 위험 관리 프레임워크에 부합합니다.
실제 평가 지침#
학습, 검증, 테스트 세트를 분리하여 평가의 무결성을 보호합니다. 평가 정보가 개발에 영향을 주어 성능이 실제보다 높아 보이게 만드는 데이터 누출을 방지합니다. 공개 벤치마크에 대한 노출 역시 결과 해석을 복잡하게 만들 수 있습니다.
비전과 언어를 함께 사용하는 애플리케이션에서는 시각 구성 요소를 자체 지표로 평가합니다. pip install ultralytics을 사용해 ultralytics을 설치한 다음, 이 문서화된 Ultralytics YOLO 검증 워크플로를 통해 YOLO26을 평가할 수 있습니다.
from ultralytics import YOLO
if __name__ == "__main__":
# 사전 학습된 객체 검출기를 불러옵니다.
model = YOLO("yolo26n.pt")
# 예측 결과를 라벨이 지정된 검증 이미지와 비교합니다.
metrics = model.val(data="coco8.yaml")
# 과학적 추론이 아닌 검출 성능을 보고합니다.
print("mAP50-95:", metrics.box.map)COCO8 예제 데이터 세트는 API를 보여주는 예시이며, 배포에 관한 결론을 내리기에는 너무 작습니다. 출력값은 평균 정밀도로, 경계 상자 중첩 임계값에 따른 검출 성능을 평가하는 지표이지 GPQA 점수는 아닙니다. 핵심 원칙은 각 성능 주장을 실제로 측정한 역량에 맞추는 것입니다.









