GPQA
Tìm hiểu benchmark GPQA đo lường điều gì, cách tính điểm GPQA Diamond và cách diễn giải kết quả khi đánh giá khả năng suy luận khoa học nâng cao trong AI.
GPQA là viết tắt của Hỏi đáp cấp sau đại học chống tra cứu Google, một benchmark đánh giá khả năng trả lời các câu hỏi khoa học khó của hệ thống AI. Benchmark này kiểm tra kiến thức chuyên sâu và khả năng suy luận trong sinh học, hóa học và vật lý thông qua các câu hỏi trắc nghiệm do chuyên gia trong lĩnh vực biên soạn. Nói một cách trực quan, GPQA đặt ra câu hỏi liệu một hệ thống có thể vận dụng hiểu biết khoa học hay chỉ nhận ra các dữ kiện quen thuộc hoặc tìm được một câu khớp với câu hỏi.
Đối với mô hình ngôn ngữ lớn, vốn xử lý và tạo ra ngôn ngữ, GPQA cung cấp một thước đo tập trung để đánh giá khả năng trả lời các câu hỏi khoa học nâng cao. Đây là công cụ đánh giá, không phải kiến trúc model, kỹ thuật huấn luyện hay chứng nhận năng lực khoa học.
GPQA hoạt động như thế nào#
Mỗi câu hỏi có bốn lựa chọn, gồm một đáp án đúng và ba phương án gây nhiễu: các lựa chọn có vẻ hợp lý nhưng không chính xác. Để giải câu hỏi, có thể cần diễn giải các giả định, kết nối một số nguyên lý hoặc loại trừ những lời giải thích ban đầu có vẻ hợp lý.
Ví dụ, một câu hỏi kiểu hóa học có thể mô tả các con đường phản ứng cạnh tranh và yêu cầu xác định sản phẩm nào được ưu tiên trong những điều kiện nhất định. Chỉ biết tên phản ứng chưa chắc đã đủ; hệ thống phải vận dụng các ràng buộc liên quan. Ví dụ này minh họa dạng nhiệm vụ, không tái hiện một câu hỏi trong benchmark.
“Chống tra cứu Google” mô tả mục tiêu thiết kế của benchmark: các câu hỏi vẫn phải đủ thách thức với người không chuyên nhưng có kiến thức, ngay cả khi họ có quyền truy cập web. Điều này không có nghĩa là không thể tìm thấy câu trả lời trên mạng hoặc mọi bài đánh giá đều cấm duyệt web. Việc có cho phép sử dụng công cụ hay không là một phần của quy trình kiểm thử và phải được báo cáo.
GPQA Diamond và các khái niệm liên quan#
Bộ GPQA chính có 448 câu hỏi. GPQA Diamond là một tập con được lọc chọn kỹ hơn gồm 198 câu hỏi, nhấn mạnh sự đồng thuận giữa các chuyên gia và độ khó đối với người không chuyên. Tài liệu đánh giá GPQA Diamond mô tả định dạng bốn lựa chọn và các lĩnh vực khoa học của bộ này. Diamond không phải là một model riêng hay bài kiểm tra trí tuệ toàn diện, và không nên xem điểm số của bộ này có thể thay thế cho điểm số trên bộ chính.
SuperGPQA là một bài đánh giá riêng, rộng hơn ở cấp sau đại học, bao quát nhiều ngành thay vì chỉ giới hạn trong ba lĩnh vực khoa học của GPQA. Tên gọi tương tự không khiến kết quả của hai bài đánh giá có thể so sánh trực tiếp.
GPQA cũng khác với hỏi đáp, một nhiệm vụ tổng quát tạo câu trả lời cho các câu hỏi. GPQA là một bài đánh giá cụ thể về năng lực đó. Không giống như hỏi đáp bằng hình ảnh, GPQA không kiểm tra khả năng diễn giải hình ảnh để trả lời câu hỏi. Vì vậy, hiệu năng tốt trên văn bản khoa học không thể chứng minh độ chính xác của khả năng nhận thức hình ảnh.
Ý nghĩa của điểm GPQA#
Chỉ số chính là độ chính xác câu trả lời: tỷ lệ câu hỏi được trả lời đúng. Với bốn lựa chọn, đoán ngẫu nhiên với xác suất như nhau có độ chính xác kỳ vọng là 25%. Một kết quả giả định với 150 câu trả lời đúng trên tổng số 198 câu tương đương khoảng 75,8%.
Tuy nhiên, chỉ riêng tỷ lệ phần trăm là chưa đủ. Khi so sánh, cần nêu rõ tập con, phiên bản model, prompt, quyền truy cập công cụ, ngân sách suy luận và số lần thử. Trả lời một lần cho mỗi câu hỏi là một thiết lập khác với việc tạo nhiều câu trả lời rồi chọn ra câu phù hợp nhất.
Cũng cần thận trọng khi xem xét những chênh lệch điểm số nhỏ. Thêm một câu trả lời đúng trên Diamond làm độ chính xác thay đổi khoảng 0,5 điểm phần trăm. Khoảng tin cậy nhị thức có thể giúp diễn đạt mức độ bất định, dù không giải quyết được thiên lệch dữ liệu hay khác biệt về quy trình đánh giá.
Các lựa chọn đúng không đảm bảo phần giải thích cũng đúng. Một hệ thống có thể chọn đúng phương án nhưng đưa ra một ảo giác—lời giải thích nghe có vẻ hợp lý nhưng không có căn cứ. Vì vậy, điểm GPQA nên bổ trợ chứ không thay thế cho việc kiểm thử theo từng ứng dụng cụ thể.
Hai ví dụ ứng dụng thực tế#
Lựa chọn trợ lý khoa học. Hãy xét một phòng thí nghiệm đang so sánh các trợ lý có khả năng giải thích hoạt tính enzyme bất thường. GPQA có thể cung cấp một tín hiệu ban đầu về năng lực khoa học. Sau đó, nhóm nên kiểm thử các tình huống thí nghiệm của riêng mình và nhờ chuyên gia đánh giá phần giải thích. Nhầm lẫn tương quan với cơ chế có thể khiến các thí nghiệm tiếp theo đi sai hướng, ngay cả khi điểm benchmark cao.
Hỗ trợ kính hiển vi. Hãy xét một hệ thống kết hợp bộ phát hiện tế bào với trợ lý giải thích những thay đổi về số lượng tế bào. GPQA có thể hỗ trợ đánh giá khả năng suy luận khoa học của thành phần ngôn ngữ, nhưng không cho biết bộ phát hiện có bỏ sót các tế bào chồng lấp hay không. Hãy đánh giá riêng khả năng phát hiện và diễn giải, sau đó kiểm thử toàn bộ quy trình. Cách tiếp cận phù hợp với ngữ cảnh này tương thích với Khung quản lý rủi ro AI của NIST.
Hướng dẫn đánh giá thực tiễn#
Bảo đảm tính toàn vẹn của quá trình đánh giá bằng cách sử dụng các tập huấn luyện, xác thực và kiểm thử riêng biệt. Tránh rò rỉ dữ liệu, trong đó thông tin đánh giá ảnh hưởng đến quá trình phát triển và làm tăng hiệu năng có vẻ đạt được. Việc benchmark bị công khai cũng có thể khiến kết quả khó diễn giải hơn.
Đối với ứng dụng kết hợp thị giác và ngôn ngữ, hãy đánh giá thành phần thị giác bằng các chỉ số riêng. Sau khi cài đặt ultralytics bằng pip install ultralytics, quy trình xác thực Ultralytics YOLO được tài liệu hóa sau đây đánh giá YOLO26:
from ultralytics import YOLO
if __name__ == "__main__":
# Nạp bộ phát hiện đối tượng đã được huấn luyện trước.
model = YOLO("yolo26n.pt")
# So sánh các dự đoán với ảnh xác thực đã gán nhãn.
metrics = model.val(data="coco8.yaml")
# Báo cáo hiệu năng phát hiện, không phải khả năng suy luận khoa học.
print("mAP50-95:", metrics.box.map)Bộ dữ liệu ví dụ COCO8 minh họa API; bộ dữ liệu này quá nhỏ để đưa ra kết luận về triển khai. Đầu ra là độ chính xác trung bình, chỉ số đánh giá khả năng phát hiện trên các ngưỡng chồng lấp của hộp giới hạn—không phải điểm GPQA. Nguyên tắc cốt yếu là gắn mỗi tuyên bố về hiệu năng với đúng năng lực được đo lường.









