Humanity's Last Exam (HLE)
Saiba o que o Último Exame da Humanidade (HLE) mede, como seu benchmark de IA avalia o raciocínio especializado e a confiança, e o que seus resultados revelam — e o que não revelam.
O Último Exame da Humanidade (HLE) é um benchmark de IA que testa conhecimentos acadêmicos de nível especializado e capacidade de raciocínio por meio de perguntas difíceis com respostas verificáveis. Pense nele como um exame exigente que abrange muitas especialidades, e não como um teste de conhecimentos gerais. Ele ajuda a revelar onde um sistema de IA consegue resolver problemas desafiadores — e onde respostas fluentes e confiantes escondem erros. (labs.scale.com)
Como funciona o Último Exame da Humanidade#
HLE é um conjunto de dados de benchmark: uma coleção padronizada usada para comparar sistemas em condições definidas. Desenvolvida pelo Center for AI Safety e pela Scale AI, sua coleção pública original e finalizada contém 2.500 perguntas de mais de 100 áreas, incluindo matemática, ciências naturais, engenharia e humanidades. (agi.safe.ai)
As perguntas incluem questões de múltipla escolha e problemas de resposta curta. Elas são fechadas, ou seja, é possível verificar se a resposta está correta, mesmo quando chegar a ela exige bastante raciocínio. Especialistas colaboradores e revisores ajudam a estabelecer o nível de dificuldade e a qualidade das respostas. HLE é multimodal: algumas perguntas exigem interpretar imagens junto com texto, em vez de processar apenas linguagem. (labs.scale.com)
Isso torna HLE relevante para modelos de linguagem grandes, que processam e geram linguagem, e para sistemas capazes de processar imagens. Suas perguntas visuais se sobrepõem à resposta a perguntas visuais, em que um sistema responde a perguntas sobre uma imagem. No entanto, reconhecer os componentes de um diagrama é apenas uma parte da resolução de um problema acadêmico especializado. (labs.scale.com)
Entendendo as pontuações e a confiança#
Duas medidas são especialmente importantes:
- Precisão das respostas: A proporção de perguntas respondidas corretamente. Ela mede o acerto das respostas, não se todas as etapas de uma explicação são válidas.
- Calibração da confiança: O quanto a confiança corresponde à correção observada. Entre as respostas às quais foi atribuída uma confiança de 80%, aproximadamente 80% devem estar corretas em um sistema bem calibrado. (scikit-learn.org)
As avaliações de HLE podem solicitar uma resposta final e uma estimativa de confiança. Elas capturam propriedades diferentes: um sistema pode aumentar a precisão e continuar excessivamente confiante quando erra. Portanto, uma porcentagem de confiança declarada não é automaticamente uma probabilidade confiável. (agi.safe.ai)
Ao consultar a metodologia de avaliação de HLE, verifica a versão das perguntas, a cobertura apenas textual ou multimodal, os prompts e o procedimento de avaliação. Verifica também se ferramentas externas eram permitidas; resultados com e sem assistência de ferramentas descrevem sistemas diferentes. (labs.scale.com)
Como HLE se diferencia de conceitos relacionados#
HLE aborda a saturação de benchmarks: quando muitos sistemas obtêm pontuações próximas ao limite de um teste, esse teste se torna menos útil para distinguir suas capacidades. Perguntas mais difíceis criam mais espaço para medir diferenças. O nome expressa essa ambição; não significa que a avaliação de IA termina com esse exame. (labs.scale.com)
Não é um certificado de inteligência artificial geral, ou seja, de inteligência amplamente aplicável a diferentes tarefas. Respostas acadêmicas excelentes não comprovam capacidade de descoberta autônoma, planejamento confiável ou comportamento seguro. O NIST AI Risk Management Framework aborda preocupações mais amplas, como confiabilidade e riscos específicos de cada contexto. (agi.safe.ai)
HLE também se diferencia da deteção de objetos, que identifica e localiza objetos em imagens. A precisão das respostas acadêmicas não substitui a medição de se um detetor encontra os objetos certos em imagens de implantação. (docs.ultralytics.com)
Dois exemplos de aplicações práticas#
Seleção de um assistente científico. Considera uma equipa que está a escolher um assistente para explicar problemas avançados de física. HLE pode fornecer uma indicação inicial da capacidade acadêmica, mas a equipa também deve testar perguntas representativas do seu próprio trabalho. Uma resposta incorreta dada com confiança pode induzir cálculos ou experiências ao erro, por isso a revisão especializada continua a ser importante. Considera isto um exemplo de triagem, não uma prova de que um determinado assistente é adequado. (agi.safe.ai)
Assistência visual em engenharia. Considera um assistente que interpreta diagramas de equipamentos. As perguntas de HLE baseadas em imagens ilustram por que ver símbolos e compreender as relações entre eles são desafios distintos. Um sistema pode identificar corretamente um componente e, ainda assim, inferir incorretamente o seu funcionamento. Por isso, a avaliação deve abranger a tarefa completa, incluindo interpretações e consequências — não apenas o reconhecimento visual. (labs.scale.com)
Orientações práticas de avaliação#
Protege a integridade da avaliação mantendo os conjuntos de treino, validação e teste separados. Evita o vazamento de dados, que ocorre quando informações da avaliação influenciam o desenvolvimento do modelo e fazem o desempenho parecer melhor do que realmente generaliza. As perguntas públicas de HLE exigem cuidados semelhantes em relação à exposição prévia. (developers.google.com)
Em visão computacional, usa avaliações específicas para cada tarefa junto com qualquer benchmark de raciocínio. Depois de instalar ultralytics, este fluxo de trabalho documentado de validação do Ultralytics YOLO avalia YOLO26 no pequeno conjunto de dados de exemplo COCO8: (docs.ultralytics.com)
from ultralytics import YOLO
if __name__ == "__main__":
model = YOLO("yolo26n.pt")
# Compara as deteções com os rótulos de validação do conjunto de dados.
metrics = model.val(data="coco8.yaml")
# Apresenta a métrica de localização e classificação do detetor.
print("mAP50-95:", metrics.box.map)A saída é a precisão média calculada entre vários limiares de sobreposição de caixas delimitadoras, não uma pontuação de HLE. COCO8 demonstra o fluxo de trabalho; para uma avaliação significativa da implantação, são necessários dados representativos da aplicação, reservados para teste. A lição central é associar cada alegação de desempenho à capacidade efetivamente testada. (docs.ultralytics.com)









