Uncertainty Quantification
Aprende sobre a quantificação da incerteza em IA e machine learning, incluindo incerteza aleatória e epistémica, calibração, métodos de avaliação e fluxos de trabalho do Ultralytics YOLO.
A quantificação da incerteza (UQ) é o processo de estimar, avaliar e comunicar o grau de incerteza de um modelo de IA ou de aprendizagem automática relativamente às suas previsões. Em vez de devolver apenas uma etiqueta, um valor ou uma caixa delimitadora, um fluxo de trabalho de UQ fornece informações adicionais, como uma distribuição de probabilidade, um intervalo de predição, uma pontuação de confiança ou um conjunto de predições. Isto ajuda os utilizadores a compreender não só o que um modelo prevê, mas também quanta confiança devem depositar nessa previsão.
Por que a Quantificação da Incerteza é Importante#
Os modelos aprendem padrões a partir de dados limitados, pelo que os seus resultados nunca são perfeitamente certos. As entradas podem conter ruído, as etiquetas podem ser ambíguas e os dados de produção podem diferir da distribuição de treino. A UQ torna estas limitações mensuráveis e apoia decisões mais seguras, a revisão humana e uma melhor recolha de dados.
Esta ideia amplia o objetivo mais abrangente de caracterizar a qualidade dos modelos, descrito pelo programa de medição virtual do NIST. Nos sistemas de IA, as estimativas de incerteza podem ajudar as equipas a:
- Rejeitar ou rever previsões quando a incerteza ultrapassa um nível aceitável.
- Comparar previsões alternativas em vez de depender de uma única resposta.
- Identificar entradas desconhecidas e possível deriva de dados.
- Dar prioridade a amostras incertas para anotação através da aprendizagem ativa.
- Propagar a incerteza para cálculos e decisões posteriores, conforme ilustrado pela visão geral do Department of Energy sobre a incerteza em modelos computacionais.
A UQ é especialmente importante quando os erros de previsão têm consequências diferentes. Não detetar um peão é mais grave do que detetar incorretamente um sinal de trânsito, pelo que o limite de incerteza aceitável depende da aplicação.
Incerteza Aleatória e Epistémica#
Duas categorias explicam a origem da incerteza preditiva:
- A incerteza aleatória, também chamada incerteza aleatória, resulta da aleatoriedade ou ambiguidade inerente aos dados. O desfoque causado pelo movimento, o ruído do sensor, a oclusão parcial e as etiquetas inconsistentes podem dificultar a interpretação de uma imagem, mesmo para um modelo bem treinado. Mais dados de treino podem ajudar a estimar esta incerteza, mas não conseguem eliminar completamente a ambiguidade subjacente.
- A incerteza epistémica resulta do conhecimento incompleto do modelo. Surge frequentemente quando os dados de treino são insuficientes, não representativos ou não abrangem situações importantes. Muitas vezes, pode ser reduzida através da recolha de exemplos relevantes, da melhoria das anotações ou da alteração do modelo.
A UQ combina informações sobre estas fontes em resultados úteis. Ferramentas de modelação probabilística, como o TensorFlow Probability, podem representar previsões como distribuições, enquanto os métodos de ensemble estimam a incerteza comparando vários modelos ou execuções de treino. Uma discordância elevada geralmente sugere maior incerteza epistémica.
A incerteza está relacionada com uma pontuação de confiança, mas é mais abrangente. A confiança descreve a força de uma previsão, enquanto a UQ avalia se essa pontuação é fiável e que fontes de incerteza a afetam. Da mesma forma, a predição conformal é uma técnica específica para produzir conjuntos ou intervalos de predições com cobertura-alvo, sob pressupostos definidos.
Métodos e Avaliação#
As abordagens comuns de UQ incluem resultados probabilísticos, ensembles, amostragem repetida, modelação bayesiana e intervalos de predição. Os intervalos de confiança bootstrap estimam a variabilidade através de novas amostragens repetidas dos dados observados. Na classificação, a calibração verifica se as previsões às quais foi atribuída uma probabilidade de aproximadamente 80% estão corretas cerca de 80% das vezes.
Um modelo pode ser preciso, mas estar mal calibrado, pelo que as equipas devem avaliar tanto o desempenho da tarefa como a qualidade da incerteza. As ferramentas de calibração de probabilidades utilizam diagramas de fiabilidade e técnicas de calibração para comparar as probabilidades previstas com os resultados observados. As Rules of Machine Learning da Google também salientam a importância de previsões probabilísticas interpretáveis e monitorizadas.
Os critérios de avaliação úteis incluem cobertura, largura do intervalo, erro de calibração e desempenho em segmentos de dados difíceis. Na visão computacional, o modo de validação da Ultralytics e o guia de métricas de desempenho do YOLO ajudam a analisar a precisão, a revocação, as matrizes de confusão e o comportamento da confiança entre classes e limiares.
Aplicações no mundo real#
- Análise de imagens médicas: Um modelo de diagnóstico pode sinalizar uma imagem para revisão por um especialista quando vários achados plausíveis têm pontuações semelhantes ou quando a imagem difere dos dados de treino. Sem esta escalada, uma previsão incorreta e excessivamente confiante poderia atrasar o tratamento.
- Inspeção visual na indústria: Um detetor de defeitos pode deparar-se com reflexos, novos materiais ou danos nunca vistos. O encaminhamento orientado pela incerteza pode enviar produtos ambíguos para inspeção manual, em vez de os aceitar ou rejeitar automaticamente, reduzindo tanto os defeitos não detetados como o desperdício desnecessário.
Estas políticas ligam a incerteza do modelo ao risco operacional. O NIST AI Risk Management Framework Core recomenda medir a incerteza, documentar os limites de generalização e monitorizar os sistemas durante toda a implementação.
Incerteza nos Fluxos de Trabalho do Ultralytics YOLO#
O Ultralytics YOLO26 disponibiliza pontuações de confiança de deteção através do seu modo de previsão documentado:
from ultralytics import YOLO
# Load an official detection model
model = YOLO("yolo26n.pt")
# Run inference
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Inspect each detection's confidence
for box in result.boxes:
class_id = int(box.cls.item())
class_name = result.names[class_id]
confidence = box.conf.item()
print(f"{class_name}: {confidence:.3f}")Este fluxo de trabalho disponibiliza um sinal útil relacionado com a incerteza, mas a confiança, por si só, não constitui uma UQ completa e não deve ser automaticamente interpretada como uma probabilidade calibrada. Valide as pontuações com dados representativos reservados, escolha os limiares com base nos custos dos erros e monitorize as distribuições de confiança após a implementação.
As equipas podem utilizar a Ultralytics Platform para anotar conjuntos de dados, treinar e implementar modelos e monitorizar endpoints. Em conjunto com a monitorização e manutenção contínuas dos modelos, os sinais de incerteza podem revelar condições desconhecidas, orientar a revisão humana e identificar quando são necessários novos dados ou um novo treino.









