Concept Bottleneck Models
Aprende como os modelos de gargalo de conceitos melhoram a IA explicável com conceitos compreensíveis por humanos, intervenção de especialistas e fluxos práticos de visão com o Ultralytics YOLO26.
Os modelos de gargalo de conceitos (CBMs) são redes neurais que fazem uma previsão por meio de uma camada intermediária de conceitos compreensíveis para as pessoas. Em vez de mapear uma entrada diretamente para um rótulo final, um CBM primeiro prevê atributos significativos — como “asa vermelha”, “rachadura na superfície” ou “estreitamento da articulação” — e depois usa apenas esses atributos para produzir sua decisão. Essa estrutura torna o modelo mais fácil de inspecionar, depurar e corrigir do que um modelo convencional de caixa-preta.
Como funcionam os modelos de gargalo de conceitos#
Uma rede neural padrão geralmente representa as informações em um espaço latente opaco. Um CBM substitui uma parte dessa representação oculta por um vetor de conceitos cujas dimensões têm significados definidos.
O pipeline de previsão tem duas etapas principais:
- Um preditor de conceitos mapeia a entrada bruta, como uma imagem, para valores de conceitos.
- Um preditor do alvo mapeia esses valores de conceitos para a classe ou pontuação final.
Por exemplo, um classificador de aves pode prever “bico preto”, “peito branco” e “cauda longa” antes de identificar a espécie. Os conceitos podem ser binários, categóricos ou contínuos. Normalmente, eles são aprendidos por meio de aprendizagem supervisionada, exigindo que cada exemplo de treinamento inclua tanto os rótulos-alvo quanto as anotações dos conceitos.
As duas etapas podem ser treinadas de forma independente, sequencial ou conjunta. O treinamento independente torna a separação explícita, enquanto o treinamento conjunto pode equilibrar a qualidade dos conceitos com o desempenho na tarefa final. Em todos os casos, o gargalo deve restringir o preditor do alvo aos conceitos declarados; caso contrário, informações ocultas podem contornar a explicação pretendida.
Por que a interpretabilidade e a intervenção são importantes#
Os CBMs são uma forma de IA explicável intrínseca: sua estrutura interpretável é incorporada à previsão, em vez de ser adicionada posteriormente. Isso é diferente de ferramentas post hoc, como mapas de saliência, que estimam o que influenciou uma caixa-preta já treinada.
A camada de conceitos permite várias interações úteis:
- Os usuários podem inspecionar quais conceitos causaram uma decisão.
- Especialistas do domínio podem corrigir um conceito impreciso e recalcular a saída.
- Os desenvolvedores podem testar se o preditor do alvo segue uma lógica de domínio válida.
- As equipes podem medir a precisão dos conceitos separadamente da precisão da tarefa final.
Esses recursos estão alinhados com as orientações do NIST sobre IA explicável e com os controles centrados nas pessoas discutidos no People + AI Guidebook. No entanto, uma explicação compreensível não é automaticamente correta. A fidelidade dos conceitos deve ser avaliada, não presumida.
Aplicações no mundo real#
-
Análise de imagens médicas: Um modelo que examina uma radiografia pode estimar conceitos como osteófitos, estreitamento do espaço articular e esclerose antes de classificar a gravidade da doença. Um profissional clínico pode revisar ou corrigir essas descobertas intermediárias, em vez de receber apenas uma pontuação de gravidade. Essa interação entre pessoa e modelo é particularmente relevante para os princípios de transparência da FDA para dispositivos médicos de aprendizagem automática.
-
Inspeção visual na fabricação: Um sistema de visão pode identificar conceitos como componentes ausentes, rachaduras, descoloração ou alinhamento incorreto e, em seguida, usá-los para decidir se um produto é aprovado na inspeção ou se requer um reparo específico. A deteção de objetos pode localizar componentes e defeitos, enquanto o classificador baseado em conceitos a jusante fornece uma decisão de qualidade auditável.
Limitações e conceitos relacionados#
Os rótulos de conceitos criam custos adicionais de anotação de dados e podem exigir conhecimento especializado. Conceitos mal definidos podem ser subjetivos, correlacionados, incompletos ou difíceis de reconhecer a partir da entrada. As equipes devem criar regras de rotulagem precisas e auditar as divergências entre os anotadores.
Outros riscos importantes incluem erros na previsão de conceitos, pontuações não calibradas e vazamento de conceitos, no qual valores contínuos de conceitos codificam informações não intencionais além do seu significado declarado. As orientações sobre calibração de probabilidades podem ajudar a determinar se os valores de confiança dos conceitos são confiáveis.
Um CBM também é diferente da engenharia de atributos: os atributos criados manualmente são entradas calculadas manualmente, enquanto os conceitos normalmente são previstos a partir de dados brutos e supervisionados explicitamente. Ele não é o mesmo que o princípio do gargalo de informação, que comprime representações sem exigir que cada dimensão seja compreensível para as pessoas.
O desempenho dos conceitos deve ser verificado em diferentes segmentos de dados relevantes, pois anotações enviesadas ou conceitos ausentes podem produzir erros desiguais. As orientações da Google para identificar viés em ML e o NIST AI RMF Core fornecem práticas úteis de avaliação e governança.
Construindo um pipeline de visão prático#
Um modelo Ultralytics YOLO26 pode atuar como um extrator visual de conceitos a montante. O fluxo de trabalho a seguir, no modo Predict, coleta classes de objetos detetados como sinais candidatos de conceitos:
from ultralytics import YOLO
# Load a pretrained visual concept extractor
model = YOLO("yolo26n.pt")
# Run inference and select the first result
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Convert detected classes into human-readable concept candidates
concepts = {result.names[int(class_id)] for class_id in result.boxes.cls}
print(sorted(concepts))
result.save(filename="concept_candidates.jpg")Isso não é um CBM completo: ainda é necessário treinar um modelo a jusante para prever o alvo final exclusivamente a partir dos conceitos selecionados. As equipes podem usar a Ultralytics Platform para anotar dados visuais, treinar extratores de conceitos, comparar experimentos e monitorar componentes implantados. Avalie separadamente a precisão dos conceitos, a precisão do alvo, a calibração, o comportamento durante intervenções e os subgrupos importantes usando um fluxo de trabalho estruturado de avaliação de modelos.









