Two-Stage Object Detectors
Explora o funcionamento dos detetores de objetos em duas etapas, com foco em propostas de regiões e classificação. Aprende por que razão os modelos modernos, como o Ultralytics YOLO26, são agora líderes.
Os detetores de objetos em duas fases são uma classe sofisticada de arquiteturas de aprendizagem profunda (DL) utilizadas em visão computacional para identificar e localizar elementos numa imagem. Ao contrário dos seus equivalentes de uma fase, que realizam a deteção numa única passagem, estes modelos dividem a tarefa em duas fases distintas: proposta de regiões e classificação de objetos. Esta abordagem bifásica foi pioneira ao dar prioridade à elevada precisão de localização, tornando estes detetores historicamente importantes na evolução da inteligência artificial (AI). Ao separar o "onde" do "quê", os detetores em duas fases alcançam frequentemente uma precisão superior, sobretudo em objetos pequenos ou parcialmente ocultos, embora isso normalmente implique um aumento dos recursos computacionais e uma maior latência de inferência.
O processo em duas fases#
A arquitetura de um detetor em duas fases baseia-se num fluxo de trabalho sequencial que imita a forma como uma pessoa poderia examinar cuidadosamente uma cena.
-
Proposta de regiões: Na primeira fase, o modelo analisa a imagem de entrada para identificar possíveis áreas onde possam existir objetos. Um componente conhecido como Rede de Proposta de Regiões (RPN) gera um conjunto esparso de caixas candidatas, frequentemente designadas por regiões de interesse (RoIs). Esta fase filtra a maior parte do fundo, permitindo que a rede concentre o poder de processamento nas áreas relevantes.
-
Classificação e refinamento: Na segunda fase, o modelo extrai características destas regiões candidatas utilizando redes neuronais convolucionais (CNNs). Em seguida, atribui uma etiqueta de classe específica (por exemplo, "pessoa" ou "veículo") a cada região e refina as coordenadas da caixa delimitadora para envolver exatamente o objeto.
Exemplos proeminentes desta arquitetura incluem a família R-CNN, especificamente o Faster R-CNN e o Mask R-CNN, que estabeleceram o padrão para os testes de referência académicos durante vários anos.
Comparação com detetores de uma fase#
É útil distinguir os modelos em duas fases dos detetores de objetos em uma fase, como o detetor de caixas múltiplas de disparo único (SSD) e a série Ultralytics YOLO. Enquanto os modelos em duas fases dão prioridade à precisão ao processar as regiões separadamente, os modelos em uma fase formulam a deteção como um único problema de regressão, mapeando diretamente os píxeis da imagem para as coordenadas das caixas delimitadoras e as probabilidades das classes.
Historicamente, isto criou um compromisso: os modelos em duas fases eram mais precisos, mas mais lentos, enquanto os modelos em uma fase eram mais rápidos, mas menos precisos. No entanto, os avanços modernos esbateram esta distinção. Modelos de última geração, como o YOLO26, utilizam agora arquiteturas de ponta a ponta que rivalizam com a precisão dos detetores em duas fases, mantendo a velocidade necessária para a inferência em tempo real.
Aplicações no mundo real#
Devido à sua ênfase na precisão e na revocação, os detetores em duas fases são frequentemente preferidos em cenários onde a segurança e o nível de detalhe são mais importantes do que a velocidade de processamento bruta.
- Imagiologia médica para diagnóstico: No campo da AI na área da saúde, não detetar um diagnóstico pode ter consequências críticas. As arquiteturas em duas fases são frequentemente utilizadas na análise de imagens médicas para detetar anomalias, como tumores, em radiografias ou exames de ressonância magnética. O processo em várias etapas ajuda a garantir que pequenas lesões não sejam ignoradas contra fundos de tecidos complexos, proporcionando aos radiologistas assistência automatizada de elevada confiança.
- Inspeção industrial de alta precisão: No âmbito da fabricação inteligente, os sistemas automatizados de inspeção visual utilizam estes modelos para identificar defeitos microscópicos nas linhas de montagem. Por exemplo, detetar uma fissura fina numa pá de turbina requer a elevada precisão de Interseção sobre União (IoU) proporcionada pelos detetores em duas fases, garantindo que apenas componentes sem defeitos avancem para a fase seguinte da produção.
Implementação da deteção moderna#
Embora os detetores em duas fases tenham estabelecido as bases para uma visão de elevada precisão, os programadores modernos utilizam frequentemente modelos avançados de uma fase que oferecem um desempenho comparável com fluxos de trabalho de implementação significativamente mais simples. A Plataforma Ultralytics simplifica o treino e a implementação destes modelos, gerindo conjuntos de dados e recursos computacionais de forma eficiente.
O exemplo seguinte em Python demonstra como carregar e executar a inferência utilizando um fluxo de trabalho moderno de deteção de objetos com ultralytics, obtendo resultados de elevada precisão semelhantes aos das abordagens tradicionais em duas fases, mas com maior eficiência:
from ultralytics import YOLO
# Load the YOLO26 model, a modern high-accuracy detector
model = YOLO("yolo26n.pt")
# Run inference on an image to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Process results (bounding boxes, classes, and confidence scores)
for result in results:
result.show() # Display the detection outcomes
print(result.boxes.conf) # Print confidence scores








