Bounding Box
Aprende como as caixas delimitadoras definem a localização de objetos em visão computacional. Explora formatos de coordenadas, aplicações no mundo real e como utilizar o Ultralytics YOLO26.
Uma caixa delimitadora é uma região retangular definida por um conjunto de coordenadas que engloba um objeto específico dentro de uma imagem ou frame de vídeo. No campo da visão computacional (CV), estas caixas funcionam como as anotações fundamentais para ensinar aos sistemas de inteligência artificial (AI) a localizar e reconhecer itens distintos. Em vez de simplesmente classificar uma imagem inteira como "contendo um carro", uma caixa delimitadora permite que um modelo determine a localização exata e a extensão espacial do carro, separando-o do fundo e de outras entidades. Esta capacidade de localização é essencial para tarefas de deteção de objetos, cujo objetivo é identificar vários objetos simultaneamente com elevada precisão.
Conceitos fundamentais e coordenadas#
Para processar dados visuais de forma eficaz, os modelos de aprendizagem automática (ML) dependem de sistemas de coordenadas específicos para representar matematicamente as caixas delimitadoras. O formato escolhido determina frequentemente como os dados são preparados para o treino do modelo e como o modelo produz as suas previsões.
- Coordenadas XYXY: Este formato define uma caixa utilizando os valores absolutos dos píxeis do canto superior esquerdo e do canto inferior direito. É intuitivo para ferramentas de visualização como OpenCV ou Matplotlib ao desenhar retângulos diretamente sobre imagens.
- Formato XYWH: Comum em conjuntos de dados como o COCO, este método especifica o ponto central do objeto, seguido pela largura e altura da caixa. Esta representação é fundamental para calcular funções de perda durante o processo de aprendizagem.
- Coordenadas normalizadas: Para garantir a escalabilidade entre imagens com diferentes resoluções, as coordenadas são frequentemente escaladas para um intervalo entre 0 e 1. Isto ajuda os modelos a generalizar melhor ao analisar entradas com dimensões variadas.
Aplicações no mundo real#
As caixas delimitadoras são os blocos de construção de inúmeras soluções de AI em diversos setores. Ao permitirem uma localização precisa, possibilitam que os sistemas interajam de forma inteligente com o mundo físico.
- Veículos autónomos: Os carros autónomos utilizam caixas delimitadoras para detetar e acompanhar peões, outros veículos, sinais de trânsito e obstáculos em tempo real. Esta perceção espacial é crucial para que os sistemas de navegação e segurança tomem decisões em frações de segundo.
- Análise de retalho: Em lojas inteligentes, as caixas delimitadoras ajudam a monitorizar o inventário nas prateleiras e a acompanhar as interações dos clientes com os produtos. Estes dados podem automatizar o reaprovisionamento e fornecer informações sobre o comportamento dos compradores sem contagem manual.
Caixas delimitadoras em ação#
Ao utilizar arquiteturas modernas como o YOLO26, o modelo prevê caixas delimitadoras juntamente com um rótulo de classe e uma pontuação de confiança. O exemplo seguinte demonstra como executar a inferência numa imagem e aceder às coordenadas da caixa delimitadora utilizando o pacote ultralytics.
from ultralytics import YOLO
# Load the YOLO26 model
model = YOLO("yolo26n.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Access bounding box coordinates (xyxy format) for the first detected object
boxes = results[0].boxes
print(boxes.xyxy[0]) # Output: tensor([x1, y1, x2, y2, ...])Termos relacionados e diferenciação#
Embora as caixas delimitadoras sejam padrão para a deteção geral, distinguem-se de outros tipos de anotação utilizados em tarefas mais granulares.
- Segmentação de instâncias: Ao contrário de uma caixa delimitadora retangular, a segmentação cria uma máscara com precisão ao nível do píxel que traça o contorno exato de um objeto. Isto é útil quando a forma precisa é mais importante do que a localização geral.
- Caixa delimitadora orientada (OBB): As caixas delimitadoras padrão estão alinhadas com os eixos (retângulos direitos). As OBB podem rodar para se ajustarem a objetos inclinados, como navios em imagens de satélite ou embalagens numa correia transportadora, proporcionando um ajuste mais preciso e reduzindo o ruído do fundo.
- Pontos-chave: Em vez de englobarem um objeto, os pontos-chave identificam pontos de referência específicos, como as articulações do corpo humano para a estimativa de pose.
Ferramentas para anotação e gestão#
A criação de anotações de caixas delimitadoras de alta qualidade é uma etapa crítica no pipeline de ML. A Ultralytics Platform simplifica este processo ao oferecer ferramentas para anotação de dados e gestão de conjuntos de dados. Uma anotação adequada garante que os modelos aprendam a distinguir os objetos com precisão, minimizando erros como sobreajuste ou confusão com o fundo. Técnicas avançadas como a Supressão não máxima (NMS) são utilizadas durante a inferência para refinar estas previsões, removendo caixas sobrepostas e garantindo que apenas a deteção mais precisa permaneça para cada objeto.









