Melhorar a previsão de colisões com modelos Ultralytics YOLO
Aprende como os conhecimentos obtidos a partir dos modelos Ultralytics YOLO ajudam os sistemas de previsão de colisões a tomar decisões mais seguras e rápidas em ambientes dinâmicos.

Apesar de teres cuidado na estrada, os acidentes podem acontecer. Um carro muda de faixa, um peão atravessa fora da passadeira ou um ciclista acelera sem avisar. Estes momentos do dia a dia são exemplos de situações em que os sistemas de previsão de colisões podem fazer uma grande diferença e ajudar a manter toda a gente em segurança.
Anteriormente, analisámos a previsão da trajetória de uma bola e vimos como prever o percurso de uma bola em movimento rápido ajuda a análise desportiva a compreender o movimento e a antecipar o que acontece a seguir. A previsão de colisões funciona de forma semelhante.
Essencialmente, estes sistemas de previsão tentam antever o futuro. Ao observar como os veículos e os peões se movem, conseguem detetar riscos atempadamente e ajustar a sua trajetória ou comportamento antes de (também conhecido como planeamento de movimento ou planeamento de trajetória) as coisas se tornarem perigosas.
As principais tecnologias de informática por detrás dos sistemas de previsão de colisões são a inteligência artificial e os seus subcampos, como a visão computacional e os métodos de previsão que ajudam a antecipar como as coisas se vão mover. Por exemplo, modelos de visão computacional como o Ultralytics YOLO11 e o futuro Ultralytics YOLO26 podem ser utilizados para detetar e acompanhar objetos como veículos e peões em tempo real, enquanto os modelos de previsão utilizam essas informações para estimar os seus próximos movimentos.

Fig. 1. Um exemplo da utilização do YOLO11 para detetar objetos na estrada (Fonte).
O resultado é um sistema de IA que compreende o que está a acontecer à sua volta e apoia uma tomada de decisões mais inteligente em ambientes dinâmicos. Neste artigo, vamos explorar como funciona a previsão de colisões, os métodos que lhe estão subjacentes e o papel que a visão computacional e os modelos YOLO da Ultralytics podem desempenhar no processo. Vamos começar!
O que é a previsão de colisões?#
A previsão de colisões é a capacidade de um sistema de IA compreender como os objetos se estão a mover e antecipar quando podem aproximar-se muito ou entrar em contacto. Diferentes sistemas podem utilizar estas informações de várias formas, incluindo apoiar funcionalidades de segurança, otimizar movimentos ou coordenar ações em espaços partilhados.
Sempre que os objetos se movem num espaço partilhado, seja no caso de carros numa autoestrada, empilhadores no corredor de um armazém ou peões a atravessar uma rua, a previsão de colisões ajuda os sistemas a compreender como estas interações podem evoluir. Em aplicações orientadas para a segurança, esta antecipação pode ser utilizada para reduzir riscos, enquanto noutros contextos pode apoiar tarefas como o planeamento de rotas, a sincronização ou o movimento coordenado.
Por exemplo, em muitos veículos recentes equipados com sistemas avançados de assistência ao condutor, ou ADAS, câmaras e sensores monitorizam a estrada à frente e estimam a rapidez com que o carro se aproxima de objetos próximos. Se o sistema detetar que uma situação pode tornar-se insegura, alerta o condutor e, em alguns casos, a travagem automática pode ajudar a reduzir o impacto.
Explorar as quatro etapas da previsão de colisões#
A previsão de colisões envolve um processo coordenado no qual diferentes componentes de IA trabalham em conjunto para identificar objetos, acompanhar o seu movimento e estimar o que pode acontecer a seguir. Normalmente, estes sistemas funcionam através de quatro etapas ligadas: deteção de objetos, acompanhamento de objetos, previsão de trajetórias e, por fim, previsão de colisões, sendo que cada etapa se baseia na precisão da anterior.
De seguida, vamos analisar mais detalhadamente o funcionamento de cada etapa.
Uma análise da deteção de objetos#
A deteção de objetos é uma tarefa essencial de visão computacional na qual os modelos de IA de visão identificam e localizam objetos numa imagem ou num fotograma de vídeo. Ao analisar dados de píxeis, um modelo de deteção de objetos pode produzir três resultados principais: caixas delimitadoras, classes de objetos e pontuações de confiança. As caixas delimitadoras mostram onde está um objeto, as classes de objetos indicam o que ele é, como um carro, um peão ou um ciclista, e as pontuações de confiança refletem o grau de certeza do modelo relativamente à previsão.
Modelos de IA de visão como YOLO11 e YOLO26 baseiam-se nesta fundação e suportam várias tarefas relacionadas, incluindo deteção de objetos, acompanhamento de objetos e deteção de caixas delimitadoras orientadas (OBB). A deteção de objetos informa um sistema de previsão sobre o que está em cada fotograma, o acompanhamento segue esses objetos à medida que se movem e as caixas delimitadoras orientadas fornecem formas mais precisas para objetos que aparecem em diferentes ângulos.
Nesta etapa, um sistema de previsão de colisões concentra-se exclusivamente em compreender o que está presente nos dados visuais. Forma a camada de base de informação de que dependem todas as etapas posteriores, mas ainda não considera como os objetos se vão mover ou interagir.
Uma visão geral do acompanhamento de objetos#
Depois de os objetos serem detetados, o passo seguinte consiste em acompanhá-los entre fotogramas para que o sistema possa compreender como se movem ao longo do tempo. Embora a deteção forneça novas caixas delimitadoras em cada fotograma, o acompanhamento de objetos acrescenta continuidade ao associar essas deteções ao longo do tempo.
Os algoritmos de acompanhamento suportados pelo pacote Python da Ultralytics, como ByteTrack ou BoT-SORT, funcionam com modelos como YOLO11 utilizando os dados de deteção de cada fotograma para seguir os objetos à medida que se movem. Estes algoritmos atribuem um ID único a cada objeto e utilizam-no para manter essa identidade, mesmo quando o objeto se move rapidamente ou fica parcialmente oculto. Isto cria um histórico de acompanhamento contínuo que regista como o objeto se move.

Fig. 2. Uma análise da atribuição de IDs únicos a diferentes deteções utilizando YOLO (Fonte)
Eis uma breve visão geral do funcionamento destes dois métodos de acompanhamento:
- ByteTrack: Utiliza deteções com confiança alta e baixa para manter IDs de objetos consistentes, enquanto as previsões de movimento de um Filtro de Kalman ajudam o rastreador a manter-se estável quando os objetos se movem rapidamente ou são difíceis de detetar durante breves períodos.
- BoT-SORT: Este algoritmo amplia o SORT ao combinar previsões de movimento do Filtro de Kalman com indicações de aparência, permitindo ao rastreador seguir objetos de forma mais fiável em cenas com muita gente ou durante uma oclusão parcial.
Para medir o desempenho destes métodos de acompanhamento, os investigadores avaliam-nos em conjuntos de dados e benchmarks estabelecidos de acompanhamento de múltiplos objetos (MOT). As métricas habitualmente utilizadas incluem a precisão do acompanhamento de múltiplos objetos (MOTA), que reflete a qualidade geral do acompanhamento; a pontuação F1 de identificação (IDF1), que mede a consistência com que as identidades dos objetos são mantidas; e a precisão de acompanhamento de ordem superior (HOTA), que oferece uma perspetiva equilibrada tanto do desempenho da deteção como da precisão da associação.
Compreender a previsão de trajetórias#
Depois de acompanhar um objeto ao longo de vários fotogramas, o passo seguinte consiste em prever para onde ele irá. Isto é conhecido como previsão de trajetórias. Enquanto a deteção encontra os objetos e o acompanhamento segue a forma como se movem, a previsão olha para o futuro e estima as suas posições futuras.
As informações provenientes da deteção e do acompanhamento, como a caixa delimitadora de um objeto, a posição ao longo dos fotogramas e o ID atribuído, podem ser utilizadas para calcular características do movimento, como a velocidade, a direção e os padrões de movimento. Estas informações derivadas fornecem ao modelo de previsão os dados necessários para estimar onde é provável que o objeto esteja nos próximos segundos.
Nos casos em que os dados de acompanhamento contêm lacunas ou saltos abruptos, as técnicas de interpolação ajudam a reconstruir trajetórias mais suaves e consistentes. Isto garante que o modelo de previsão recebe dados de movimento de alta qualidade, em vez de dados de posição ruidosos ou incompletos.

Fig. 3. Uma visualização da previsão da trajetória de um carro. (Fonte)
Para fazer estas previsões, muitos sistemas utilizam modelos de aprendizagem profunda concebidos para compreender como o movimento de um objeto muda ao longo do tempo. Ao analisarem sequências de posições anteriores e as características de movimento delas derivadas, estes modelos aprendem padrões de movimento comuns e utilizam esse conhecimento para prever trajetórias futuras.
Eis algumas abordagens comuns de aprendizagem profunda e aprendizagem automática para a previsão de trajetórias:
-
Redes Neuronais Recorrentes (RNNs): As RNNs são modelos de aprendizagem profunda concebidos para trabalhar com sequências, como uma série de fotogramas de vídeo. Conseguem manter uma memória das posições anteriores e utilizar essas informações para compreender como um objeto se tem movido. Isto ajuda o sistema a reconhecer padrões de movimento simples, como acelerar, abrandar ou mover-se em linha reta.
-
Redes de Memória de Longo e Curto Prazo (LSTMs): As LSTMs são um tipo mais avançado de RNN que consegue memorizar informações durante períodos mais longos. Isto permite-lhes captar movimentos mais complexos, como um veículo a preparar-se para virar ou um peão a mudar de direção. Como conseguem acompanhar tendências mais longas, produzem frequentemente previsões mais fiáveis em ambientes movimentados.
-
Transformers: Os Transformers processam sequências completas de movimento e utilizam atenção para se concentrarem nos detalhes mais importantes dessas sequências. Isto torna-os especialmente eficazes em cenas onde vários objetos interagem, como carros a entrar na mesma via ou peões a atravessar a rua.
Estes modelos podem prever trajetórias tanto de curto como de longo prazo. As previsões de curto prazo, normalmente inferiores a dois segundos, tendem a ser as mais precisas, enquanto as previsões para intervalos mais longos, como dois a seis segundos, oferecem uma maior antecipação, mas envolvem mais incerteza.
Reunir tudo: algoritmos de deteção de colisões#
Na etapa final, a previsão de colisões, o sistema utiliza tudo o que aprendeu até então: o que é cada objeto (deteção), como se moveu (acompanhamento) e para onde é provável que se dirija (previsão). Esta etapa verifica se alguma das trajetórias previstas poderá se cruzar de forma a provocar uma colisão.

Fig. 4. Como funciona um sistema de previsão de colisões (Fonte)
No caso dos veículos autónomos, um sistema de verificação de colisões compara as trajetórias futuras de objetos próximos, como carros, peões e ciclistas. Se duas trajetórias previstas se sobrepuserem ou ficarem perigosamente próximas, o sistema assinala a situação como uma potencial colisão entre veículos. Para compreender o grau de urgência do risco de colisão, o sistema também calcula um valor conhecido como tempo até à colisão.
O tempo até à colisão (TTC) é uma medição essencial em ambientes de movimento rápido. Estima quanto tempo falta até dois objetos colidirem se continuarem com as velocidades e direções atuais. Quando o TTC desce abaixo de um determinado limiar, o sistema pode responder emitindo avisos, acionando os travões ou ajustando a trajetória planeada.
Aplicações reais da previsão de colisões#
A previsão de colisões está a tornar-se crucial em muitos setores, incluindo a gestão de tráfego, a infraestrutura de cidades inteligentes, a automação industrial e a robótica móvel. À medida que os modelos de visão computacional e de previsão de última geração continuam a evoluir, estes sistemas tornam-se cada vez mais capazes de antecipar movimentos.
Agora que compreendemos melhor como funcionam a previsão de colisões e a previsão de trajetórias, vamos analisar alguns estudos de investigação interessantes que mostram como estes métodos podem ser utilizados em vários ambientes reais.
Previsão de colisões para veículos autónomos de emergência com tecnologia YOLO#
Navegar em ambientes movimentados e imprevisíveis é um dos desafios mais difíceis para os sistemas autónomos, especialmente quando os peões se movem de formas que não seguem padrões claros. Os veículos de emergência enfrentam este problema com ainda maior frequência, pois precisam de se deslocar rapidamente a alta velocidade por espaços públicos densos, sem depender de estradas estruturadas, marcações de faixa ou comportamentos previsíveis dos peões.
Neste tipo de cenário, compreender onde estão as pessoas e como poderão mover-se nos próximos segundos torna-se essencial para evitar acidentes. Por exemplo, um estudo de investigação recente explorou este desafio ao criar um pipeline completo de previsão de colisões para um Veículo Autónomo de Emergência (EAV) a operar em ambientes com muitos peões.
Como funciona o pipeline de previsão de colisões com tecnologia YOLO#
Eis uma breve visão geral do funcionamento desta metodologia:
- Deteção de peões utilizando YOLO: Um detetor baseado em YOLO identifica os peões em cada fotograma da câmara e produz caixas delimitadoras para cada pessoa visível.
- Acompanhamento do movimento com ByteTrack: O algoritmo ByteTrack associa estas deteções entre fotogramas, atribuindo a cada peão um ID consistente e criando um histórico de movimento que mostra como se desloca ao longo do tempo.
- Estimativa da posição no mundo real: O Mapeamento de Perspetiva Inversa (IPM) converte coordenadas de píxeis 2D em posições aproximadas no plano do solo, ajudando o sistema a compreender onde estão os peões no espaço real relativamente ao veículo.
- Geração de uma vista aérea utilizando um cGAN: Uma GAN condicional, um modelo de IA que converte um formato de imagem noutro, cria uma representação da cena numa vista aérea. Esta disposição de cima para baixo facilita a interpretação das posições dos peões e do ambiente envolvente.
- Previsão de trajetórias com um modelo LSTM: Utilizando as posições anteriores e os padrões de movimento de cada peão, um modelo LSTM prevê para onde é provável que se desloquem nos próximos segundos.
- Deteção eficiente de colisões utilizando cones de colisão: As trajetórias previstas são comparadas através do método dos cones de colisão, que determina se as trajetórias do veículo e de algum peão estão prestes a se cruzar.
- Prevenção de colisões através de sinalização: Se o sistema prever uma colisão, ativa um sinal sonoro (como uma buzina ou campainha) no momento ideal. O momento é escolhido para influenciar o comportamento dos peões e dar-lhes a oportunidade de acelerar ou abrandar para chegarem a um local seguro.
Garantir a segurança dos peões nas cidades utilizando visão na periferia e YOLO#
De forma semelhante, outra abordagem à prevenção de colisões vai além dos veículos e concentra-se na própria infraestrutura. Em vez de depender de sensores instalados num carro, este método utiliza câmaras inteligentes instaladas em passadeiras e cruzamentos para monitorizar em tempo real o movimento de peões e veículos. Estes locais são frequentemente imprevisíveis; as pessoas podem entrar repentinamente na estrada, os ciclistas podem ziguezaguear pelo trânsito e os condutores podem nem sempre abrandar, pelo que é essencial detetar os riscos atempadamente.
Um estudo interessante explorou esta ideia através de um sistema chamado NAVIBox, um dispositivo de visão na periferia concebido para prever diretamente os riscos entre veículos e peões no cruzamento. O sistema utiliza o modelo Ultralytics YOLOv8 para detetar peões e veículos, e um rastreador Centroid leve para os acompanhar entre fotogramas. Isto cria históricos de movimento curtos e fiáveis, que são depois refinados através de uma transformação de perspetiva que converte a vista inclinada da CCTV numa disposição aérea mais clara da estrada.
Com estas trajetórias refinadas, o NAVIBox consegue estimar como é provável que os utilizadores da estrada se movam nos próximos segundos e verificar se as suas trajetórias se podem cruzar (também referido como um teste de interseção). Quando o sistema deteta uma interação de risco, envia imediatamente avisos através de ecrãs para os condutores e altifalantes para os peões, sem depender de um servidor remoto ou de uma ligação de rede. Os testes realizados em locais urbanos reais mostraram que o NAVIBox funciona suficientemente depressa para responder verdadeiramente em tempo real e identificar com precisão potenciais cenários de colisão, tornando-o uma ferramenta de segurança prática para cruzamentos urbanos movimentados.

Fig. 5. Previsão do risco de colisão entre veículos e peões. (Fonte)
Vantagens e desvantagens da deteção e previsão de colisões#
Eis algumas vantagens da utilização de sistemas preditivos de colisão baseados em IA:
-
Melhora a consciência situacional: Os sistemas de IA mapeiam continuamente a forma como os objetos se movem num ambiente, proporcionando uma compreensão mais abrangente do fluxo de multidões em grande escala, do comportamento do trânsito ou das trajetórias das máquinas.
-
Informações baseadas em dados para o planeamento a longo prazo: Ao registarem deteções, quase acidentes e padrões de movimento, os sistemas de IA fornecem análises que os responsáveis pelo planeamento urbano, as equipas de segurança e os operadores de frotas podem utilizar para redesenhar cruzamentos, melhorar a sinalização ou aperfeiçoar políticas operacionais.
-
Prevenção de riscos económica: Ao detetarem riscos antes de estes se agravarem, estes sistemas podem evitar acidentes dispendiosos, reclamações de seguros ou reparações de equipamento.
Apesar dos seus benefícios, os sistemas de prevenção de colisões também enfrentam algumas limitações. Eis alguns desafios a considerar:
- Restrições na colocação de sensores e câmaras: Câmaras mal posicionadas ou inclinadas podem distorcer o tamanho ou a distância dos objetos, tornando menos fiáveis a estimativa de profundidade e a previsão de trajetórias.
- Oclusão: Os objetos podem ficar parcial ou totalmente ocultos atrás de outros. Isto dificulta o acompanhamento de objetos, uma vez que o modelo perde a continuidade visual.
- Condições ambientais: Iluminação reduzida, luz solar intensa, chuva, nevoeiro ou baixa qualidade da câmara podem diminuir a capacidade do modelo de ver claramente a cena, afetando a precisão.
Principais conclusões#
A previsão de colisões reúne duas capacidades poderosas: a visão computacional, que permite aos sistemas compreender o que está a acontecer no ambiente neste momento, e a previsão de trajetórias, que os ajuda a antecipar o que é provável que aconteça a seguir.
Ao combinarem estas capacidades, as máquinas podem detetar objetos em movimento em tempo real e prever como esses objetos poderão interagir nos segundos seguintes. À medida que as técnicas de visão computacional e de previsão continuam a evoluir, a previsão de colisões deverá tornar-se fundamental para criar sistemas autónomos mais seguros, fiáveis e escaláveis.
Consulta a nossa comunidade e o nosso repositório no GitHub para saberes mais sobre IA. Explora aplicações como IA na área da saúde e visão computacional na indústria nas nossas páginas de soluções. Descobre as nossas opções de licenciamento e começa já a criar!









