Mejora de la predicción de colisiones con modelos Ultralytics YOLO
Descubre cómo los conocimientos extraídos de los modelos Ultralytics YOLO ayudan a los sistemas de predicción de colisiones a tomar decisiones más seguras y rápidas en entornos dinámicos.

Aunque tengas cuidado en la carretera, los accidentes pueden ocurrir. Un coche cambia de carril, un peatón cruza por donde no debe o un ciclista acelera sin avisar. Estos momentos cotidianos son ejemplos de situaciones en las que los sistemas de predicción de colisiones pueden marcar una gran diferencia y ayudar a mantener a todo el mundo a salvo.
Anteriormente, analizamos la predicción de la trayectoria de una pelota y vimos cómo predecir el recorrido de una pelota que se mueve rápidamente ayuda a la analítica deportiva a comprender el movimiento y anticipar lo que ocurrirá después. La predicción de colisiones funciona de forma similar.
En esencia, estos sistemas de predicción miran hacia el futuro. Al observar cómo se mueven los vehículos y los peatones, pueden detectar los riesgos con antelación y ajustar su trayectoria o comportamiento antes de que (lo que también se conoce como planificación del movimiento o planificación de trayectorias) la situación se vuelva peligrosa.
Las principales tecnologías informáticas en las que se basan los sistemas de predicción de colisiones son la inteligencia artificial y sus subcampos, como la visión por ordenador y los métodos de predicción que ayudan a anticipar cómo se moverán las cosas. Por ejemplo, los modelos de visión por ordenador como Ultralytics YOLO11 y el próximo Ultralytics YOLO26 pueden utilizarse para detectar y seguir objetos como vehículos y peatones en tiempo real, mientras que los modelos de predicción utilizan esa información para estimar sus próximos movimientos.

Fig. 1. Ejemplo del uso de YOLO11 para detectar objetos en la carretera (Fuente).
El resultado es un sistema de IA que comprende lo que ocurre a su alrededor y permite tomar decisiones más inteligentes en entornos dinámicos. En este artículo, analizaremos cómo funciona la predicción de colisiones, los métodos en los que se basa y el papel que pueden desempeñar la visión por ordenador y los modelos YOLO de Ultralytics en este proceso. ¡Empecemos!
¿Qué es la predicción de colisiones?#
La predicción de colisiones es la capacidad de un sistema de IA para comprender cómo se mueven los objetos y anticipar cuándo pueden acercarse mucho o entrar en contacto. Los distintos sistemas pueden utilizar esta información de muchas formas, como para desarrollar funciones de seguridad, optimizar el movimiento o coordinar acciones en espacios compartidos.
Siempre que los objetos se desplazan por un espacio compartido, ya sean coches en una autopista, carretillas elevadoras en el pasillo de un almacén o peatones cruzando una calle, la predicción de colisiones ayuda a los sistemas a comprender cómo pueden desarrollarse estas interacciones. En las aplicaciones centradas en la seguridad, esta previsión puede utilizarse para reducir el riesgo, mientras que en otros contextos puede facilitar tareas como la planificación de rutas, la sincronización o el movimiento coordinado.
Por ejemplo, en muchos vehículos nuevos equipados con sistemas avanzados de asistencia a la conducción, o ADAS, las cámaras y los sensores supervisan la carretera y estiman la rapidez con la que el coche se aproxima a los objetos cercanos. Si el sistema detecta que una situación podría volverse peligrosa, avisa al conductor y, en algunos casos, el frenado automático puede ayudar a reducir el impacto.
Exploración de las cuatro etapas de la predicción de colisiones#
La predicción de colisiones implica un proceso coordinado en el que distintos componentes de IA trabajan conjuntamente para identificar objetos, seguir su movimiento y estimar qué puede ocurrir después. Estos sistemas suelen funcionar mediante cuatro etapas conectadas: detección de objetos, seguimiento de objetos, predicción de trayectorias y, por último, predicción de colisiones, de modo que cada etapa se basa en la precisión de la anterior.
A continuación, veremos más de cerca cómo funciona cada etapa.
Una mirada a la detección de objetos#
La detección de objetos es una tarea fundamental de la visión por ordenador en la que los modelos de IA de visión identifican y localizan objetos en una imagen o fotograma de vídeo. Al analizar los datos de los píxeles, un modelo de detección de objetos puede generar tres resultados principales: cuadros delimitadores, clases de objetos y puntuaciones de confianza. Los cuadros delimitadores muestran dónde se encuentra un objeto, las clases de objetos indican qué es, como un coche, un peatón o un ciclista, y las puntuaciones de confianza reflejan el grado de certeza del modelo sobre la predicción.
Los modelos de IA de visión como YOLO11 y YOLO26 se basan en estos fundamentos y admiten varias tareas relacionadas, como la detección de objetos, el seguimiento de objetos y la detección de cuadros delimitadores orientados (OBB). La detección de objetos indica al sistema de predicción qué hay en cada fotograma, el seguimiento sigue esos objetos mientras se mueven y los cuadros delimitadores orientados proporcionan formas más precisas para los objetos que aparecen en distintos ángulos.
En esta etapa, el sistema de predicción de colisiones se centra exclusivamente en comprender qué aparece en los datos visuales. Esto forma la capa de información base de la que dependen todos los pasos posteriores, pero todavía no tiene en cuenta cómo se moverán o interactuarán los objetos.
Una visión general del seguimiento de objetos#
Una vez detectados los objetos, el siguiente paso consiste en seguirlos entre fotogramas para que el sistema pueda comprender cómo se mueven a lo largo del tiempo. Mientras que la detección proporciona nuevos cuadros delimitadores en cada fotograma, el seguimiento de objetos aporta continuidad al vincular esas detecciones a lo largo del tiempo.
Los algoritmos de seguimiento compatibles con el paquete de Python de Ultralytics, como ByteTrack o BoT-SORT, funcionan con modelos como YOLO11 utilizando los datos de detección de cada fotograma para seguir los objetos mientras se mueven. Estos algoritmos asignan un ID único a cada objeto y lo utilizan para mantener su identidad incluso cuando el objeto se mueve rápidamente o queda parcialmente oculto. Así se crea un historial de seguimiento fluido que registra cómo se mueve el objeto.

Fig. 2. Ejemplo de asignación de ID únicos a distintas detecciones mediante YOLO (Fuente)
Veamos rápidamente cómo funcionan estos dos métodos de seguimiento:
- ByteTrack: Utiliza detecciones con niveles de confianza altos y bajos para mantener unos ID de objeto coherentes, mientras que las predicciones de movimiento de un filtro de Kalman ayudan al rastreador a mantenerse estable cuando los objetos se mueven rápidamente o son difíciles de detectar durante un breve periodo.
- BoT-SORT: Este algoritmo amplía SORT combinando las predicciones de movimiento del filtro de Kalman con indicios de apariencia, lo que permite al rastreador seguir los objetos con mayor fiabilidad en escenas multitudinarias o durante oclusiones parciales.
Para medir el rendimiento de estos métodos de seguimiento, los investigadores los evalúan en conjuntos de datos y pruebas de referencia consolidados de seguimiento de múltiples objetos (MOT). También se utilizan habitualmente métricas como la precisión del seguimiento de múltiples objetos (MOTA), que refleja la calidad general del seguimiento; la puntuación F1 de identificación (IDF1), que mide la coherencia con la que se mantienen las identidades de los objetos; y la precisión de seguimiento de orden superior (HOTA), que ofrece una visión equilibrada del rendimiento de la detección y la precisión de la asociación.
Comprender la predicción de trayectorias#
Después de seguir un objeto a lo largo de varios fotogramas, el siguiente paso es predecir adónde se dirigirá. Esto se conoce como predicción de trayectorias. Mientras que la detección encuentra los objetos y el seguimiento registra cómo se mueven, la predicción mira hacia delante y estima sus posiciones futuras.
La información de la detección y el seguimiento, como el cuadro delimitador de un objeto, su posición a lo largo de los fotogramas y el ID asignado, puede utilizarse para calcular características del movimiento, como la velocidad, la dirección y los patrones de desplazamiento. Estos datos derivados proporcionan al modelo de predicción la información que necesita para estimar dónde es probable que se encuentre el objeto durante los próximos segundos.
Cuando los datos de seguimiento contienen interrupciones o saltos bruscos, las técnicas de interpolación ayudan a reconstruir trayectorias más suaves y coherentes. Así se garantiza que el modelo de predicción reciba información de movimiento de alta calidad, en lugar de datos de posición incompletos o con ruido.

Fig. 3. Visualización de la predicción de la trayectoria de un coche. (Fuente)
Para realizar estas predicciones, muchos sistemas utilizan modelos de aprendizaje profundo diseñados para comprender cómo cambia el movimiento de un objeto con el tiempo. Al analizar secuencias de posiciones anteriores y las características de movimiento derivadas de ellas, estos modelos aprenden patrones de desplazamiento habituales y utilizan ese conocimiento para predecir trayectorias futuras.
Estos son algunos enfoques habituales de aprendizaje profundo y aprendizaje automático para la predicción de trayectorias:
-
Redes neuronales recurrentes (RNNs): Las RNNs son modelos de aprendizaje profundo diseñados para trabajar con secuencias, como una serie de fotogramas de vídeo. Pueden conservar una memoria de las posiciones anteriores y utilizar esa información para comprender cómo se ha estado moviendo un objeto. Esto ayuda al sistema a reconocer patrones de movimiento sencillos, como acelerar, reducir la velocidad o desplazarse en línea recta.
-
Redes de memoria a corto y largo plazo (LSTMs): Las LSTMs son un tipo más avanzado de RNN capaz de recordar información durante periodos más largos. Esto les permite captar movimientos más complejos, como un vehículo que se prepara para girar o un peatón que cambia de dirección. Como pueden seguir tendencias más prolongadas, suelen producir predicciones más fiables en entornos concurridos.
-
Transformers: Los Transformers procesan secuencias completas de movimiento y utilizan la atención para centrarse en los detalles más importantes de dichas secuencias. Esto los hace especialmente eficaces en escenas en las que interactúan varios objetos, como coches que se incorporan o peatones que cruzan.
Estos modelos pueden predecir trayectorias tanto a corto como a largo plazo. Las predicciones a corto plazo, normalmente inferiores a dos segundos, suelen ser las más precisas, mientras que las predicciones para intervalos más largos, como de dos a seis segundos, ofrecen una mayor previsión, pero conllevan más incertidumbre.
Unirlo todo: algoritmos de detección de colisiones#
En la etapa final, la predicción de colisiones, el sistema utiliza todo lo aprendido hasta ese momento: qué es cada objeto (detección), cómo se ha movido (seguimiento) y adónde es probable que se dirija (predicción). Este paso comprueba si alguna de las trayectorias predichas podría cruzarse de forma que provocara una colisión.

Fig. 4. Cómo funciona un sistema de predicción de colisiones (Fuente)
En el caso de los vehículos autónomos, un sistema de comprobación de colisiones compara las trayectorias futuras de objetos cercanos, como coches, peatones y ciclistas. Si dos trayectorias predichas se solapan o se acercan peligrosamente, marca la situación como una posible colisión entre vehículos. Para comprender la urgencia del riesgo de colisión, el sistema también calcula un valor conocido como tiempo hasta la colisión.
El tiempo hasta la colisión (TTC) es una medida clave en entornos con movimiento rápido. Estima cuánto tiempo queda antes de que dos objetos colisionen si continúan a sus velocidades y en sus direcciones actuales. Cuando el TTC cae por debajo de un umbral determinado, el sistema puede responder emitiendo avisos, accionando los frenos o ajustando la trayectoria planificada.
Aplicaciones reales de la predicción de colisiones#
La predicción de colisiones se está volviendo crucial en muchos sectores, como la gestión del tráfico, las infraestructuras de ciudades inteligentes, la automatización industrial y la robótica móvil. A medida que avanzan los modelos de visión por ordenador y predicción más avanzados, estos sistemas son cada vez más capaces de anticipar los movimientos.
Ahora que comprendemos mejor cómo funcionan la predicción de colisiones y la predicción de trayectorias, veamos algunos estudios de investigación interesantes que muestran cómo pueden utilizarse estos métodos en diversos entornos reales.
Predicción de colisiones basada en YOLO para vehículos autónomos de emergencia#
Desplazarse por entornos abarrotados e impredecibles es uno de los mayores retos para los sistemas autónomos, especialmente cuando los peatones se mueven de formas que no siguen patrones claros. Los vehículos de emergencia se enfrentan a este problema con mayor frecuencia, ya que necesitan desplazarse rápidamente a velocidades elevadas por espacios públicos densos sin depender de carreteras estructuradas, marcas viales o comportamientos previsibles de los peatones.
En este tipo de situaciones, comprender dónde se encuentran las personas y cómo podrían moverse durante los próximos segundos resulta esencial para evitar accidentes. Por ejemplo, un estudio de investigación reciente analizó este reto mediante la creación de una canalización completa de predicción de colisiones para un vehículo autónomo de emergencia (EAV) que opera en entornos con gran presencia de peatones.
Cómo funciona la canalización de predicción de colisiones basada en YOLO#
Este es un resumen del funcionamiento de esta metodología:
- Detección de peatones mediante YOLO: Un detector basado en YOLO identifica a los peatones en cada fotograma de la cámara y genera cuadros delimitadores para cada persona visible.
- Seguimiento del movimiento con ByteTrack: El algoritmo ByteTrack vincula estas detecciones entre fotogramas, asigna a cada peatón un ID coherente y crea un historial de movimiento que muestra cómo se desplaza con el tiempo.
- Estimación de la posición en el mundo real: El mapeo de perspectiva inversa (IPM) convierte las coordenadas de píxel 2D en posiciones aproximadas sobre el plano del suelo, lo que ayuda al sistema a comprender dónde están los peatones en el espacio real con respecto al vehículo.
- Generación de una vista cenital mediante una cGAN: Una GAN condicional, un modelo de IA que transforma un formato de imagen en otro, crea una representación cenital de la escena. Esta disposición desde arriba facilita la interpretación de las posiciones de los peatones y de su entorno.
- Predicción de trayectorias con un modelo LSTM: Mediante las posiciones anteriores y los patrones de movimiento de cada peatón, un modelo LSTM predice hacia dónde es probable que se desplace durante los próximos segundos.
- Detección eficiente de colisiones mediante conos de colisión: Las trayectorias predichas se comparan mediante el método de los conos de colisión, que determina si las trayectorias del vehículo y de algún peatón están encaminadas a cruzarse.
- Evitación de colisiones mediante señales: Si el sistema predice una colisión, activa una señal sonora, como un claxon o una campana, en el momento óptimo. La sincronización se elige para influir en el comportamiento de los peatones y darles la oportunidad de acelerar o reducir la velocidad para ponerse a salvo.
Garantizar la seguridad de los peatones en las ciudades mediante visión en el edge y YOLO#
Del mismo modo, otro enfoque para prevenir colisiones va más allá de los vehículos y se centra en la propia infraestructura. En lugar de depender de sensores dentro de un coche, este método utiliza cámaras inteligentes instaladas en pasos de peatones e intersecciones para supervisar en tiempo real cómo se mueven los peatones y los vehículos. Estos lugares suelen ser impredecibles: las personas pueden irrumpir repentinamente en la calzada, los ciclistas pueden zigzaguear entre el tráfico y los conductores no siempre pueden reducir la velocidad, por lo que es vital detectar los riesgos con antelación.
Un estudio interesante exploró esta idea mediante un sistema llamado NAVIBox, un dispositivo de visión en el edge diseñado para predecir directamente en la intersección los riesgos entre vehículos y peatones. El sistema utiliza el modelo Ultralytics YOLOv8 para detectar peatones y vehículos, y un rastreador Centroid ligero para seguirlos entre fotogramas. Esto crea historiales de movimiento breves y fiables, que posteriormente se perfeccionan mediante una transformación de perspectiva que convierte la vista angulada de CCTV en una disposición cenital más clara de la carretera.
Con estas trayectorias perfeccionadas, NAVIBox puede estimar cómo es probable que se desplacen los usuarios de la vía durante los próximos segundos y comprobar si sus trayectorias podrían cruzarse (lo que también se denomina prueba de intersección). Cuando el sistema detecta una interacción peligrosa, envía inmediatamente avisos mediante pantallas para los conductores y altavoces para los peatones, sin depender de un servidor remoto ni de una conexión de red. Las pruebas realizadas en ubicaciones urbanas reales demostraron que NAVIBox funciona con la suficiente rapidez para responder verdaderamente en tiempo real y puede identificar con precisión posibles escenarios de colisión, lo que lo convierte en una herramienta de seguridad práctica para intersecciones urbanas concurridas.

Fig. 5. Predicción del riesgo de colisión entre vehículos y peatones. (Fuente)
Ventajas e inconvenientes de la detección y predicción de colisiones#
Estas son algunas ventajas de utilizar sistemas predictivos de colisiones basados en IA:
-
Mejora el conocimiento de la situación: Los sistemas de IA cartografían continuamente cómo se mueven los objetos en un entorno, proporcionando una comprensión más completa del flujo de multitudes a gran escala, del comportamiento del tráfico o de las trayectorias de las máquinas.
-
Información basada en datos para la planificación a largo plazo: Al registrar detecciones, accidentes evitados por poco y patrones de movimiento, los sistemas de IA proporcionan análisis que los urbanistas, los equipos de seguridad y los operadores de flotas pueden utilizar para rediseñar intersecciones, mejorar la señalización o perfeccionar las políticas operativas.
-
Prevención de riesgos rentable: Al detectar los riesgos antes de que se agraven, estos sistemas pueden ayudar a evitar accidentes costosos, reclamaciones al seguro o reparaciones de equipos.
A pesar de sus ventajas, los sistemas sin colisiones también presentan ciertas limitaciones. Estos son algunos retos que debes tener en cuenta:
- Limitaciones en la ubicación de sensores y cámaras: Las cámaras mal colocadas o anguladas pueden distorsionar el tamaño o la distancia de los objetos, haciendo que la estimación de profundidad y la predicción de trayectorias sean menos fiables.
- Oclusión: Los objetos pueden quedar parcial o totalmente ocultos detrás de otros. Esto dificulta el seguimiento de objetos, ya que el modelo pierde la continuidad visual.
- Condiciones ambientales: La poca iluminación, la luz solar intensa, la lluvia, la niebla o la baja calidad de la cámara pueden reducir la capacidad del modelo para ver la escena con claridad y afectar a la precisión.
Conclusiones clave#
La predicción de colisiones reúne dos capacidades potentes: la visión por ordenador, que permite a los sistemas comprender qué está ocurriendo en el entorno en ese momento, y la predicción de trayectorias, que les ayuda a anticipar lo que probablemente ocurrirá después.
Al combinar estas capacidades, las máquinas pueden detectar objetos en movimiento en tiempo real y predecir cómo podrían interactuar durante los segundos siguientes. A medida que evolucionen las técnicas de visión por ordenador y predicción, la predicción de colisiones probablemente se convertirá en un elemento clave para crear sistemas autónomos más seguros, fiables y escalables.
Consulta nuestra comunidad y nuestro repositorio de GitHub para obtener más información sobre la IA. Explora aplicaciones como la IA en la sanidad y la visión por ordenador en la fabricación en nuestras páginas de soluciones. Descubre nuestras opciones de licencia y empieza a crear hoy mismo.









