Sensor Fusion
La fusión de sensores combina datos de cámaras, LiDAR, radar y otros sensores para obtener una visión más fiable que la de cualquier sensor por separado, como en los coches autónomos.
La fusión de sensores combina mediciones de varios sensores para obtener una comprensión del entorno más precisa, completa y fiable que la que puede proporcionar un solo sensor. En visión artificial, esto suele implicar combinar imágenes de cámaras con datos de LiDAR, radar, GPS, micrófonos o unidades de medición inercial. El concepto general de fusión de sensores permite que las máquinas autónomas aprovechen fortalezas complementarias; por ejemplo, las cámaras captan el color y los detalles semánticos, mientras que el radar mide de forma fiable la distancia y la velocidad cuando hay poca visibilidad.
Cómo funciona la fusión de sensores#
Una canalización de fusión sincroniza primero las lecturas de los sensores, las transforma a un sistema de coordenadas común y estima la incertidumbre de cada medición. Después combina la información en uno de estos tres niveles:
- La fusión temprana combina las entradas sin procesar antes del procesamiento, conserva los detalles, pero exige una alineación precisa.
- La fusión a nivel de características combina representaciones aprendidas después de la extracción de características. Sistemas recientes como la fusión de radar y cámaras RCBEVDet y la fusión de LiDAR y cámaras GAFusion utilizan características de vista aérea y atención para alinear modalidades.
- La fusión tardía combina resultados como los cuadros de detección de objetos, las estimaciones de profundidad o las probabilidades de clase. Es modular y puede seguir funcionando si falla un sensor.
Entre los métodos tradicionales de estimación de estado se encuentran el filtro de Kalman y el filtro de Kalman extendido. Los sistemas modernos de aprendizaje profundo aprenden cada vez más a asignar pesos adaptativos para que los sensores poco fiables contribuyan menos.
Aplicaciones en el mundo real#
- Vehículos autónomos: las cámaras identifican peatones y señales de tráfico, LiDAR proporciona geometría 3D y el radar estima el movimiento. En febrero de 2026, Waymo describió su Waymo Driver de sexta generación como un sistema que utiliza fusión basada en aprendizaje automático de entradas de cámara, LiDAR, radar y audio para aportar redundancia en condiciones meteorológicas difíciles.
- Robótica: Los robots móviles fusionan los datos de cámaras, encoders de rueda, IMU y sensores de distancia para navegar. Combinar la percepción con Visual SLAM ayuda al robot a localizarse mientras cartografía entornos dinámicos.
- Sistemas de visión industrial: Las fábricas combinan sensores RGB, térmicos, de vibración y de profundidad para detectar defectos o fallos de equipos que podrían pasar inadvertidos en imágenes normales.
Fusión de sensores con Ultralytics YOLO#
Ultralytics YOLO26 puede proporcionar la rama de percepción de cámara de un sistema de fusión. Este ejemplo genera detecciones que se pueden asociar con mediciones sincronizadas de radar o profundidad:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg")[0]
for box in result.boxes:
label = result.names[int(box.cls)]
print(label, box.xyxy[0].tolist(), box.conf.item())Para vídeo, el modo de seguimiento de YOLO puede mantener la identidad de los objetos antes de fusionar las estimaciones de distancia o movimiento.
Investigación actual y buenas prácticas#
Las investigaciones de 2024 a 2026 hacen hincapié en la fusión adaptada a las condiciones meteorológicas, las representaciones de vista aérea, el contexto temporal y la degradación gradual. Los trabajos recientes exploran la fusión de LiDAR y radar 4D en condiciones meteorológicas adversas, la fusión adaptada a los sensores y la robustez frente a datos de sensores obsoletos o retrasados.
Entre las prácticas recomendadas se incluyen la calibración espacial precisa, las marcas de tiempo de hardware, la ponderación sensible a la incertidumbre, las pruebas de pérdida de sensores y la validación en distintas condiciones meteorológicas y de iluminación. La sincronización temporal y una configuración coherente de los sensores son esenciales, mientras que conjuntos de datos como MSU-4S permiten realizar pruebas en distintas estaciones.
La fusión de sensores se diferencia de la integración de sensores, que principalmente conecta sensores a un sistema, y del aprendizaje multimodal, que puede combinar entradas no sensoriales, como texto. Los equipos pueden usar Ultralytics Platform para anotar datos visuales, entrenar modelos, desplegar componentes de percepción y supervisarlos como parte de una canalización de fusión más amplia.










