Cómo el computer vision guía a los AMR, AGV y carretillas elevadoras autónomas
Qué aporta el computer vision a la navegación de AMR, AGV y carretillas elevadoras autónomas, cómo se complementan la cámara, el lidar y la profundidad, y dónde se sitúa la seguridad.

La visión artificial ayuda a los robots móviles autónomos, vehículos de guiado automático y carretillas elevadoras autónomas a percibir personas, palés, estanterías, cargas, señales, áreas de suelo y otros vehículos. Ultralytics YOLO puede proporcionar observaciones de detección, segmentación, postura y seguimiento dentro de esa pila de percepción. No sustituye a la localización, la planificación de rutas, el control del vehículo ni a un sistema de seguridad validado.
La mejor arquitectura suele ser la fusión de sensores. Las cámaras aportan comprensión semántica y rica información de apariencia. El láser y los sensores de profundidad aportan geometría y alcance. Los codificadores y sensores inerciales aportan movimiento. El sistema de navegación combina estas entradas en función del vehículo, el entorno y la evaluación de riesgos.
Los requisitos de los AMR, AGV y carretillas elevadoras autónomas difieren#
Un AGV suele seguir rutas fijas o semifijas y depende de infraestructura como marcadores, reflectores o rutas mapeadas. Un AMR generalmente planifica rodeando obstáculos cambiantes en un entorno mapeado. Una carretilla elevadora autónoma añade manipulación de carga, geometría de mástil y horquillas, cargas elevadas e interacciones en torno a palés y estanterías.
No utilices las etiquetas como sustituto de los requisitos. Define:
- Zonas de operación y rutas permitidas.
- Velocidad del vehículo, comportamiento de frenado y rango de carga útil.
- Personas, vehículos y clases de objetos que se deben percibir.
- Iluminación interior y exterior, clima, polvo y condiciones del suelo.
- Comportamiento de localización y mapas requerido.
- Puntos ciegos creados por el vehículo y la carga.
- Disponibilidad de red y límites de computación a bordo.
- Requisitos aplicables de maquinaria, vehículos y seguridad en el lugar de trabajo.
Lo que aporta la visión artificial#
| Función de percepción | Posible tarea de visión | Uso en navegación | Limitación clave |
|---|---|---|---|
| Detección de personas y vehículos | Detección y seguimiento de objetos | Conciencia semántica y lógica de comportamiento | La detección no es una función de protección evaluada para la seguridad de manera predeterminada |
| Reconocimiento de palés y estanterías | Detección, segmentación o puntos clave | Contexto de acoplamiento, recogida y colocación | Las oclusiones y los palés dañados cambian la apariencia |
| Estimación de espacio libre | Segmentación semántica o profundidad | Entrada de transitabilidad | Los reflejos en el suelo y la geometría no vista pueden engañar a un sistema exclusivo de cámaras |
| Supervisión del estado de la carga | Detección o clasificación | Confirmar la presencia de carga y la alineación visible | El peso oculto y la estabilidad necesitan otros sensores |
| Reconocimiento de señales y marcadores | Detección más decodificación | Contexto de ruta o flujo de trabajo | La suciedad, el desgaste y el punto de vista afectan la legibilidad |
| Localización visual | Seguimiento de características o SLAM visual | Estimación de pose | Los pasillos repetitivos y las escenas cambiantes pueden reducir la fiabilidad |
| Movimiento de objetos | Seguimiento multiobjeto | Predecir trayectorias cercanas | El movimiento de la cámara y la oclusión requieren una fusión cuidadosa |
La aplicación de navegación debe consumir observaciones explícitas y con marca de tiempo. Necesita conocer el fotograma de la cámara, la versión del modelo, la confianza y la antigüedad de cada resultado para poder rechazar datos obsoletos o incoherentes.
La cámara, el láser y la profundidad son complementarios#
Las cámaras monoculares ofrecen color y textura con una complejidad de hardware relativamente baja, pero no miden directamente la profundidad métrica. Las cámaras estéreo y de profundidad activa estiman el alcance dentro de su margen de funcionamiento. El láser proporciona mediciones geométricas directas y puede seguir siendo útil donde la apariencia varía, aunque el material, el clima y la geometría siguen importando.
La selección de sensores debe seguir el análisis de fallos. Pregúntate qué peligros o características de navegación se pasarían por alto si un sensor se bloqueara, saturara, contaminara o no estuviera disponible. La redundancia solo ayuda cuando los modos de fallo son lo suficientemente independientes y la lógica de fusión gestiona el desacuerdo.
La colocación de la cámara debe tener en cuenta los giros, la marcha atrás, la posición de las horquillas y las cargas cambiantes. Valida el campo de visión con la carga máxima permitida y cada estado del mástil. Añade comprobaciones de limpieza, inspección y alineación a los procedimientos de mantenimiento.
Construye el conjunto de datos de percepción a partir de rutas, no de imágenes aisladas#
Recopila condiciones de ruta completas en todos los sitios, turnos, tipos de pasillos, intersecciones, áreas de muelles, tráfico de personas y vehículos, estados de carga y condiciones de mantenimiento. Incluye negativos difíciles como carteles, reflejos, maniquíes, materiales apilados y vistas parciales que se asemejen a las clases objetivo.
Divide los datos de evaluación por ruta, hora o sitio para evitar fotogramas de vídeo casi duplicados en el entrenamiento y las pruebas. Informa sobre el rendimiento por distancia, oclusión, iluminación, movimiento y tipo de objeto. Un único promedio puede ocultar los casos que más importan cerca de las intersecciones o áreas de acoplamiento.
Ultralytics Platform puede admitir la anotación, el entrenamiento y la gestión de versiones para modelos de percepción personalizados de Ultralytics YOLO. Los modelos exportados se pueden ejecutar en tiempos de ejecución de borde o de a bordo compatibles seleccionados para las restricciones de computación y latencia del vehículo.
Integra la percepción con ROS 2 u otra pila de robótica#
Una integración robótica normalmente publica detecciones o máscaras con marcas de tiempo e información del marco de coordenadas. Una capa de transformación relaciona las coordenadas de la cámara con el vehículo. La capa de navegación o comportamiento utiliza las observaciones junto con mapas, sensores de alcance, odometría y el estado de la tarea.
Diseña teniendo en cuenta:
- La sincronización temporal entre sensores.
- La latencia acotada y el rechazo de mensajes obsoletos.
- Los estados de salud de la cámara y del modelo.
- El comportamiento explícito cuando los sensores discrepan.
- Los datos registrados suficientes para reproducir un evento.
- Los esquemas de mensajes versionados y las salidas del modelo.
- La contención de recursos entre la percepción, la localización y la planificación.
Evita acoplar la navegación directamente a salidas de modelos no documentadas. Una interfaz estable permite que la percepción evolucione sin cambiar silenciosamente el comportamiento del vehículo.
Límite de seguridad#
La visión artificial de propósito general puede respaldar la conciencia y las decisiones operativas, pero no debe describirse como un dispositivo de protección certificado. La parada del vehículo, los campos de protección, las funciones de emergencia y la validación de seguridad pertenecen a la arquitectura de seguridad aplicable y al proceso de ingeniería competente.
Documenta qué sucede cuando el modelo, la cámara, la computación o la red fallan. Un estado seguro puede requerir velocidad reducida, parada controlada, restricción de ruta o transferencia a otro modo de operación, dependiendo del diseño del sistema. Valida estos comportamientos en el vehículo completo.
Plan de evaluación#
Prueba la percepción, la navegación y las operaciones por separado y en conjunto.
Pruebas de percepción#
- Detección y localización por distancia, dirección, iluminación y oclusión.
- Continuidad del seguimiento a través de cruces y obstrucciones temporales.
- Falsos positivos de objetos de fondo y reflejos.
- Rendimiento con cámaras sucias, desplazadas, borrosas o parcialmente bloqueadas.
- Latencia de extremo a extremo y uso de recursos en la computación de destino.
Pruebas de navegación#
- Intersecciones, pasillos estrechos, incorporaciones, adelantamientos, marcha atrás y acoplamiento.
- Obstáculos estáticos y en movimiento a velocidades representativas.
- Cambios en el mapa, barreras temporales y cierres de rutas.
- Desacuerdo entre sensores, retraso de mensajes y falta de entrada.
- Recuperación de la pérdida de localización o de un componente de percepción no disponible.
Pruebas operativas#
- Recogida, transporte y colocación de carga entre variantes de palés.
- Comportamiento con cargas elevadas o que bloquean la visión.
- Cambios de turno, carga, puesta en marcha, apagado y mantenimiento.
- Reconstrucción de incidentes y reversión de modelos.
Mide la finalización de misiones, intervenciones, retrasos de ruta, tiempo no disponible, errores de percepción y comportamiento de recuperación. No infieras la seguridad de la navegación únicamente a partir de la precisión del modelo.
Opciones de implementación#
La inferencia a bordo minimiza la dependencia de la conectividad de red y puede mantener datos de sensores de alta velocidad en el vehículo. Requiere actualizaciones de software controladas, supervisión de recursos, gestión de almacenamiento y soporte de hardware en toda la flota.
Los servicios centralizados pueden simplificar la gestión de modelos y agregar datos de revisión, pero el comportamiento del vehículo en tiempo real debe tener en cuenta la latencia y la pérdida de red. Un diseño híbrido puede ejecutar la percepción inmediata a bordo mientras gestiona centralmente artefactos de modelos aprobados, metadatos y ejemplos de revisión seleccionados.
Utiliza lanzamientos por fases. Comienza con reproducción grabada, luego un área de prueba, observaciones en la sombra, operaciones restringidas y un subconjunto de flota controlado antes de un despliegue amplio. Conserve un modelo y una configuración conocidos que funcionen bien para la reversión.
Preguntas frecuentes
La localización y el mapeo simultáneos visuales estiman el movimiento de la cámara mientras construyen o utilizan un mapa a partir de características visuales. Es un enfoque de localización y se puede combinar con mediciones inerciales, de ruedas, láser u otras.
La inferencia a bordo es adecuada cuando importan la baja latencia, la localidad de los datos o el funcionamiento durante una pérdida de red. Confirma que el dispositivo de destino pueda soportar la carga de trabajo completa y que las actualizaciones y la supervisión de la flota sean viables.
Detecta entradas ausentes, desactualizadas, borrosas, bloqueadas, desplazadas o inverosímiles y canaliza ese estado hacia un comportamiento definido del vehículo. La respuesta debe diseñarse y validarse como parte del sistema completo.






