YOLO Vision 2026:
Volver al glosario de Ultralytics

Computer Vision (CV)

Explora cómo la visión por ordenador permite a las máquinas interpretar imágenes y vídeos. Conoce las tareas principales, las aplicaciones industriales y cómo empezar con Ultralytics YOLO.

La visión por computador (CV) es el campo de la inteligencia artificial (AI) que permite a los ordenadores y sistemas obtener información significativa de imágenes digitales, vídeos y otras entradas visuales. Si la AI permite a las máquinas pensar, la visión por computador les permite ver, observar y comprender. A diferencia de las herramientas de procesamiento de imágenes basadas en reglas, los sistemas modernos aprenden directamente de los datos: nunca se les indica explícitamente qué aspecto tiene un coche o un tumor, sino que identifican los patrones subyacentes en miles de ejemplos etiquetados y generalizan ese conocimiento a imágenes que nunca han visto. Al aplicar aprendizaje automático (ML) y aprendizaje profundo (DL), la visión por computador convierte datos visuales no estructurados en decisiones sobre las que puede actuar el software.

Cómo funciona la visión por computador#

Un ordenador ve una imagen como una matriz de valores numéricos que representan píxeles. Convertir esa matriz en una acción sigue una canalización de cinco etapas.

Las cinco etapas de una canalización de visión por computador: adquisición de imágenes, preprocesamiento, extracción de características, inferencia del modelo y salida o acción

Adquisición de imágenes. El flujo de trabajo comienza con hardware —sensores CMOS, cámaras infrarrojas o escáneres LiDAR— que captura la luz y la convierte en una cuadrícula digital de píxeles. La calibración de la cámara tiene en cuenta la geometría de la lente antes de comenzar el análisis.

Preprocesamiento. Los datos capturados se normalizan para que el modelo reciba una entrada coherente: se cambia su tamaño, se reduce el ruido y se ajusta el contraste.

Extracción de características. El sistema identifica características de bajo nivel, como bordes, gradientes y esquinas. A medida que los datos avanzan por la red, esos elementos básicos se combinan en características de alto nivel: texturas, patrones y geometrías complejas. Un sistema puede detectar líneas verticales, reconocerlas como postes de una valla y entender después la escena como el límite de un perímetro. Este proceso se conoce como extracción de características.

Inferencia del modelo. El motor de la visión por computador moderna es la red neuronal convolucional (CNN). A diferencia de una red neuronal estándar que trata una imagen como una lista plana de números, las CNN conservan la relación espacial entre los píxeles y utilizan filtros que se deslizan por la imagen para detectar patrones independientemente de dónde aparezcan en el encuadre. Más recientemente, los Transformers de visión (ViTs) han surgido como una alternativa potente, al aplicar el mecanismo de atención del procesamiento del lenguaje natural a los datos de imagen.

Salida y acción. El modelo devuelve un resultado estructurado —una etiqueta, un conjunto de cuadros delimitadores o una máscara de píxeles— sobre el que actúa el sistema circundante: rechazar una pieza defectuosa, frenar un vehículo o emitir una alerta.

Cómo aprende un modelo#

Un modelo solo puede ser tan bueno como los datos que consume. El aprendizaje supervisado requiere grandes volúmenes de datos de entrenamiento, y benchmarks como ImageNet y COCO proporcionan millones de ejemplos anotados. Durante el entrenamiento, el modelo hace una predicción, la compara con la etiqueta de referencia y ajusta sus pesos internos para reducir el error. Una vez entrenado, ese mismo modelo realiza la etapa de inferencia descrita anteriormente.

El cambio de los sistemas basados en reglas al aprendizaje profundo#

Cronología de la visión por computador, desde los sistemas basados en reglas de la década de 1960 hasta el aprendizaje automático y el aprendizaje profundo, pasando por los Transformers y los modelos fundacionales

La visión por computador inicial dependía de la ingeniería manual de características: los ingenieros definían parámetros geométricos rígidos para ayudar a las máquinas a reconocer objetos. Esos sistemas eran frágiles y fallaban cuando cambiaba la iluminación o un objeto aparecía desde un ángulo desconocido. La publicación de AlexNet en 2012, entrenada con más de un millón de imágenes etiquetadas de ImageNet, marcó un punto de inflexión al demostrar que las redes convolucionales podían superar a los enfoques diseñados manualmente a gran escala. El aprendizaje profundo sustituyó las reglas ajustadas manualmente por arquitecturas que aprenden sus propias características, lo bastante flexibles como para funcionar en condiciones reales que nunca están perfectamente controladas.

Visión por computador frente a procesamiento de imágenes y visión artificial#

Es importante distinguir la visión por computador de los campos relacionados con los que se confunde habitualmente.

  • El procesamiento de imágenes manipula una imagen para mejorarla o extraer información: ajusta el brillo y el contraste, o aplica filtros. Su salida suele ser otra imagen. La visión por computador recibe una imagen como entrada y devuelve una interpretación ("hay tres personas en esta habitación"). La visión por computador utiliza habitualmente el procesamiento de imágenes como etapa de preparación.
  • La visión artificial hace referencia a sistemas de inspección industrial que funcionan en entornos estrictamente controlados, con iluminación fija y posiciones conocidas de las piezas. La visión por computador es la disciplina más amplia, diseñada para gestionar condiciones impredecibles y no controladas.
  • El procesamiento del lenguaje natural gestiona texto y voz. La visión por computador se centra por completo en los datos visuales, aunque los modelos de lenguaje y visión conectan cada vez más ambos ámbitos.

Tareas principales de la visión por computador#

La visión por computador no es una única función, sino un conjunto de tareas diferenciadas, cada una de las cuales resuelve un problema distinto. Para consultar una explicación más detallada de cada una, visita la guía completa sobre tareas de visión por computador.

Elegir la tarea adecuada#

Alinear desde el principio la tarea técnica con el objetivo empresarial evita tener que rehacer el trabajo, con el coste que ello supone.

Objetivo empresarialTarea que se debe utilizar
Clasificar productos por categoríasClasificación de imágenes
Contar elementos o localizar su posiciónDetección de objetos
Analizar la forma o el límite exactos de un objetoSegmentación de instancias
Seguir el movimiento entre fotogramas de vídeoSeguimiento de objetos
Medir la posición del cuerpo o los ángulos de las articulacionesEstimación de pose
Detectar objetos rotados en imágenes aéreasCuadros delimitadores orientados
Leer texto de documentos o etiquetasReconocimiento óptico de caracteres

Aplicaciones en el mundo real#

La visión por computador sustenta actualmente sistemas de producción en la mayoría de las grandes industrias.

Gráfico que compara la adopción de la visión por computador en distintos sectores, con la fabricación como el segmento más grande, por delante de la sanidad y el comercio minorista

  • Fabricación y control de calidad. Las líneas de producción modernas funcionan más rápido que la capacidad visual humana. Los sistemas de visión realizan una inspección de calidad instantánea e identifican grietas microscópicas o componentes desalineados a la velocidad de la línea, sin acumular el cansancio que sufre un inspector humano. La supervisión de los patrones de desgaste de la maquinaria también permite realizar un mantenimiento predictivo: detecta indicios de fallo antes de que una avería provoque una interrupción imprevista. Consulta visión por computador en la fabricación y detección de defectos.
  • Sanidad y diagnóstico. Los algoritmos de análisis de imágenes médicas procesan radiografías, resonancias magnéticas y tomografías computarizadas para detectar tumores en fases tempranas, microfracturas y anomalías retinianas que son fáciles de pasar por alto bajo presión de tiempo. En el quirófano, los sistemas de visión proporcionan mapas espaciales en tiempo real durante procedimientos mínimamente invasivos. Consulta visión por computador en sanidad.
  • Comercio minorista. Las tiendas sin cajas utilizan la fusión de sensores y algoritmos de visión para realizar un seguimiento de los artículos que salen de las estanterías y cobrar automáticamente a los clientes. Estos mismos sistemas supervisan en tiempo real los niveles de existencias de las estanterías para activar alertas de reposición, lo que facilita la gestión del inventario y la prevención de pérdidas en el comercio minorista. Consulta visión por computador en el comercio minorista.
  • Transporte autónomo. La capa de percepción es el componente más crítico para la seguridad de un coche autónomo. Los sistemas de visión identifican en tiempo real las marcas viales, las señales de tráfico, los peatones y otros vehículos, y combinan la información de las cámaras con el radar y LiDAR para crear, mediante la detección de objetos 3D, un modelo de 360 grados del entorno del vehículo. Consulta vehículos autónomos.
  • Seguridad y monitorización. La infraestructura de seguridad ha pasado de la grabación pasiva a la intervención proactiva: detecta la presencia prolongada en zonas restringidas, señala patrones de comportamiento inusuales mientras se producen y facilita la gestión de colas en espacios públicos. La detección de anomalías es la capacidad subyacente.
  • Agricultura. Los drones y tractores evalúan la salud de los cultivos a nivel de planta individual y analizan imágenes multiespectrales para detectar deshidratación, infestaciones de plagas o carencias de nutrientes. Después, el agua, los pesticidas y los fertilizantes se aplican solo donde se necesitan, en lugar de cubrir campos enteros. Consulta visión por computador en la agricultura.

La visión por computador en el edge#

El análisis visual en tiempo real se ejecuta cada vez más en el edge —directamente en la cámara o en una pasarela local— en lugar de enviar el vídeo a un servidor centralizado en la nube. Esto es importante por dos motivos.

La latencia se reduce prácticamente a cero, algo imprescindible en la robótica autónoma o en la inspección de líneas industriales, donde un retraso de milisegundos provoca errores. Además, como por la red solo circulan metadatos y no el vídeo sin procesar, los requisitos de ancho de banda disminuyen considerablemente y mejora la privacidad, ya que las grabaciones sensibles nunca salen del dispositivo local. La IA en el edge y la inferencia en tiempo real hacen esto posible, mientras que las opciones de despliegue de modelos, como ONNX y TensorRT, permiten ejecutar un único modelo entrenado en distintos tipos de hardware.

Retos y limitaciones#

Calidad de los datos. Un modelo refleja la calidad de sus datos de entrenamiento. Los conjuntos de datos de baja resolución, mal etiquetados o poco representativos producen modelos poco fiables, y crear un conjunto de datos anotado y diverso suele requerir más trabajo que diseñar el algoritmo. Consulta etiquetado de datos.

Variables ambientales. La lluvia intensa, los destellos de la lente, la oclusión parcial y la escala variable de los objetos reducen el rendimiento. Los sistemas robustos recurren al aumento de datos durante el entrenamiento para simular estas condiciones y desarrollar resiliencia antes del despliegue, así como a una validación cuidadosa para evitar el sobreajuste.

Consideraciones éticas y sesgo. Un modelo entrenado con un conjunto de datos que carece de diversidad demográfica tendrá un rendimiento desigual entre grupos de población. Las organizaciones que despliegan sistemas que analizan a personas —en imágenes médicas, seguridad laboral o espacios públicos— deben auditar la equidad de sus conjuntos de datos y cumplir la normativa emergente sobre toma de decisiones automatizada.

El futuro de la visión por computador#

Los Transformers de visión están redefiniendo lo que se puede lograr en tareas que requieren comprender las relaciones entre partes distantes de una imagen. Además, el aprendizaje multimodal combina datos visuales con texto, audio y profundidad para crear sistemas con una comprensión contextual más rica; los modelos de lenguaje y visión que responden a preguntas sobre imágenes son un ejemplo inicial.

La IA generativa aborda directamente la escasez de datos. Los datos sintéticos permiten crear imágenes hiperrealistas de escenarios poco frecuentes —modos de fallo concretos o manifestaciones atípicas de enfermedades— que no se pueden recopilar en cantidad suficiente en el mundo real. Mientras tanto, las cámaras con sensores de profundidad y LiDAR están llevando los sistemas más allá del análisis de imágenes planas hacia la computación espacial, donde la información digital se superpone al mundo físico para aplicaciones como el mantenimiento guiado mediante RA y el mapeo estructural.

Implementar visión por computador con Ultralytics#

Para los equipos que ponen a prueba un proyecto de visión por computador, Ultralytics YOLO26 es un punto de partida práctico para la detección de objetos en tiempo real: es de código abierto, cuenta con una documentación extensa y funciona con suficiente rapidez en el edge. Las cifras de precisión y latencia en distintos dispositivos se publican en la página de benchmarks, junto con comparaciones de modelos en paralelo en la documentación. El ecosistema más amplio incluye OpenCV para el procesamiento clásico de imágenes y PyTorch como framework principal de entrenamiento.

from ultralytics import YOLO

# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")

# Run inference on a standard example image
# The model identifies objects and their locations
results = model("https://ultralytics.com/images/bus.jpg")

# Display the resulting image with bounding boxes
results[0].show()

Este script utiliza un modelo preentrenado para realizar inferencia en unas pocas líneas. Los equipos que pasan de una prueba piloto a producción pueden utilizar la plataforma de Ultralytics para anotar conjuntos de datos, entrenar modelos en la nube y gestionar el despliegue, o aplicar aprendizaje por transferencia para adaptar un modelo preentrenado a un conjunto de datos personalizado con muchos menos datos etiquetados que si se entrenara desde cero.

Preguntas frecuentes

  • El aprendizaje automático es la disciplina más amplia de creación de sistemas que aprenden de los datos. La visión por computador es la aplicación de esa disciplina —normalmente mediante aprendizaje profundo— a entradas visuales, como imágenes y vídeo. Casi toda la visión por computador moderna se basa en el aprendizaje automático, pero el aprendizaje automático también abarca texto, audio y datos tabulares.

  • No. La identificación de imágenes es una tarea de la visión por computador: identificar qué aparece en una imagen. La visión por computador también incluye la detección de objetos, la segmentación, la estimación de pose, el seguimiento y la comprensión de escenas.

  • Depende de la complejidad de la tarea y de la variación que el modelo deba gestionar. El aprendizaje por transferencia a partir de un modelo preentrenado, como Ultralytics YOLO26, reduce considerablemente el requisito, y a menudo se entrenan detectores personalizados útiles con entre unos cientos y unos pocos miles de imágenes etiquetadas por clase, en lugar de los millones utilizados para entrenar modelos fundacionales.

  • Sí. Los modelos pueden desplegarse directamente en dispositivos edge y ejecutarse completamente sin conexión, una práctica habitual cuando la latencia, el ancho de banda o las normas de privacidad de los datos impiden enviar el vídeo a la nube.

  • Python es el predominante gracias a la madurez de su ecosistema: el paquete ultralytics, PyTorch y OpenCV. C++ se utiliza cuando se necesita el máximo rendimiento de inferencia, normalmente en sistemas integrados y de automoción.

Explore solutions

Real-time AI that works with your team

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Real-time AI that works with your team

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Real-time AI that works with your team

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Real-time AI that works with your operation

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Real-time AI that works with your team

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Real-time AI that works with your team

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Real-time AI that works with your team

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Real-time AI that works with your operation

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Real-time AI that works with your team

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Real-time AI that works with your team

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Real-time AI that works with your team

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Real-time AI that works with your operation

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu recorrido hacia el futuro del aprendizaje automático