YOLO Vision 2026:
Volver al glosario de Ultralytics

Computer Vision (CV)

Explora cómo la visión por ordenador permite a las máquinas interpretar imágenes y vídeo. Conoce las tareas principales, las aplicaciones en la industria y cómo empezar con Ultralytics YOLO.

La visión por ordenador (CV) es el campo de la inteligencia artificial (IA) que permite a los ordenadores y sistemas extraer información significativa a partir de imágenes digitales, vídeos y otras entradas visuales. Si la inteligencia artificial permite a las máquinas pensar, la visión por ordenador les permite ver, observar y comprender. A diferencia de las herramientas de procesamiento de imágenes basadas en reglas, los sistemas modernos aprenden directamente de los datos: nunca se les dice explícitamente cómo es un coche o un tumor, sino que identifican los patrones subyacentes en miles de ejemplos etiquetados y generalizan ese conocimiento a imágenes con las que nunca se han encontrado. Al aplicar aprendizaje automático (ML) y aprendizaje profundo (DL), la visión por ordenador convierte los datos visuales no estructurados en decisiones sobre las que el software puede actuar.

Cómo funciona la Visión artificial#

Un ordenador ve una imagen como una matriz de valores numéricos que representan píxeles. Convertir esa matriz en una acción sigue un flujo de trabajo de cinco etapas.

Las cinco etapas de un flujo de trabajo de visión por ordenador: adquisición de imágenes, preprocesamiento, extracción de características, inferencia del modelo y salida o acción

Adquisición de imágenes. El flujo de trabajo comienza con el hardware (sensores CMOS, cámaras infrarrojas o escáneres LiDAR) capturando luz y convirtiéndola en una cuadrícula de píxeles digitales. La calibración de la cámara compensa la geometría de la lente antes de que comience el análisis.

Preprocesamiento. Los datos capturados se normalizan para que el modelo reciba una entrada coherente: cambiar el tamaño, reducir el ruido y ajustar el contraste.

Extracción de características. El sistema identifica características de bajo nivel como bordes, gradientes y esquinas. A medida que los datos penetran más profundamente en la red, esas primitivas se combinan en características de alto nivel: texturas, patrones y geometrías complejas. Un sistema puede detectar líneas verticales, reconocerlas como postes de una valla y luego comprender la escena como un límite perimetral. Este proceso se conoce como extracción de características.

Inferencia del modelo. El motor de la visión por ordenador moderna es la red neuronal convolucional (CNN). A diferencia de una red neuronal estándar que trata una imagen como una lista plana de números, las CNN preservan la relación espacial entre los píxeles, utilizando filtros que se deslizan por la imagen para detectar patrones independientemente de dónde aparezcan en el fotograma. Más recientemente, los Vision Transformers (ViTs) han surgido como una potente alternativa, aplicando el mecanismo de atención del procesamiento del lenguaje natural a los datos de imagen.

Salida y acción. El modelo devuelve un resultado estructurado (una etiqueta, un conjunto de cuadros delimitadores o una máscara de píxeles) sobre el que actúa el sistema circundante: rechazar una pieza defectuosa, frenar un vehículo o emitir una alerta.

Cómo aprende un modelo#

Un modelo es tan bueno como los datos que consume. El aprendizaje supervisado requiere grandes volúmenes de datos de entrenamiento, y los benchmarks como ImageNet y COCO proporcionan millones de ejemplos anotados. Durante el entrenamiento, el modelo predice, compara su predicción con la etiqueta de verdad terreno y ajusta sus pesos internos para reducir el error. Una vez entrenado, ese mismo modelo realiza el paso de inferencia mencionado anteriormente.

El cambio de los sistemas basados en reglas al aprendizaje profundo#

Línea de tiempo de la visión por ordenador desde los sistemas basados en la década de 1960 hasta el aprendizaje automático y profundo, pasando por los transformers y los modelos de base

La visión por ordenador inicial dependía de la ingeniería manual de características: los ingenieros definían parámetros geométricos rígidos para ayudar a las máquinas a reconocer objetos. Esos sistemas eran frágiles y fallaban cada vez que cambiaba la iluminación o un objeto aparecía en un ángulo desconocido. La publicación en 2012 de AlexNet, entrenada con más de un millón de imágenes etiquetadas de ImageNet, marcó el punto de inflexión al demostrar que las redes convolucionales podían superar a los enfoques diseñados a mano a escala. El aprendizaje profundo sustituyó las reglas ajustadas a mano por arquitecturas que aprenden sus propias características, lo suficientemente flexibles como para resistir en condiciones del mundo real que nunca están perfectamente controladas.

Visión por ordenador frente a procesamiento de imágenes frente a visión artificial#

Es importante distinguir la visión por ordenador de los campos adyacentes con los que se confunde habitualmente.

  • Procesamiento de imágenes manipula una imagen para mejorarla o extraer señales: ajustar el brillo, el contraste o aplicar filtros. Su salida suele ser otra imagen. La visión por ordenador toma una imagen como entrada y emite una interpretación («hay tres personas en esta habitación»). La visión por ordenador utiliza habitualmente el procesamiento de imágenes como paso de preparación.
  • Visión artificial se refiere a los sistemas de inspección industrial que operan en entornos estrictamente controlados con iluminación fija y posiciones de piezas conocidas. La visión por ordenador es la disciplina más amplia, diseñada para manejar condiciones impredecibles y no controladas.
  • El procesamiento del lenguaje natural maneja texto y voz. La visión por ordenador se centra enteramente en los datos visuales, aunque los modelos de lenguaje visual están uniendo cada vez más ambos mundos.

Tareas principales de la visión por ordenador#

La visión por computador no es una única función, sino un conjunto de tareas distintas, cada una de las cuales resuelve un problema diferente. Para obtener una explicación más detallada de cada una, consulta la guía completa sobre tareas de visión por computador.

Elegir la tarea correcta#

Alinear la tarea técnica con el objetivo comercial desde el principio evita costosos trabajos repetidos.

Objetivo comercialTarea a utilizar
Clasificar productos en categoríasClasificación de imágenes
Contar elementos o localizar su posiciónDetección de objetos
Analizar la forma exacta o el límite de un objetoSegmentación de instancias
Seguir el movimiento a través de fotogramas de vídeoRastreo de objetos
Medir la posición corporal o los ángulos articularesEstimación de pose
Detectar objetos rotados en imágenes aéreasCuadros delimitadores orientados
Leer texto de documentos o etiquetasReconocimiento óptico de caracteres

Aplicaciones en el mundo real#

La visión por ordenador sustenta ahora sistemas de producción en la mayoría de las principales industrias.

Gráfico que compara la adopción de la visión por ordenador entre industrias, siendo la fabricación el mayor segmento por delante de la sanidad y el comercio minorista

  • Fabricación y control de calidad. Las líneas de producción modernas funcionan más rápido que la capacidad visual humana. Los sistemas de visión realizan una inspección de calidad instantánea, identificando grietas microscópicas o componentes desalineados a la velocidad de la línea sin nada de la fatiga que acumula un inspector humano. Supervisar los patrones de desgaste en la maquinaria también permite el mantenimiento predictivo, detectando firmas de fallos antes de que una avería provoque un tiempo inactivo no planificado. Consulta la visión por ordenador en la fabricación y la detección de defectos.
  • Sanidad y diagnóstico. Los algoritmos de análisis de imágenes médicas procesan radiografías, resonancias magnéticas y tomografías computarizadas para detectar tumores en fase inicial, microfracturas y anomalías retinianas que son fáciles de pasar por alto bajo la presión del tiempo. En el quirófano, los sistemas de visión proporcionan un mapeo espacial en tiempo real durante procedimientos mínimamente invasivos. Consulta la visión por ordenador en la sanidad.
  • Comercio minorista. Las tiendas sin cajas emplean fusión de sensores y algoritmos de visión para realizar un seguimiento de los artículos que abandonan los estantes y facturar a los clientes automáticamente. Los mismos sistemas supervisan los niveles de las estanterías en tiempo real para activar alertas de reabastecimiento, apoyando la gestión de inventario y la prevención de pérdidas en el comercio minorista. Consulta la visión por ordenador en el comercio minorista.
  • Transporte autónomo. La capa de percepción es el componente más crítico para la seguridad de un coche autónomo. Los sistemas de visión identifican marcas viales, señales de tráfico, peatones y otros vehículos en tiempo real, combinando la entrada de la cámara con radar y LiDAR para construir un modelo de 360 grados del entorno del vehículo mediante detección de objetos 3D. Consulta vehículos autónomos.
  • Seguridad y vigilancia. La infraestructura de seguridad ha pasado del registro pasivo a la intervención proactiva: detectar merodeo en zonas restringidas, señalar patrones de comportamiento inusuales a medida que ocurren y apoyar la gestión de colas en espacios públicos. La detección de anomalías es la capacidad subyacente.
  • Agricultura. Los drones y los tractores evalúan la salud de los cultivos a nivel de planta individual, analizando imágenes multiespectrales en busca de deshidratación, infestación de plagas o deficiencia de nutrientes. El agua, los pesticidas y los fertilizantes se aplican entonces solo donde se necesitan en lugar de en campos enteros. Consulta la visión por ordenador en la agricultura.

Visión por ordenador en el Edge#

El análisis visual en tiempo real se ejecuta cada vez más en el edge (directamente en la cámara o en una pasarela local) en lugar de enrutar el vídeo a un servidor en la nube centralizado. Esto importa por dos razones.

La latencia cae a casi cero, lo cual no es negociable para la robótica autónoma o la inspección de líneas industriales donde un retraso de milisegundos produce errores. Y dado que solo los metadatos cruzan la red en lugar de vídeo sin procesar, los requisitos de ancho de banda se reducen drásticamente al tiempo que mejora la privacidad, ya que las grabaciones sensibles nunca abandonan el dispositivo local. Edge AI y la inferencia en tiempo real son lo que hace esto práctico, y las opciones de despliegue de modelos como ONNX y TensorRT permiten que un único modelo entrenado se ejecute en un hardware variado.

Retos y limitaciones#

Calidad de los datos. Un modelo refleja la calidad de sus datos de entrenamiento. Los conjuntos de datos de baja resolución, mal etiquetados o no representativos producen modelos poco fiables, y construir un conjunto de datos anotado diverso suele requerir más mano de obra que diseñar el algoritmo. Consulta el etiquetado de datos.

Variables ambientales. La lluvia intensa, el destello de la lente, la oclusión parcial y la escala variable de los objetos degradan el rendimiento. Los sistemas robustos confían en la aumentación de datos durante el entrenamiento para simular estas condiciones y crear resistencia antes del despliegue, así como en una validación cuidadosa para evitar el sobreajuste.

Consideraciones éticas y sesgos. Un modelo entrenado con un conjunto de datos que carece de diversidad demográfica funcionará de manera desigual entre grupos de población. Las organizaciones que despliegan sistemas que analizan a personas (en imágenes médicas, seguridad laboral o espacios públicos) deben auditar sus conjuntos de datos en busca de equidad y cumplir con la normativa emergente que regula la toma de decisiones automatizada.

El futuro de la visión por ordenador#

Los Vision Transformers están remodelando lo que se puede lograr en tareas que requieren comprender las relaciones entre partes distantes de una imagen. Más allá de eso, el aprendizaje multimodal combina datos visuales con texto, audio y profundidad para construir sistemas con una comprensión contextual más rica; los modelos de lenguaje visual que responden a preguntas sobre imágenes son un claro ejemplo temprano.

La IA generativa está abordando la escasez de datos directamente. Los datos sintéticos hacen posible crear imágenes hiperrealistas de escenarios poco comunes (modos de fallo específicos, presentaciones de enfermedades poco frecuentes) que no se pueden recopilar en volumen suficiente en el mundo real. Mientras tanto, las cámaras con sensores de profundidad y LiDAR están empujando a los sistemas más allá del análisis de imágenes planas hacia la computación espacial, donde la información digital se superpone al mundo físico para aplicaciones como el mantenimiento guiado por AR y el mapeo estructural.

Implementación de la visión por ordenador con Ultralytics#

Para los equipos que realizan una prueba piloto de un proyecto de visión por ordenador, Ultralytics YOLO26 es un punto de partida práctico para la detección de objetos en tiempo real: de código abierto, ampliamente documentado y lo suficientemente rápido como para ejecutarse en el edge. Las cifras de precisión y latencia en diferentes hardwares se publican en la página de benchmarks, con comparaciones de modelos lado a lado en la documentación. El ecosistema más amplio incluye OpenCV para el procesamiento clásico de imágenes y PyTorch como el marco de entrenamiento principal.

from ultralytics import YOLO

# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")

# Run inference on a standard example image
# The model identifies objects and their locations
results = model("https://ultralytics.com/images/bus.jpg")

# Display the resulting image with bounding boxes
results[0].show()

Este script utiliza un modelo preentrenado para realizar inferencia en pocas líneas. Los equipos que pasan de una prueba piloto a la producción pueden utilizar Ultralytics Platform para anotar conjuntos de datos, entrenar modelos en la nube y gestionar el despliegue, o aplicar el aprendizaje por transferencia para adaptar un modelo preentrenado a un conjunto de datos personalizado con muchos menos datos etiquetados que si se entrenara desde cero.

Preguntas frecuentes#

¿Cuál es la diferencia entre la visión por ordenador y el aprendizaje automático? El aprendizaje automático es la disciplina más amplia que consiste en construir sistemas que aprenden a partir de datos. La visión por ordenador es la aplicación de esa disciplina (normalmente a través del aprendizaje profundo) a entradas visuales como imágenes y vídeo. Casi toda la visión por ordenador moderna se basa en el aprendizaje automático, pero el aprendizaje automático también abarca texto, audio y datos tabulares.

¿Es la visión por ordenador lo mismo que el reconocimiento de imágenes? No. El reconocimiento de imágenes es una tarea dentro de la visión por ordenador: identificar lo que aparece en una imagen. La visión por ordenador también abarca la detección de objetos, la segmentación, la estimación de poses, el seguimiento y la comprensión de escenas.

¿Cuántos datos se necesitan para entrenar un modelo de visión artificial? Depende de la complejidad de la tarea y de la variedad que el modelo deba manejar. El aprendizaje por transferencia a partir de un modelo preentrenado como Ultralytics YOLO26 reduce sustancialmente este requisito, y a menudo se entrenan detectores personalizados útiles con unos pocos cientos o miles de imágenes etiquetadas por clase en lugar de los millones utilizados para entrenar modelos fundamentales.

¿Puede funcionar la visión por ordenador sin conexión a Internet? Sí. Los modelos se pueden desplegar directamente en dispositivos edge y ejecutarse completamente sin conexión, lo cual es la práctica habitual cuando la latencia, el ancho de banda o la privacidad de los datos desaconsejan enviar vídeo a la nube.

¿Qué lenguaje de programación se utiliza para la visión por ordenador? Python domina, debido a la madurez de su ecosistema: el paquete ultralytics, PyTorch y OpenCV. C++ se utiliza cuando se requiere el máximo rendimiento de inferencia, normalmente en sistemas integrados y de automoción.

Explore solutions

Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu viaje con el futuro del aprendizaje automático