Computer Vision (CV)
Explora cómo la visión por ordenador permite a las máquinas interpretar imágenes y vídeos. Conoce las tareas principales, las aplicaciones industriales y cómo empezar con Ultralytics YOLO.
La visión por computador (CV) es el campo de la inteligencia artificial (AI) que permite a los ordenadores y sistemas obtener información significativa de imágenes digitales, vídeos y otras entradas visuales. Si la AI permite a las máquinas pensar, la visión por computador les permite ver, observar y comprender. A diferencia de las herramientas de procesamiento de imágenes basadas en reglas, los sistemas modernos aprenden directamente de los datos: nunca se les indica explícitamente qué aspecto tiene un coche o un tumor, sino que identifican los patrones subyacentes en miles de ejemplos etiquetados y generalizan ese conocimiento a imágenes que nunca han visto. Al aplicar aprendizaje automático (ML) y aprendizaje profundo (DL), la visión por computador convierte datos visuales no estructurados en decisiones sobre las que puede actuar el software.
Cómo funciona la visión por computador#
Un ordenador ve una imagen como una matriz de valores numéricos que representan píxeles. Convertir esa matriz en una acción sigue una canalización de cinco etapas.

Adquisición de imágenes. El flujo de trabajo comienza con hardware —sensores CMOS, cámaras infrarrojas o escáneres LiDAR— que captura la luz y la convierte en una cuadrícula digital de píxeles. La calibración de la cámara tiene en cuenta la geometría de la lente antes de comenzar el análisis.
Preprocesamiento. Los datos capturados se normalizan para que el modelo reciba una entrada coherente: se cambia su tamaño, se reduce el ruido y se ajusta el contraste.
Extracción de características. El sistema identifica características de bajo nivel, como bordes, gradientes y esquinas. A medida que los datos avanzan por la red, esos elementos básicos se combinan en características de alto nivel: texturas, patrones y geometrías complejas. Un sistema puede detectar líneas verticales, reconocerlas como postes de una valla y entender después la escena como el límite de un perímetro. Este proceso se conoce como extracción de características.
Inferencia del modelo. El motor de la visión por computador moderna es la red neuronal convolucional (CNN). A diferencia de una red neuronal estándar que trata una imagen como una lista plana de números, las CNN conservan la relación espacial entre los píxeles y utilizan filtros que se deslizan por la imagen para detectar patrones independientemente de dónde aparezcan en el encuadre. Más recientemente, los Transformers de visión (ViTs) han surgido como una alternativa potente, al aplicar el mecanismo de atención del procesamiento del lenguaje natural a los datos de imagen.
Salida y acción. El modelo devuelve un resultado estructurado —una etiqueta, un conjunto de cuadros delimitadores o una máscara de píxeles— sobre el que actúa el sistema circundante: rechazar una pieza defectuosa, frenar un vehículo o emitir una alerta.
Cómo aprende un modelo#
Un modelo solo puede ser tan bueno como los datos que consume. El aprendizaje supervisado requiere grandes volúmenes de datos de entrenamiento, y benchmarks como ImageNet y COCO proporcionan millones de ejemplos anotados. Durante el entrenamiento, el modelo hace una predicción, la compara con la etiqueta de referencia y ajusta sus pesos internos para reducir el error. Una vez entrenado, ese mismo modelo realiza la etapa de inferencia descrita anteriormente.
El cambio de los sistemas basados en reglas al aprendizaje profundo#

La visión por computador inicial dependía de la ingeniería manual de características: los ingenieros definían parámetros geométricos rígidos para ayudar a las máquinas a reconocer objetos. Esos sistemas eran frágiles y fallaban cuando cambiaba la iluminación o un objeto aparecía desde un ángulo desconocido. La publicación de AlexNet en 2012, entrenada con más de un millón de imágenes etiquetadas de ImageNet, marcó un punto de inflexión al demostrar que las redes convolucionales podían superar a los enfoques diseñados manualmente a gran escala. El aprendizaje profundo sustituyó las reglas ajustadas manualmente por arquitecturas que aprenden sus propias características, lo bastante flexibles como para funcionar en condiciones reales que nunca están perfectamente controladas.
Visión por computador frente a procesamiento de imágenes y visión artificial#
Es importante distinguir la visión por computador de los campos relacionados con los que se confunde habitualmente.
- El procesamiento de imágenes manipula una imagen para mejorarla o extraer información: ajusta el brillo y el contraste, o aplica filtros. Su salida suele ser otra imagen. La visión por computador recibe una imagen como entrada y devuelve una interpretación ("hay tres personas en esta habitación"). La visión por computador utiliza habitualmente el procesamiento de imágenes como etapa de preparación.
- La visión artificial hace referencia a sistemas de inspección industrial que funcionan en entornos estrictamente controlados, con iluminación fija y posiciones conocidas de las piezas. La visión por computador es la disciplina más amplia, diseñada para gestionar condiciones impredecibles y no controladas.
- El procesamiento del lenguaje natural gestiona texto y voz. La visión por computador se centra por completo en los datos visuales, aunque los modelos de lenguaje y visión conectan cada vez más ambos ámbitos.
Tareas principales de la visión por computador#
La visión por computador no es una única función, sino un conjunto de tareas diferenciadas, cada una de las cuales resuelve un problema distinto. Para consultar una explicación más detallada de cada una, visita la guía completa sobre tareas de visión por computador.
- Clasificación de imágenes: asigna una única etiqueta a toda una imagen y responde a la pregunta "¿qué aparece en esta imagen?", por ejemplo, clasificando productos como defectuosos o no defectuosos. Estrechamente relacionada está la identificación de imágenes, que identifica lo que aparece en ellas.
- Detección de objetos: identifica objetos diferenciados y dibuja un cuadro delimitador alrededor de cada uno, lo que permite a los sistemas contar y localizar varios objetos en un solo fotograma.
- Segmentación de instancias: genera una máscara a nivel de píxel para cada objeto detectado y separa las instancias individuales de una misma clase. La segmentación semántica, en cambio, asigna una clase a cada píxel sin distinguir entre instancias.
- Estimación de pose: detecta puntos clave de un objeto, como las articulaciones del cuerpo humano, para realizar un seguimiento del movimiento y la postura.
- Cuadros delimitadores orientados: ajusta cuadros rotados a objetos que no están alineados con los ejes, algo esencial en imágenes aéreas y de satélite.
- Seguimiento de objetos: sigue un objeto a lo largo de un flujo de vídeo y mantiene un ID coherente entre fotogramas. El flujo óptico amplía esta capacidad al analizar el movimiento aparente entre fotogramas consecutivos.
- Reconocimiento óptico de caracteres (OCR): convierte imágenes de texto impreso o manuscrito en datos legibles por máquina y automatiza el procesamiento de documentos a gran escala.
Elegir la tarea adecuada#
Alinear desde el principio la tarea técnica con el objetivo empresarial evita tener que rehacer el trabajo, con el coste que ello supone.
| Objetivo empresarial | Tarea que se debe utilizar |
|---|---|
| Clasificar productos por categorías | Clasificación de imágenes |
| Contar elementos o localizar su posición | Detección de objetos |
| Analizar la forma o el límite exactos de un objeto | Segmentación de instancias |
| Seguir el movimiento entre fotogramas de vídeo | Seguimiento de objetos |
| Medir la posición del cuerpo o los ángulos de las articulaciones | Estimación de pose |
| Detectar objetos rotados en imágenes aéreas | Cuadros delimitadores orientados |
| Leer texto de documentos o etiquetas | Reconocimiento óptico de caracteres |
Aplicaciones en el mundo real#
La visión por computador sustenta actualmente sistemas de producción en la mayoría de las grandes industrias.

- Fabricación y control de calidad. Las líneas de producción modernas funcionan más rápido que la capacidad visual humana. Los sistemas de visión realizan una inspección de calidad instantánea e identifican grietas microscópicas o componentes desalineados a la velocidad de la línea, sin acumular el cansancio que sufre un inspector humano. La supervisión de los patrones de desgaste de la maquinaria también permite realizar un mantenimiento predictivo: detecta indicios de fallo antes de que una avería provoque una interrupción imprevista. Consulta visión por computador en la fabricación y detección de defectos.
- Sanidad y diagnóstico. Los algoritmos de análisis de imágenes médicas procesan radiografías, resonancias magnéticas y tomografías computarizadas para detectar tumores en fases tempranas, microfracturas y anomalías retinianas que son fáciles de pasar por alto bajo presión de tiempo. En el quirófano, los sistemas de visión proporcionan mapas espaciales en tiempo real durante procedimientos mínimamente invasivos. Consulta visión por computador en sanidad.
- Comercio minorista. Las tiendas sin cajas utilizan la fusión de sensores y algoritmos de visión para realizar un seguimiento de los artículos que salen de las estanterías y cobrar automáticamente a los clientes. Estos mismos sistemas supervisan en tiempo real los niveles de existencias de las estanterías para activar alertas de reposición, lo que facilita la gestión del inventario y la prevención de pérdidas en el comercio minorista. Consulta visión por computador en el comercio minorista.
- Transporte autónomo. La capa de percepción es el componente más crítico para la seguridad de un coche autónomo. Los sistemas de visión identifican en tiempo real las marcas viales, las señales de tráfico, los peatones y otros vehículos, y combinan la información de las cámaras con el radar y LiDAR para crear, mediante la detección de objetos 3D, un modelo de 360 grados del entorno del vehículo. Consulta vehículos autónomos.
- Seguridad y monitorización. La infraestructura de seguridad ha pasado de la grabación pasiva a la intervención proactiva: detecta la presencia prolongada en zonas restringidas, señala patrones de comportamiento inusuales mientras se producen y facilita la gestión de colas en espacios públicos. La detección de anomalías es la capacidad subyacente.
- Agricultura. Los drones y tractores evalúan la salud de los cultivos a nivel de planta individual y analizan imágenes multiespectrales para detectar deshidratación, infestaciones de plagas o carencias de nutrientes. Después, el agua, los pesticidas y los fertilizantes se aplican solo donde se necesitan, en lugar de cubrir campos enteros. Consulta visión por computador en la agricultura.
La visión por computador en el edge#
El análisis visual en tiempo real se ejecuta cada vez más en el edge —directamente en la cámara o en una pasarela local— en lugar de enviar el vídeo a un servidor centralizado en la nube. Esto es importante por dos motivos.
La latencia se reduce prácticamente a cero, algo imprescindible en la robótica autónoma o en la inspección de líneas industriales, donde un retraso de milisegundos provoca errores. Además, como por la red solo circulan metadatos y no el vídeo sin procesar, los requisitos de ancho de banda disminuyen considerablemente y mejora la privacidad, ya que las grabaciones sensibles nunca salen del dispositivo local. La IA en el edge y la inferencia en tiempo real hacen esto posible, mientras que las opciones de despliegue de modelos, como ONNX y TensorRT, permiten ejecutar un único modelo entrenado en distintos tipos de hardware.
Retos y limitaciones#
Calidad de los datos. Un modelo refleja la calidad de sus datos de entrenamiento. Los conjuntos de datos de baja resolución, mal etiquetados o poco representativos producen modelos poco fiables, y crear un conjunto de datos anotado y diverso suele requerir más trabajo que diseñar el algoritmo. Consulta etiquetado de datos.
Variables ambientales. La lluvia intensa, los destellos de la lente, la oclusión parcial y la escala variable de los objetos reducen el rendimiento. Los sistemas robustos recurren al aumento de datos durante el entrenamiento para simular estas condiciones y desarrollar resiliencia antes del despliegue, así como a una validación cuidadosa para evitar el sobreajuste.
Consideraciones éticas y sesgo. Un modelo entrenado con un conjunto de datos que carece de diversidad demográfica tendrá un rendimiento desigual entre grupos de población. Las organizaciones que despliegan sistemas que analizan a personas —en imágenes médicas, seguridad laboral o espacios públicos— deben auditar la equidad de sus conjuntos de datos y cumplir la normativa emergente sobre toma de decisiones automatizada.
El futuro de la visión por computador#
Los Transformers de visión están redefiniendo lo que se puede lograr en tareas que requieren comprender las relaciones entre partes distantes de una imagen. Además, el aprendizaje multimodal combina datos visuales con texto, audio y profundidad para crear sistemas con una comprensión contextual más rica; los modelos de lenguaje y visión que responden a preguntas sobre imágenes son un ejemplo inicial.
La IA generativa aborda directamente la escasez de datos. Los datos sintéticos permiten crear imágenes hiperrealistas de escenarios poco frecuentes —modos de fallo concretos o manifestaciones atípicas de enfermedades— que no se pueden recopilar en cantidad suficiente en el mundo real. Mientras tanto, las cámaras con sensores de profundidad y LiDAR están llevando los sistemas más allá del análisis de imágenes planas hacia la computación espacial, donde la información digital se superpone al mundo físico para aplicaciones como el mantenimiento guiado mediante RA y el mapeo estructural.
Implementar visión por computador con Ultralytics#
Para los equipos que ponen a prueba un proyecto de visión por computador, Ultralytics YOLO26 es un punto de partida práctico para la detección de objetos en tiempo real: es de código abierto, cuenta con una documentación extensa y funciona con suficiente rapidez en el edge. Las cifras de precisión y latencia en distintos dispositivos se publican en la página de benchmarks, junto con comparaciones de modelos en paralelo en la documentación. El ecosistema más amplio incluye OpenCV para el procesamiento clásico de imágenes y PyTorch como framework principal de entrenamiento.
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Run inference on a standard example image
# The model identifies objects and their locations
results = model("https://ultralytics.com/images/bus.jpg")
# Display the resulting image with bounding boxes
results[0].show()Este script utiliza un modelo preentrenado para realizar inferencia en unas pocas líneas. Los equipos que pasan de una prueba piloto a producción pueden utilizar la plataforma de Ultralytics para anotar conjuntos de datos, entrenar modelos en la nube y gestionar el despliegue, o aplicar aprendizaje por transferencia para adaptar un modelo preentrenado a un conjunto de datos personalizado con muchos menos datos etiquetados que si se entrenara desde cero.
Preguntas frecuentes
El aprendizaje automático es la disciplina más amplia de creación de sistemas que aprenden de los datos. La visión por computador es la aplicación de esa disciplina —normalmente mediante aprendizaje profundo— a entradas visuales, como imágenes y vídeo. Casi toda la visión por computador moderna se basa en el aprendizaje automático, pero el aprendizaje automático también abarca texto, audio y datos tabulares.
No. La identificación de imágenes es una tarea de la visión por computador: identificar qué aparece en una imagen. La visión por computador también incluye la detección de objetos, la segmentación, la estimación de pose, el seguimiento y la comprensión de escenas.
Depende de la complejidad de la tarea y de la variación que el modelo deba gestionar. El aprendizaje por transferencia a partir de un modelo preentrenado, como Ultralytics YOLO26, reduce considerablemente el requisito, y a menudo se entrenan detectores personalizados útiles con entre unos cientos y unos pocos miles de imágenes etiquetadas por clase, en lugar de los millones utilizados para entrenar modelos fundacionales.
Sí. Los modelos pueden desplegarse directamente en dispositivos edge y ejecutarse completamente sin conexión, una práctica habitual cuando la latencia, el ancho de banda o las normas de privacidad de los datos impiden enviar el vídeo a la nube.
Python es el predominante gracias a la madurez de su ecosistema: el paquete
ultralytics, PyTorch y OpenCV. C++ se utiliza cuando se necesita el máximo rendimiento de inferencia, normalmente en sistemas integrados y de automoción.






