Large Vision Models (LVM)
Descubre los modelos de visión a gran escala (LVM) y su impacto en la IA. Aprende cómo Ultralytics YOLO26 y Ultralytics Platform permiten realizar detección y análisis de objetos avanzados.
Los modelos de visión a gran escala (LVM) representan una importante evolución de la inteligencia artificial y se centran exclusivamente en comprender, generar y procesar datos visuales a gran escala. A diferencia de los sistemas tradicionales de visión artificial, entrenados con conjuntos de datos limitados para tareas específicas y predefinidas, los LVM actúan como modelos fundacionales generalistas, entrenados con enormes colecciones de imágenes y vídeos. Este preentrenamiento exhaustivo les permite desarrollar una comprensión profunda y completa de la geometría visual, las texturas y las relaciones espaciales complejas sin depender de etiquetas anotadas por personas.
Cómo funcionan los modelos de visión a gran escala#
Los modelos de visión a gran escala modernos suelen aprovechar Vision Transformers (ViT) o arquitecturas convolucionales de gran escala para procesar entradas visuales. Mediante técnicas de aprendizaje autosupervisado, como el modelado de imágenes enmascaradas, aprenden prediciendo las partes que faltan de una imagen o un fotograma. Organizaciones académicas como el Centro de Investigación sobre Modelos Fundacionales de Stanford han demostrado que aumentar rápidamente el número de parámetros de estos modelos da lugar a capacidades emergentes que funcionan directamente, sin configuración adicional. Esto les permite adaptarse a tareas posteriores, como la detección de objetos de alta velocidad y la segmentación detallada de imágenes, con un ajuste fino mínimo.
Aplicaciones en el mundo real#
Los LVM están transformando diversos sectores al abordar análisis visuales complejos que antes requerían algoritmos altamente especializados y entrenados a medida.
- Análisis automatizado de imágenes médicas: En entornos clínicos, las arquitecturas de visión a gran escala procesan radiografías, resonancias magnéticas y tomografías computarizadas de alta resolución para identificar anomalías sutiles, ayudar a los radiólogos a detectar enfermedades de forma temprana y reducir considerablemente los errores de diagnóstico.
- Detección de defectos en la fabricación: Las líneas de producción de las fábricas utilizan modelos de visión generalistas para inspeccionar productos en tiempo real, identificar fácilmente defectos complejos nunca vistos en las cadenas de montaje y mejorar el control de calidad sin necesitar miles de ejemplos de cada defecto específico.
Diferenciación de conceptos relacionados#
Para comprender plenamente el panorama de la IA, conviene distinguir los LVM de otros modelos fundacionales populares:
- LVM frente a modelo de visión y lenguaje (VLM): Mientras que un LVM procesa únicamente modalidades visuales (píxeles), un VLM integra tanto texto como imágenes, lo que permite a los usuarios hacer preguntas en lenguaje natural sobre una imagen o recibir descripciones textuales de un vídeo.
- LVM frente a modelo de lenguaje grande (LLM): Los LLM se entrenan exclusivamente con datos de texto para comprender y generar lenguaje humano. Un LVM aplica un escalado y una comprensión equivalentes, pero únicamente a datos visuales.
Trabajar con modelos de visión#
Aunque los LVM de gran tamaño suelen requerir clústeres de servidores que ejecuten PyTorch o TensorFlow, modelos fundacionales de visión altamente optimizados como Ultralytics YOLO26 llevan una inteligencia visual avanzada y de última generación directamente a los entornos locales de edge. El siguiente ejemplo muestra cómo realizar inferencias visuales fiables con un modelo preentrenado:
from ultralytics import YOLO
# Carga un modelo avanzado preentrenado de Ultralytics YOLO26
model = YOLO("yolo26x.pt")
# Realiza inferencias en una imagen para extraer características visuales y cuadros delimitadores
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Muestra las relaciones visuales predichas
results[0].show()El futuro de la inteligencia visual#
La transición de la investigación académica publicada en arXiv y la biblioteca digital IEEE Xplore a su aplicación práctica en empresas se está acelerando rápidamente. Las innovaciones de grupos de investigación como Google DeepMind están ampliando activamente los LVM al dominio temporal, lo que permite a los modelos comprender secuencias de vídeo complejas, de forma similar a las generaciones que se ven en Sora de OpenAI.
Para los desarrolladores y las organizaciones que buscan crear soluciones de IA visual personalizadas, la plataforma Ultralytics ofrece herramientas integradas para anotar conjuntos de datos en equipo, entrenar en la nube y simplificar la implementación de modelos, poniendo las capacidades avanzadas de visión al alcance de todos. Además, las herramientas de segmentación zero-shot como Segment Anything 2 (SAM 2) de Meta demuestran cómo los enfoques fundacionales de visión a gran escala —descritos a menudo en la Biblioteca Digital de ACM— están estandarizando la comprensión compleja a nivel de píxel en todo el sector de la IA.









