Visual Prompting
Explora el prompting visual para guiar modelos de IA con puntos y cajas. Aprende cómo Ultralytics YOLO y SAM permiten una segmentación precisa y una anotación de datos más rápida.
El prompting visual es una técnica emergente de la visión por ordenador en la que los usuarios proporcionan indicaciones espaciales o visuales, como puntos, cajas delimitadoras o trazos, para guiar la atención de un modelo de IA hacia objetos o regiones específicos dentro de una imagen. A diferencia de la tradicional ingeniería de prompts, que se basa principalmente en descripciones de texto, el prompting visual permite una interacción más precisa e intuitiva con sistemas de inteligencia artificial (AI). Este método aprovecha las capacidades de los modernos modelos fundacionales para realizar tareas como la segmentación y la detección sin necesidad de un reentrenamiento exhaustivo ni de grandes conjuntos de datos etiquetados. Al "señalar" eficazmente lo que importa, los usuarios pueden adaptar modelos de propósito general a tareas nuevas al instante, reduciendo la distancia entre la intención humana y la percepción de las máquinas.
Mecanismos del prompting visual#
En esencia, el prompting visual funciona inyectando información espacial directamente en la canalización de procesamiento del modelo. Cuando un usuario hace clic en un objeto o dibuja una caja, estas entradas se convierten en embeddings basados en coordenadas que la red neuronal integra con las características de la imagen. Este proceso es fundamental en arquitecturas interactivas como el Modelo Segment Anything (SAM), en el que el modelo predice máscaras basándose en indicaciones geométricas.
La flexibilidad del prompting visual permite varios tipos de interacción:
- Prompts de puntos: El usuario hace clic en un píxel concreto para indicar el objeto de interés. A continuación, el modelo amplía esta selección hasta abarcar los límites completos del objeto.
- Prompts de cajas: Dibujar una caja delimitadora proporciona una localización aproximada e indica al modelo que segmente o clasifique todo lo que se encuentre dentro de esa área.
- Prompts de trazos: Las líneas dibujadas a mano alzada sobre un objeto pueden ayudar a desambiguar escenas complejas en las que los objetos se solapan o tienen texturas similares.
Las investigaciones recientes presentadas en CVPR 2024 destacan cómo el prompting visual reduce significativamente el tiempo necesario para la anotación de datos, ya que los anotadores humanos pueden corregir las predicciones del modelo en tiempo real con simples clics, en lugar de trazar polígonos manualmente.
Prompting visual frente a prompting de texto#
Aunque ambas técnicas pretenden guiar el comportamiento del modelo, es importante distinguir el prompting visual de los métodos basados en texto. La generación de texto a imagen o la detección zero-shot se basa en el procesamiento del lenguaje natural (NLP) para interpretar descripciones semánticas, como «encuentra el coche rojo». Sin embargo, el lenguaje puede ser ambiguo o insuficiente para describir ubicaciones espaciales precisas o formas abstractas.
El prompting visual resuelve esta ambigüedad al anclar la instrucción en el propio espacio de píxeles. Por ejemplo, en el análisis de imágenes médicas, es mucho más preciso que un radiólogo haga clic en un nódulo sospechoso que intentar describir mediante texto sus coordenadas exactas y su forma irregular. A menudo, los flujos de trabajo más potentes combinan ambos enfoques: usan texto para el filtrado semántico y prompts visuales para la precisión espacial, un concepto conocido como aprendizaje multimodal.
Aplicaciones en el mundo real#
La adaptabilidad del prompting visual ha propiciado su rápida adopción en diversos sectores:
- Diagnóstico médico interactivo: Los médicos utilizan herramientas de prompting visual para aislar tumores u órganos en exploraciones de MRI. Con solo hacer clic en una región de interés, pueden generar al instante mediciones volumétricas en 3D, lo que facilita la detección de tumores y la planificación quirúrgica precisas.
- Edición fotográfica inteligente: En software para consumidores, como Adobe Photoshop o aplicaciones móviles, el prompting visual impulsa las herramientas de «selección mágica». Los usuarios pueden tocar una persona u objeto para eliminar el fondo o aplicar filtros específicos, utilizando tecnologías subyacentes de segmentación de instancias sin necesidad de saber crear máscaras manualmente.
- Manipulación robótica: En la IA en robótica, los robots pueden recibir instrucciones para recoger objetos concretos mediante una interfaz visual. El operador hace clic en un objeto de la señal de vídeo de la cámara del robot, proporcionando un prompt visual que el robot traduce en coordenadas de agarre y facilita la automatización con una persona en el circuito en almacenes.
Implementación con Ultralytics#
El ecosistema de Ultralytics admite flujos de trabajo de prompting visual, especialmente mediante modelos como FastSAM y SAM. Estos modelos permiten a los desarrolladores pasar coordenadas de puntos o cajas mediante programación para obtener máscaras de segmentación.
El siguiente ejemplo muestra cómo utilizar el paquete ultralytics para aplicar un prompt de punto a una imagen e indicar al modelo que segmente el objeto situado en unas coordenadas concretas.
from ultralytics import SAM
# Load the Segment Anything Model (SAM)
model = SAM("sam2.1_b.pt")
# Apply a visual point prompt to the image
# The 'points' argument accepts [x, y] coordinates
# labels: 1 indicates a foreground point (include), 0 indicates background
results = model("https://ultralytics.com/images/bus.jpg", points=[[300, 350]], labels=[1])
# Display the segmented result
results[0].show()Mejora de la agilidad de los modelos#
El prompting visual representa un cambio hacia la visión por ordenador «promptable», en la que los modelos ya no son «cajas negras» estáticas, sino herramientas interactivas. Esta capacidad es esencial para los ciclos de aprendizaje activo, en los que los modelos mejoran rápidamente al incorporar los comentarios de los usuarios.
Para los desarrolladores que quieran integrar estas capacidades en producción, la Ultralytics Platform ofrece herramientas para gestionar conjuntos de datos y desplegar modelos capaces de procesar entradas dinámicas. A medida que avance la investigación, esperamos una integración aún más estrecha entre los prompts visuales y los modelos de lenguaje grandes (LLMs), lo que permitirá crear sistemas capaces de razonar sobre entradas visuales con la misma fluidez con la que actualmente procesan texto.









