Prompt Enrichment
Aprende cómo el enriquecimiento de prompts automatiza la ampliación de entradas para mejorar la precisión de la IA. Descubre cómo usar esta técnica con Ultralytics YOLO26 para tareas de visión más inteligentes.
El enriquecimiento de prompts es el proceso automatizado de ampliar la entrada inicial de un usuario con contexto relevante, instrucciones específicas o datos complementarios antes de enviarla a un modelo de inteligencia artificial (AI). Esta técnica actúa como una capa de middleware inteligente que optimiza la interacción entre las personas y las máquinas, garantizando que los modelos de lenguaje de gran tamaño (LLMs) y los sistemas de visión artificial reciban consultas completas. Al inyectar detalles que un usuario podría omitir —como preferencias históricas, datos de ubicación o restricciones técnicas—, el enriquecimiento de prompts mejora significativamente la precisión y la personalización de la salida del modelo sin exigir que el usuario sea experto en redactar instrucciones detalladas.
El mecanismo del enriquecimiento#
La función principal del enriquecimiento de prompts es salvar la distancia entre una intención humana vaga y la entrada precisa y rica en datos que los modelos necesitan para ofrecer un rendimiento óptimo. Cuando se recibe una consulta, el sistema la analiza y recupera la información contextual necesaria de un grafo de conocimiento o de una base de datos estructurada. Estos datos recuperados se formatean mediante programación y se añaden al prompt original.
Por ejemplo, en los flujos de trabajo de procesamiento del lenguaje natural (NLP), una pregunta sencilla como «¿Cuál es el estado?» no proporciona suficiente contexto. Un sistema de enriquecimiento identifica la sesión activa, recupera el número de pedido más reciente de una base de datos transaccional y reescribe el prompt así: «El usuario pregunta por el pedido n.º 998, que está actualmente en tránsito. Proporciona una actualización del envío basándote en este estado». Este proceso suele utilizar bases de datos vectoriales para encontrar rápidamente contexto semánticamente relevante que inyectar.
Aplicaciones en el mundo real#
El enriquecimiento de prompts es esencial para implementar aplicaciones sólidas de IA generativa en diversos sectores, mejorando tanto los sistemas basados en texto como los basados en visión:
-
Asistencia al cliente contextual: En los servicios de asistencia automatizados, un chatbot utiliza el enriquecimiento para acceder al historial de compras y al entorno técnico de un cliente. En lugar de pedir al usuario la versión de su dispositivo, el sistema recupera este dato de los metadatos de la cuenta y lo inyecta en el prompt. Esto permite al agente de AI proporcionar de inmediato pasos de solución de problemas específicos para el dispositivo, mejorando significativamente la experiencia del cliente.
-
Configuración dinámica de la visión artificial: En las operaciones de seguridad, un usuario puede limitarse a activar el ajuste «Modo nocturno». Entre bastidores, el enriquecimiento de prompts traduce esta intención de alto nivel en clases de objetos específicas para un detector de vocabulario abierto como YOLO-World. El sistema enriquece el prompt para buscar específicamente «linterna», «movimiento sospechoso» o «persona no autorizada», lo que permite al modelo adaptar dinámicamente su enfoque de detección de objetos.
Ejemplo: enriquecimiento dinámico de clases#
El siguiente ejemplo de Python demuestra el concepto de enriquecimiento de prompts mediante el paquete ultralytics. En este caso, la intención de alto nivel de un usuario se enriquece mediante programación hasta convertirse en una lista de clases descriptivas específicas que el modelo analiza.
from ultralytics import YOLO
def run_enriched_inference(user_mode):
"""Enriches a simple user mode into specific detection prompts."""
# Load a YOLO-World model capable of open-vocabulary detection
model = YOLO("yolov8s-world.pt")
# Enrichment Logic: Map simple user intent to detailed class prompts
context_map = {
"site_safety": ["hard hat", "safety vest", "gloves"],
"traffic": ["car", "bus", "traffic light", "pedestrian"],
}
# Inject the enriched context into the model
enriched_classes = context_map.get(user_mode, ["object"])
model.set_classes(enriched_classes)
# The model now looks for the specific enriched terms
print(f"Mode: {user_mode} -> Enriched Prompt: {enriched_classes}")
run_enriched_inference("site_safety")Enriquecimiento de prompts frente a conceptos relacionados#
Para implementar unas operaciones de aprendizaje automático (MLOps) eficaces, conviene distinguir el enriquecimiento de prompts de términos similares:
- Generación aumentada mediante recuperación (RAG): RAG es un método específico de enriquecimiento. Se refiere estrictamente al mecanismo de recuperar documentos relevantes de un corpus externo para fundamentar la respuesta del modelo. El enriquecimiento es un concepto más amplio que incluye RAG, pero también abarca la inyección de datos de sesión estáticos, metadatos del usuario o la hora del sistema sin realizar necesariamente una búsqueda semántica compleja.
- Ingeniería de prompts: Es el trabajo manual de diseñar prompts eficaces. El enriquecimiento es un proceso automatizado que aplica dinámicamente principios de ingeniería de prompts durante la ejecución.
- Ajuste de prompts: Es una técnica de ajuste fino eficiente en cuanto a parámetros (PEFT) en la que los «prompts blandos» (tensores entrenables) se optimizan durante el entrenamiento. El enriquecimiento de prompts tiene lugar por completo durante la inferencia en tiempo real y no modifica los pesos del modelo.
- Aprendizaje con pocos ejemplos: Consiste en proporcionar ejemplos dentro del prompt para enseñar al modelo una tarea. Los sistemas de enriquecimiento suelen inyectar estos ejemplos dinámicamente en función del tipo de tarea, combinando eficazmente ambos conceptos.
Relevancia en los sistemas modernos de AI#
A medida que modelos como Ultralytics YOLO26 y GPT-4 adquieren más capacidades, el cuello de botella suele trasladarse a la calidad de la entrada. El enriquecimiento de prompts reduce las alucinaciones en los LLM al fundamentar el modelo en datos fácticos proporcionados. En la visión artificial (CV), permite crear sistemas flexibles de detección mediante aprendizaje sin ejemplos (zero-shot learning) que pueden adaptarse al instante a nuevos entornos sin volver a entrenarse, simplemente modificando los prompts de texto que se introducen en el sistema. Esta flexibilidad es crucial para crear soluciones escalables de AI multimodal capaces de razonar tanto sobre texto como sobre imágenes. Los usuarios que buscan gestionar los conjuntos de datos utilizados para fundamentar estos sistemas suelen recurrir a herramientas como Ultralytics Platform para organizar y anotar su información eficazmente.









