Prompt Chaining
Aprende cómo el encadenamiento de prompts divide las tareas complejas de IA en flujos de trabajo fiables. Explora cómo integrar Ultralytics YOLO26 con LLM para crear agentes de IA avanzados.
El encadenamiento de prompts es un patrón arquitectónico avanzado en el desarrollo de Inteligencia artificial (AI) en el que una tarea compleja se descompone en una secuencia de subtareas más pequeñas y manejables. En este flujo de trabajo, la salida de un paso —generada a menudo por un Modelo de lenguaje grande (LLM) o un sistema de visión artificial— sirve como entrada para el paso posterior. A diferencia de un único prompt monolítico que intenta resolver un problema multifacético de una sola vez, el encadenamiento permite a los desarrolladores crear aplicaciones más fiables, comprobables y capaces. Este enfoque modular es esencial para crear Agentes de AI sofisticados que puedan razonar, navegar por la web o interactuar con entornos físicos.
La mecánica del encadenamiento#
En esencia, el encadenamiento de prompts aborda las limitaciones de las ventanas de contexto y las capacidades de razonamiento de los Modelos fundacionales. Cuando se pide a un modelo que realice demasiadas operaciones distintas en una sola solicitud (por ejemplo, «Analiza esta imagen, extrae el texto, tradúcelo al español y dale formato de factura JSON»), aumenta la probabilidad de error. Al dividirlo en una canalización, los desarrolladores pueden verificar la precisión de cada etapa.
Las cadenas eficaces suelen utilizar «código de unión» escrito en Python o gestionado mediante bibliotecas de orquestación como LangChain para gestionar la transformación de datos entre pasos. Esto permite integrar tecnologías dispares, como combinar la capacidad visual de la Detección de objetos con la fluidez lingüística de los modelos generativos de texto.
Aplicaciones en el mundo real#
El encadenamiento de prompts es especialmente potente para conectar distintas modalidades de datos, lo que permite que los Modelos multimodales funcionen en entornos industriales y comerciales dinámicos.
-
Informes visuales automatizados: En la Fabricación inteligente, un sistema de control de calidad puede encadenar un modelo de visión con un LLM. Primero, un modelo de alta velocidad como Ultralytics YOLO26 escanea los componentes de una línea de montaje. La salida estructurada (por ejemplo, «Clase: Dented_Can, Confianza: 0.92») se convierte en una cadena de texto. A continuación, este texto se envía a un modelo de lenguaje con un prompt como «Redacta una solicitud de mantenimiento basándote en este defecto», que genera un correo electrónico legible para el responsable de planta.
-
Asistencia al cliente contextual: Los chatbots inteligentes suelen utilizar el encadenamiento para gestionar consultas complejas de los usuarios. El primer enlace de la cadena puede utilizar el Procesamiento del lenguaje natural (NLP) para clasificar la intención del usuario. Si la intención es técnica, el sistema activa un flujo de trabajo de Generación aumentada mediante recuperación (RAG): genera embeddings para la consulta, busca documentación en una base de datos vectorial y, finalmente, solicita a un LLM que sintetice los fragmentos recuperados en una respuesta útil.
Ejemplo de código de visión a lenguaje#
El siguiente ejemplo muestra el primer «enlace» de una cadena: utilizar la Visión artificial (CV) para generar datos estructurados que sirvan como contexto para un prompt posterior.
from ultralytics import YOLO
# Load the YOLO26 model (natively end-to-end and highly efficient)
model = YOLO("yolo26n.pt")
# Step 1: Run inference to 'see' the environment
results = model("https://ultralytics.com/images/bus.jpg")
# Step 2: Format visual detections into a natural language string
det_names = [model.names[int(c)] for c in results[0].boxes.cls]
prompt_context = f"The scene contains: {', '.join(det_names)}. Please describe the likely activity."
# The 'prompt_context' variable is now ready to be sent to an LLM API
print(prompt_context)Diferenciación de conceptos relacionados#
Para implementar arquitecturas eficaces de Aprendizaje automático (ML), es útil diferenciar el encadenamiento de prompts de términos similares del ámbito de la AI:
- Frente a Prompts de cadena de pensamiento: Chain-of-Thought (CoT) es una técnica que se utiliza dentro de un único prompt para animar a un modelo a «mostrar su razonamiento» (por ejemplo, «Piensa paso a paso»). El encadenamiento de prompts implica varias llamadas distintas a la API, donde la entrada del paso B depende de la salida del paso A.
- Frente a la Ingeniería de prompts: La ingeniería de prompts es la disciplina más amplia de optimizar las entradas de texto para obtener un mejor rendimiento del modelo. El encadenamiento es un patrón de ingeniería específico que se centra en el flujo secuencial de las operaciones y en el control de la lógica.
- Frente al Ajuste de prompts: El ajuste de prompts es un método de Optimización de modelos que actualiza parámetros aprendibles (prompts blandos) durante una fase de entrenamiento. El encadenamiento de prompts tiene lugar íntegramente durante la Inferencia en tiempo real y no modifica los Pesos del modelo.
Al aprovechar el encadenamiento de prompts, los equipos pueden crear aplicaciones robustas que integren lógica, recuperación de datos y Reconocimiento de acciones. Para gestionar los conjuntos de datos y entrenar los modelos de visión que impulsan estas cadenas, la Plataforma Ultralytics ofrece una solución centralizada para la anotación, el entrenamiento y el despliegue.









