ReAct Prompting
Descubre el prompting ReAct para crear agentes de IA autónomos. Aprende cómo el razonamiento y la acción se complementan con los LLM y herramientas de visión como Ultralytics YOLO26.
La generación de instrucciones ReAct (razonamiento y acción) es un paradigma avanzado de ingeniería de instrucciones que permite a los grandes modelos de lenguaje (LLM) intercalar dinámicamente secuencias de razonamiento paso a paso con acciones específicas para cada tarea. Esta técnica, presentada en el influyente artículo académico de 2022 «ReAct: sinergia entre razonamiento y acción en modelos de lenguaje», transforma un modelo de lenguaje estático en un agente de IA interactivo. Al generar explícitamente pensamientos sobre un problema y ejecutar acciones para obtener información externa, el marco ReAct mejora significativamente la precisión factual y la capacidad de tomar decisiones en flujos de trabajo complejos de inteligencia artificial.
Mecánica del razonamiento y la acción#
En las interacciones tradicionales, un modelo genera una respuesta basándose por completo en sus conocimientos internos, lo que suele provocar alucinaciones en los LLM. La arquitectura ReAct lo resuelve fundamentando la IA en entornos externos mediante un ciclo continuo de pensamientos, acciones y observaciones.
Ante una consulta, el modelo primero genera un «pensamiento» para definir su estrategia. Después activa una «acción», como consultar un motor de búsqueda, interactuar con una base de datos o llamar a una API de visión mediante un concepto conocido como llamada a funciones. El entorno devuelve una «observación» con datos objetivos. El modelo evalúa esta nueva información, actualiza su razonamiento y repite el ciclo hasta llegar a la respuesta final. Esta metodología, que se explica con más detalle en la guía de ingeniería de instrucciones sobre ReAct, refleja la resolución de problemas humana y permite crear comportamientos de agentes muy transparentes y controlables.
Aplicaciones en el mundo real#
La generación de instrucciones ReAct destaca en situaciones que requieren resolver problemas de forma iterativa y utilizar herramientas en varios pasos, por lo que es fundamental para los sistemas de IA agéntica modernos.
- Agentes automatizados de atención al cliente: En entornos empresariales, los agentes de asistencia informática utilizan ReAct para resolver problemas de los usuarios. Si un usuario informa de una interrupción de la red, el agente deduce que debe comprobar el estado del servidor. Para ello, llama a una API de diagnóstico y observa el resultado; después, escala el ticket o proporciona una guía para solucionar el problema basándose en los hechos obtenidos, lo que optimiza los flujos de trabajo tradicionales de generación aumentada por recuperación (RAG).
- Análisis visual dinámico: Los sistemas de visión artificial utilizan ReAct para responder preguntas visuales complejas. Un agente robótico encargado de gestionar el inventario puede observar una estantería, deducir que debe contar determinados artículos, invocar un modelo de detección de objetos y utilizar los datos de los cuadros delimitadores obtenidos para completar el recuento. Esta sinergia conecta el razonamiento basado en texto con la comprensión espacial.
Implementación de ReAct con visión artificial#
Para los desarrolladores que utilizan Python, los agentes ReAct suelen coordinar modelos de percepción para interactuar con el mundo físico. El siguiente ejemplo conceptual de código muestra cómo un ciclo de razonamiento ReAct puede desplegar sin complicaciones un modelo Ultralytics YOLO26 como herramienta externa para observar e informar sobre un entorno.
from ultralytics import YOLO
def vision_tool(image_path: str) -> str:
"""Action tool for a ReAct agent to detect objects in an image."""
model = YOLO("yolo26n.pt") # Load highly efficient YOLO26 nano model
results = model(image_path)
# Format the observation for the LLM's reasoning loop
detected_classes = [model.names[int(c)] for c in results[0].boxes.cls]
return f"Observation: Found {len(detected_classes)} objects: {', '.join(detected_classes)}"
# Simulated ReAct agent executing an action
agent_observation = vision_tool("https://ultralytics.com/images/bus.jpg")
print(agent_observation)La plataforma Ultralytics permite optimizar por completo la gestión de conjuntos de datos y el seguimiento de experimentos para estas herramientas de visión, y ofrece soluciones integrales para el despliegue de IA moderno. Quienes quieran crear estos agentes desde cero también pueden estudiar la lógica fundamental en el repositorio oficial de ReAct.
Diferenciación de conceptos relacionados#
Para diseñar arquitecturas multimodales robustas como las que se exploran en la investigación académica reciente sobre alineamiento, es fundamental distinguir ReAct de otros patrones de ingeniería relacionados:
- Frente a la generación de instrucciones de cadena de pensamiento: La cadena de pensamiento (CoT) anima al modelo a razonar paso a paso, pero se basa íntegramente en conocimientos internos y estáticos. ReAct amplía CoT añadiendo «acciones» dinámicas que recopilan observaciones externas recientes durante el proceso de razonamiento.
- Frente al encadenamiento de instrucciones: El encadenamiento de instrucciones consiste en codificar de forma fija una secuencia de llamadas independientes a LLM, donde la salida de un paso se pasa automáticamente al siguiente. ReAct es un paradigma más autónomo: un único agente decide dinámicamente qué herramientas o acciones secuenciales utilizar según las observaciones continuas, en lugar de seguir un guion encadenado rígido.
Al unificar la deducción lógica con la ejecución de herramientas externas especializadas, como los modelos multimodales, la generación de instrucciones ReAct permite desarrollar sistemas de IA generalizados y muy capaces.









