Chain-of-Thought Prompting
Explora el prompting de cadena de pensamiento (CoT) para mejorar el razonamiento de la IA. Descubre cómo dividir las tareas en pasos lógicos mejora la generación de código para Ultralytics YOLO26.
El prompting de cadena de pensamiento (CoT) es una técnica avanzada de ingeniería de prompts que permite a los modelos de lenguaje de gran tamaño (LLMs) resolver tareas de razonamiento complejas dividiéndolas en pasos lógicos intermedios. En lugar de pedir a un modelo que proporcione una respuesta final inmediata, CoT anima al sistema a generar una «cadena de pensamiento» que imita la resolución de problemas humana. Este razonamiento paso a paso mejora significativamente el rendimiento en tareas que implican aritmética, lógica simbólica y razonamiento de sentido común, transformando nuestra forma de interactuar con los sistemas de Inteligencia Artificial (AI).
El mecanismo del razonamiento#
Los modelos de lenguaje estándar suelen tener dificultades con los problemas de varios pasos porque intentan asignar directamente la entrada a la salida en una sola pasada. Este enfoque de «caja negra» puede provocar errores, especialmente cuando el salto lógico es demasiado grande. El prompting de cadena de pensamiento aborda este problema insertando pasos de razonamiento entre la pregunta de entrada y la salida final.
Este proceso generalmente funciona de dos maneras:
- CoT de cero ejemplos: El usuario añade al prompt una frase desencadenante sencilla, como «Let's think step by step». Esto activa las capacidades de razonamiento latentes del modelo sin requerir ejemplos específicos.
- CoT de pocos ejemplos: El prompt incluye algunos ejemplos (demostraciones) de preguntas emparejadas con sus soluciones paso a paso. Esto aprovecha el aprendizaje con pocos ejemplos para mostrar al modelo exactamente cómo estructurar su lógica antes de intentar resolver un problema nuevo.
Al generar explícitamente razonamientos intermedios, el modelo tiene más oportunidades de corregirse y ofrece transparencia sobre cómo ha llegado a una conclusión. Esto es crucial para reducir las alucinaciones en los LLMs, cuando de otro modo los modelos podrían afirmar hechos incorrectos con total confianza.
Aplicaciones en el mundo real#
Aunque se desarrolló inicialmente para la lógica basada en texto, el prompting de cadena de pensamiento tiene aplicaciones muy potentes cuando se combina con otros ámbitos de la IA, como la visión por computador y la generación de código.
1. Mejorar la generación de código para la visión por computador#
Los desarrolladores utilizan CoT para guiar a los LLMs en la escritura de scripts de software complejos para tareas como la detección de objetos. En lugar de una petición vaga como «escribe código para encontrar coches», un prompt CoT podría estructurar la solicitud así: «Primero, importa las bibliotecas necesarias. Segundo, carga el modelo preentrenado. Tercero, define la fuente de imágenes. Por último, ejecuta el bucle de predicción». Este enfoque estructurado garantiza que el código generado para modelos como YOLO26 sea sintácticamente correcto y lógicamente sólido.
2. Toma de decisiones autónoma#
En el ámbito de los vehículos autónomos, los sistemas deben procesar datos visuales y tomar decisiones críticas para la seguridad. Un enfoque de cadena de pensamiento permite al sistema expresar su lógica: «Detecto un peatón cerca del paso de peatones. El peatón está orientado hacia la calzada. El semáforo está en verde para mí, pero el peatón podría salir a la calzada. Por tanto, reduciré la velocidad y me prepararé para detenerme». Esto hace que las decisiones de la IA sean interpretables y se ajuste a los principios de la IA explicable (XAI).
La cadena de pensamiento en acción#
Aunque CoT es principalmente una técnica de lenguaje natural, puede implementarse mediante programación para garantizar interacciones coherentes con modelos de visión. El siguiente ejemplo de Python muestra cómo un desarrollador podría estructurar un prompt para guiar a un LLM (simulado aquí) en la generación de código de inferencia válido para la Ultralytics Platform.
# Example of structuring a Chain-of-Thought prompt for an LLM
# This prompt guides the model to write a valid YOLO26 inference script
cot_prompt = """
Task: Write a Python script to detect objects using YOLO26.
Chain of Thought:
1. Import the YOLO class from the 'ultralytics' library.
2. Load the 'yolo26n.pt' model weights (the latest nano model).
3. Load a sample image using a URL or local path.
4. Run the predict() function and save the results.
Based on these steps, generate the Python code below:
"""
# In a real application, you would send 'cot_prompt' to an LLM API
print(f"Structured Prompt for LLM:\n{cot_prompt}")Diferenciación de conceptos relacionados#
Es importante diferenciar el prompting de cadena de pensamiento de términos similares del ámbito del aprendizaje automático (ML):
- Encadenamiento de prompts: Consiste en conectar varias llamadas independientes al modelo, de modo que la salida de un paso se convierte en la entrada del siguiente. CoT tiene lugar dentro de un único prompt para provocar el razonamiento interno, mientras que el encadenamiento de prompts coordina un flujo de trabajo a través de varias interacciones.
- Generación aumentada mediante recuperación (RAG): RAG se centra en obtener datos externos (como documentos o bases de datos) para fundamentar el conocimiento del modelo. CoT se centra en el proceso de razonamiento en sí. A menudo se combinan: RAG se utiliza para obtener los hechos y CoT para razonar sobre ellos.
- Ajuste de prompts: Es un método de ajuste fino eficiente en cuanto a parámetros que optimiza prompts blandos continuos (vectores) durante el entrenamiento. CoT es una estrategia discreta de lenguaje natural que se aplica durante la inferencia en tiempo real sin modificar los pesos del modelo.
Perspectivas de futuro#
A medida que los modelos fundacionales siguen evolucionando, el prompting de cadena de pensamiento se está convirtiendo en una práctica recomendada estándar para liberar todo su potencial. Las investigaciones de grupos como Google DeepMind sugieren que, a medida que los modelos aumentan de tamaño, su capacidad para realizar razonamientos CoT mejora drásticamente. Esta evolución está allanando el camino hacia agentes más fiables y autónomos, capaces de gestionar flujos de trabajo complejos en sectores que van desde la sanidad hasta la fabricación inteligente.









