Chain-of-Thought Prompting
Explora o prompting de Chain-of-Thought (CoT) para melhorar o raciocínio de IA. Aprende como dividir tarefas em passos lógicos melhora a geração de código para o Ultralytics YOLO26.
O Chain-of-Thought (CoT) prompting é uma técnica avançada em prompt engineering que permite aos large language models (LLMs) resolver tarefas de raciocínio complexas, dividindo-as em passos lógicos intermediários. Em vez de pedir ao modelo para fornecer uma resposta final imediata, o CoT incentiva o sistema a gerar um "comboio de pensamento" que imita a resolução de problemas humana. Este raciocínio passo a passo melhora significativamente o desempenho em tarefas que envolvem aritmética, lógica simbólica e raciocínio de senso comum, transformando a forma como interagimos com os sistemas de Artificial Intelligence (AI).
O Mecanismo de Raciocínio#
Modelos de linguagem padrão muitas vezes têm dificuldade com problemas de várias etapas porque tentam mapear a entrada diretamente para a saída em uma única passagem. Essa abordagem de "caixa preta" pode levar a erros, particularmente quando o salto lógico é grande demais. O Chain-of-Thought prompting soluciona isso inserindo etapas de raciocínio entre a pergunta de entrada e a saída final.
Este processo geralmente funciona de duas maneiras:
- Zero-Shot CoT: Você adiciona uma frase de gatilho simples, como "Vamos pensar passo a passo", ao prompt. Isso ativa as capacidades latentes de raciocínio do modelo sem exigir exemplos específicos.
- Few-Shot CoT: O prompt inclui alguns exemplos (exemplars) de perguntas associadas às respetivas soluções passo a passo. Isto tira partido do few-shot learning para mostrar exatamente ao modelo como estruturar a sua lógica antes de tentar resolver um novo problema.
Ao gerar explicitamente um raciocínio intermediário, o modelo tem mais oportunidades de se corrigir e proporciona transparência sobre como chegou a uma conclusão. Isto é crucial para reduzir a hallucination in LLMs, em que os modelos poderiam, de outra forma, afirmar factos incorretos com confiança.
Aplicações no Mundo Real#
Embora desenvolvido inicialmente para lógica baseada em texto, o Chain-of-Thought prompting tem aplicações poderosas quando combinado com outros domínios de IA, como visão computacional e geração de código.
Melhorando a Geração de Código para Visão Computacional#
Os programadores utilizam o CoT para orientar os LLMs na escrita de scripts de software complexos para tarefas como object detection. Em vez de um pedido vago como "escreve código para encontrar carros", um prompt CoT pode estruturar o pedido: "Primeiro, importa as bibliotecas necessárias. Segundo, carrega o modelo pré-treinado. Terceiro, define a origem da imagem. Por fim, executa o ciclo de previsão." Esta abordagem estruturada garante que o código gerado para modelos como o YOLO26 está correto a nível sintático e é logicamente sólido.
Tomada de Decisão Autônoma#
No campo dos autonomous vehicles, os sistemas devem processar dados visuais e tomar decisões críticas para a segurança. Uma abordagem Chain-of-Thought permite que o sistema articule a sua lógica: "Deteto um pedestre perto da passadeira. O pedestre está virado para a estrada. O semáforo está verde para mim, mas o pedestre pode avançar. Portanto, vou abrandar e preparar-me para parar." Isto torna as decisões da IA interpretáveis e alinha-se com os princípios de explainable AI (XAI).
Chain-of-Thought em Ação#
Embora o CoT seja primariamente uma técnica de linguagem natural, pode ser implementado programaticamente para garantir interações consistentes com modelos de visão. O seguinte exemplo em Python demonstra como um programador pode estruturar um prompt para orientar um LLM (simulado aqui) na geração de código de inferência válido para a Ultralytics Platform.
# Example of structuring a Chain-of-Thought prompt for an LLM
# This prompt guides the model to write a valid YOLO26 inference script
cot_prompt = """
Task: Write a Python script to detect objects using YOLO26.
Chain of Thought:
1. Import the YOLO class from the 'ultralytics' library.
2. Load the 'yolo26n.pt' model weights (the latest nano model).
3. Load a sample image using a URL or local path.
4. Run the predict() function and save the results.
Based on these steps, generate the Python code below:
"""
# In a real application, you would send 'cot_prompt' to an LLM API
print(f"Structured Prompt for LLM:\n{cot_prompt}")Distinguindo Conceitos Relacionados#
É importante diferenciar o Chain-of-Thought prompting de termos semelhantes no ecossistema de Machine Learning (ML):
- Prompt Chaining: Isto envolve ligar várias chamadas de modelo separadas, em que a saída de um passo se torna a entrada do seguinte. O CoT ocorre dentro de um único prompt para suscitar raciocínio interno, enquanto o prompt chaining orquestra um fluxo de trabalho através de várias interações.
- Retrieval-Augmented Generation (RAG): O RAG foca-se na obtenção de dados externos (como documentos ou bases de dados) para fundamentar o conhecimento do modelo. O CoT foca-se no próprio processo de raciocínio. Frequentemente, estes elementos são combinados — utilizando o RAG para obter os factos e o CoT para raciocinar sobre eles.
- Prompt Tuning: Trata-se de um método de fine-tuning eficiente em termos de parâmetros que otimiza prompts suaves contínuos (vetores) durante o treino. O CoT é uma estratégia discreta de linguagem natural aplicada na real-time inference sem alterar os model weights.
Perspectiva Futura#
À medida que os foundation models continuam a evoluir, o Chain-of-Thought prompting está a tornar-se uma prática recomendada padrão para desbloquear todo o seu potencial. A investigação de grupos como o Google DeepMind sugere que, à medida que os modelos aumentam de tamanho, a sua capacidade de realizar raciocínio CoT melhora drasticamente. Esta evolução está a abrir caminho para agentes mais fiáveis e autónomos, capazes de lidar com fluxos de trabalho complexos em indústrias que vão desde os cuidados de saúde até ao smart manufacturing.






