Chain-of-Thought Prompting
Изучи промпт-инжиниринг методом «цепочка рассуждений» (Chain-of-Thought, CoT) для улучшения логического вывода ИИ. Узнай, как разбиение задач на логические шаги помогает лучше генерировать код для Ultralytics YOLO26.
Chain-of-Thought (CoT) prompting — это передовой метод инженерии промптов, который позволяет большим языковым моделям (LLMs) решать сложные задачи на основе логических рассуждений, разбивая их на промежуточные логические шаги. Вместо того чтобы просить модель выдать немедленный окончательный ответ, CoT побуждает систему генерировать «ход мыслей», имитирующий решение проблем человеком. Такой пошаговый процесс рассуждений значительно улучшает производительность в задачах, связанных с арифметикой, символической логикой и здравым смыслом, преобразуя то, как мы взаимодействуем с системами Artificial Intelligence (AI).
Механизм рассуждения#
Стандартные языковые модели часто сталкиваются с трудностями при решении многошаговых задач, поскольку пытаются сопоставить входные данные с выходными за один проход. Этот подход «черного ящика» может приводить к ошибкам, особенно если логический разрыв слишком велик. Chain-of-Thought prompting решает эту проблему, вставляя этапы рассуждения между исходным вопросом и окончательным результатом.
Этот процесс обычно работает двумя способами:
- Zero-Shot CoT: Ты добавляешь к промпту простую триггерную фразу, например «Давай подумаем шаг за шагом». Это активирует скрытые способности модели к рассуждению без необходимости приводить конкретные примеры.
- Few-Shot CoT: Промпт включает в себя несколько примеров (экземпляров) вопросов вместе с их пошаговыми решениями. Это задействует few-shot learning, чтобы точно показать модели, как структурировать свою логику перед началом работы над новой задачей.
Явно генерируя промежуточные рассуждения, модель получает больше возможностей для самокоррекции и обеспечивает прозрачность того, как она пришла к выводу. Это крайне важно для снижения уровня hallucination in LLMs, при котором модели в противном случае могли бы с уверенностью заявлять неверные факты.
Реальные приложения#
Хотя изначально метод разрабатывался для текстовой логики, Chain-of-Thought prompting имеет мощные области применения в сочетании с другими доменами ИИ, такими как компьютерное зрение и генерация кода.
Улучшение генерации кода для компьютерного зрения#
Разработчики используют CoT, чтобы направлять LLMs при написании сложных программных скриптов для таких задач, как object detection. Вместо расплывчатого запроса вроде «напиши код для поиска машин», промпт CoT может структурировать запрос следующим образом: «Сначала импортируй необходимые библиотеки. Во-вторых, загрузи предобученную модель. В-третьих, определи источник изображения. Наконец, запусти цикл предсказаний». Такой структурированный подход гарантирует, что сгенерированный код для таких моделей, как YOLO26, синтаксически корректен и логически выверен.
Автономное принятие решений#
В сфере autonomous vehicles системы должны обрабатывать визуальные данные и принимать критически важные для безопасности решения. Подход Chain-of-Thought позволяет системе формулировать свою логику: «Я обнаруживаю пешехода возле пешеходного перехода. Пешеход повернут к дороге. Для меня горит зеленый свет, но пешеход может выйти на дорогу. Поэтому я сбавлю скорость и подготовлюсь к остановке». Это делает решения ИИ интерпретируемыми и соответствует принципам explainable AI (XAI).
Chain-of-Thought в действии#
Хотя CoT — это преимущественно метод естественного языка, его можно реализовать программным путем для обеспечения стабильного взаимодействия с моделями видеонаблюдения. Следующий пример на Python демонстрирует, как разработчик может структурировать промпт, чтобы направлять LLM (здесь смоделированную) в генерации валидного кода инференса для Ultralytics Platform.
# Example of structuring a Chain-of-Thought prompt for an LLM
# This prompt guides the model to write a valid YOLO26 inference script
cot_prompt = """
Task: Write a Python script to detect objects using YOLO26.
Chain of Thought:
1. Import the YOLO class from the 'ultralytics' library.
2. Load the 'yolo26n.pt' model weights (the latest nano model).
3. Load a sample image using a URL or local path.
4. Run the predict() function and save the results.
Based on these steps, generate the Python code below:
"""
# In a real application, you would send 'cot_prompt' to an LLM API
print(f"Structured Prompt for LLM:\n{cot_prompt}")Разграничение похожих концепций#
Важно отличать Chain-of-Thought prompting от похожих терминов в сфере Machine Learning (ML):
- Prompt Chaining: Это предполагает соединение нескольких отдельных вызовов моделей, где результат одного шага становится входом для следующего. CoT происходит в рамках одного промпта для вызова внутренних рассуждений, в то время как цепочка промптов организует рабочий процесс через множество взаимодействий.
- Retrieval-Augmented Generation (RAG): RAG фокусируется на получении внешних данных (таких как документы или базы данных) для обоснования знаний модели. CoT фокусируется на самом процессе рассуждений. Часто они комбинируются: RAG используется для получения фактов, а CoT — для рассуждений над ними.
- Prompt Tuning: Это метод эффективной настройки параметров, который оптимизирует непрерывные мягкие промпты (векторы) во время обучения. CoT — это дискретная стратегия на естественном языке, применяемая на этапе real-time inference без изменения model weights.
Взгляд в будущее#
По мере того как foundation models продолжают развиваться, Chain-of-Thought prompting становится стандартной лучшей практикой для раскрытия их полного потенциала. Исследования таких групп, как Google DeepMind, показывают, что по мере роста размеров моделей их способность выполнять рассуждения CoT значительно улучшается. Эта эволюция прокладывает путь к более надежным автономным агентам, способным справляться со сложными рабочими процессами в отраслях от здравоохранения до smart manufacturing.






