Prompt Engineering
Domina a engenharia de prompts para IA e visão computacional. Aprende a otimizar entradas para LLMs e modelos multimodais, como o Ultralytics YOLO26, para obter resultados superiores.
A engenharia de prompts é o processo estratégico de conceber, aperfeiçoar e otimizar texto de entrada para orientar modelos de Inteligência Artificial (AI) a produzir resultados precisos, relevantes e de alta qualidade. Inicialmente ganhando destaque com o surgimento dos Grandes Modelos de Linguagem (LLMs), como o GPT-4, esta disciplina evoluiu para uma competência essencial na interação com sistemas de IA generativa em várias modalidades, incluindo texto, imagem e vídeo. Em vez de alterar os pesos do modelo subjacentes por meio de um novo treino, a engenharia de prompts aproveita o conhecimento existente do modelo, formulando a tarefa de uma forma que o sistema consiga compreender melhor e colmatando a diferença entre a intenção humana e a execução pela máquina.
Mecânica da Criação de Prompts Eficazes#
No seu cerne, a engenharia de prompts depende da compreensão de como os modelos fundacionais processam o contexto e as instruções. Um prompt bem construído reduz a ambiguidade ao fornecer restrições explícitas, formatos de saída pretendidos, como JSON ou Markdown, e informações de contexto relevantes. Profissionais avançados utilizam técnicas como aprendizagem few-shot, na qual o utilizador fornece alguns exemplos de pares de entrada e saída dentro do prompt para demonstrar o padrão pretendido.
Outra estratégia poderosa é o prompting chain-of-thought, que incentiva o modelo a decompor tarefas complexas de raciocínio em etapas intermédias. Isto melhora significativamente o desempenho em consultas que exigem muito raciocínio lógico. Além disso, otimizar a utilização da janela de contexto—o limite da quantidade de texto que um modelo consegue processar de uma só vez—é crucial para manter a coerência em interações longas. Recursos externos, como o guia da OpenAI sobre conceção de prompts, realçam a importância do aperfeiçoamento iterativo para lidar eficazmente com casos extremos.
Relevância na Visão Computacional#
Embora seja frequentemente associada ao texto, a engenharia de prompts é cada vez mais importante na Visão Computacional (CV). Os modelos multimodais modernos e os detetores de vocabulário aberto, como o YOLO-World, permitem aos utilizadores definir alvos de deteção usando processamento de linguagem natural (NLP), em vez de IDs numéricos de classe predefinidos.
Neste contexto, o "prompt" é uma descrição textual do objeto, por exemplo, "pessoa com um capacete vermelho". Esta capacidade, conhecida como aprendizagem zero-shot, permite aos sistemas detetar objetos para os quais não foram explicitamente treinados, aproveitando as associações aprendidas entre características visuais e embeddings semânticos. Em ambientes de produção de alta velocidade, onde as classes são fixas, os programadores podem eventualmente passar de modelos orientados por prompts para modelos eficientes e treinados novamente, como o YOLO26, mas a engenharia de prompts continua a ser essencial para a prototipagem rápida e a flexibilidade.
Aplicações no mundo real#
A engenharia de prompts gera valor em diversos setores ao permitir uma automação flexível e inteligente:
- Análise Visual Dinâmica: Na IA no Retalho, os responsáveis pelas lojas utilizam modelos de visão baseados em prompts para procurar artigos específicos sem intervenção técnica. É possível pedir a um sistema que acompanhe "prateleiras vazias" num dia e "produtos fora do lugar" no dia seguinte. Esta flexibilidade permite às empresas adaptar imediatamente os seus sistemas de deteção de objetos às tendências sazonais.
- Criação Automatizada de Conteúdo: As equipas de marketing dependem de prompts detalhados para orientar geradores de texto para imagem, como o Stable Diffusion ou o Midjourney. Ao conceber prompts que especificam a iluminação, o estilo artístico e a composição, os designers conseguem gerar rapidamente recursos visuais.
- Pesquisa Inteligente de Conhecimento: No apoio ao cliente, os engenheiros concebem "prompts de sistema" que instruem chatbots a responder a consultas utilizando apenas dados empresariais verificados. Este é um componente essencial da Geração Aumentada por Recuperação (RAG), garantindo que a IA mantém uma personalidade útil e evita alucinações em LLMs.
Implementação com Ultralytics#
O exemplo seguinte demonstra como a engenharia de prompts é aplicada programaticamente utilizando o pacote ultralytics. Aqui, utilizamos um modelo YOLO-World que aceita prompts de texto para definir dinamicamente os objetos a procurar, ao contrário de modelos padrão, como o YOLO26, que utilizam listas de classes fixas.
from ultralytics import YOLO
# Load a YOLO-World model capable of interpreting text prompts
model = YOLO("yolov8s-world.pt")
# Apply prompt engineering to define custom classes dynamically
# The model maps these text descriptions to visual features
model.set_classes(["person in safety vest", "forklift", "blue hardhat"])
# Run inference on an image
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show results - the model only detects objects matching the prompts
results[0].show()Distinguir conceitos relacionados#
Para implementar eficazmente soluções de IA através da Plataforma Ultralytics, é importante distinguir a engenharia de prompts de técnicas de otimização semelhantes:
- Engenharia de Prompts vs. Ajuste de Prompts: A engenharia de prompts envolve a criação manual de entradas em linguagem natural. Em contrapartida, o ajuste de prompts é um método de ajuste fino eficiente em termos de parâmetros (PEFT) que aprende "soft prompts" (embeddings vetoriais contínuos) durante uma fase de treino. Estes soft prompts são otimizações matemáticas invisíveis para o utilizador.
- Engenharia de Prompts vs. Ajuste Fino: O ajuste fino atualiza permanentemente os pesos de um modelo utilizando um conjunto de dados de treino específico para o especializar numa tarefa. A engenharia de prompts não altera o modelo; apenas otimiza a entrada durante a inferência em tempo real.
- Engenharia de Prompts vs. Injeção de Prompts: Enquanto a engenharia é construtiva, a injeção de prompts é uma vulnerabilidade de segurança na qual entradas maliciosas manipulam o modelo para ignorar as suas restrições de segurança. Garantir a Segurança da IA exige uma defesa robusta contra esses prompts adversariais.









