Prompt Enrichment
Aprende como o enriquecimento de prompts automatiza o aumento de entradas para melhorar a precisão da IA. Descobre como usar esta técnica com o Ultralytics YOLO26 para tarefas de visão mais inteligentes.
O enriquecimento de prompts é o processo automatizado de complementar a entrada inicial de um utilizador com contexto relevante, instruções específicas ou dados adicionais antes de a enviar para um modelo de Inteligência Artificial (AI). Esta técnica funciona como uma camada de middleware inteligente que otimiza a interação entre pessoas e máquinas, garantindo que os Modelos de Linguagem de Grande Escala (LLMs) e os sistemas de visão computacional recebem consultas abrangentes. Ao inserir detalhes que um utilizador poderia omitir — como preferências anteriores, dados de localização ou restrições técnicas —, o enriquecimento de prompts melhora significativamente a precisão e a personalização da saída do modelo, sem exigir que o utilizador seja especialista na elaboração de instruções detalhadas.
O mecanismo do enriquecimento#
A função principal do enriquecimento de prompts é colmatar a lacuna entre uma intenção humana vaga e a entrada precisa e rica em dados de que os modelos necessitam para um desempenho ideal. Quando uma consulta é recebida, o sistema analisa-a e obtém as informações de contexto necessárias a partir de um grafo de conhecimento ou de uma base de dados estruturada. Estes dados obtidos são formatados programaticamente e anexados ao prompt original.
Por exemplo, em fluxos de trabalho de Processamento de Linguagem Natural (NLP), uma pergunta simples como "Qual é o estado?" é contextualmente insuficiente. Um sistema de enriquecimento identifica a sessão ativa, obtém o número do pedido mais recente de uma base de dados transacional e reescreve o prompt como: "O utilizador está a perguntar sobre o Pedido #998, que está atualmente em trânsito. Forneça uma atualização sobre o envio com base neste estado." Este processo utiliza frequentemente bases de dados vetoriais para encontrar rapidamente contexto semanticamente relevante a adicionar.
Aplicações no mundo real#
O enriquecimento de prompts é essencial para implementar aplicações robustas de IA generativa em vários setores, melhorando tanto os sistemas baseados em texto como os baseados em visão:
-
Suporte ao cliente com conhecimento do contexto: Nos serviços de assistência automatizados, um chatbot utiliza o enriquecimento para aceder ao histórico de compras e ao ambiente técnico de um cliente. Em vez de pedir ao utilizador a versão do dispositivo, o sistema obtém essa informação dos metadados da conta e insere-a no prompt. Isto permite ao agente de IA fornecer imediatamente passos de resolução de problemas específicos do dispositivo, melhorando significativamente a experiência do cliente.
-
Configuração dinâmica de visão computacional: Em operações de segurança, um utilizador pode simplesmente ativar uma definição de "Modo noturno". Nos bastidores, o enriquecimento de prompts traduz esta intenção de alto nível em classes de objetos específicas para um detetor de vocabulário aberto como o YOLO-World. O sistema enriquece o prompt para procurar especificamente "lanterna", "movimento suspeito" ou "pessoa não autorizada", permitindo que o modelo adapte dinamicamente o foco da sua deteção de objetos.
Exemplo: enriquecimento dinâmico de classes#
O exemplo seguinte em Python demonstra o conceito de enriquecimento de prompts utilizando o pacote ultralytics. Aqui, a intenção de alto nível de um utilizador é enriquecida programaticamente numa lista de classes descritivas específicas que o modelo procura.
from ultralytics import YOLO
def run_enriched_inference(user_mode):
"""Enriches a simple user mode into specific detection prompts."""
# Load a YOLO-World model capable of open-vocabulary detection
model = YOLO("yolov8s-world.pt")
# Enrichment Logic: Map simple user intent to detailed class prompts
context_map = {
"site_safety": ["hard hat", "safety vest", "gloves"],
"traffic": ["car", "bus", "traffic light", "pedestrian"],
}
# Inject the enriched context into the model
enriched_classes = context_map.get(user_mode, ["object"])
model.set_classes(enriched_classes)
# The model now looks for the specific enriched terms
print(f"Mode: {user_mode} -> Enriched Prompt: {enriched_classes}")
run_enriched_inference("site_safety")Enriquecimento de prompts vs. conceitos relacionados#
Para implementar Operações de Machine Learning (MLOps) eficazes, é útil distinguir o enriquecimento de prompts de termos semelhantes:
- Geração aumentada por recuperação (RAG): RAG é um método específico de enriquecimento. Refere-se estritamente ao mecanismo de obter documentos relevantes de um corpus externo para fundamentar a resposta do modelo. O enriquecimento é o conceito mais abrangente, que inclui RAG, mas também abrange a inserção de dados estáticos da sessão, metadados do utilizador ou a hora do sistema, sem necessariamente realizar uma pesquisa semântica complexa.
- Engenharia de prompts: Esta é a prática manual de conceber prompts eficazes. O enriquecimento é um processo automatizado que aplica dinamicamente princípios de engenharia de prompts durante a execução.
- Afinação de prompts: Esta é uma técnica de afinação fina eficiente em parâmetros (PEFT) na qual os "prompts suaves" (tensores aprendíveis) são otimizados durante o treino. O enriquecimento de prompts ocorre inteiramente durante a inferência em tempo real e não altera os pesos do modelo.
- Aprendizagem few-shot: Consiste em fornecer exemplos no prompt para ensinar uma tarefa ao modelo. Os sistemas de enriquecimento inserem frequentemente estes exemplos few-shot de forma dinâmica, com base no tipo de tarefa, combinando efetivamente ambos os conceitos.
Relevância nos sistemas modernos de IA#
À medida que modelos como o Ultralytics YOLO26 e o GPT-4 se tornam mais capazes, o estrangulamento desloca-se frequentemente para a qualidade da entrada. O enriquecimento de prompts reduz as alucinações nos LLMs ao fundamentar o modelo em dados factuais fornecidos. Em visão computacional (CV), permite sistemas de deteção flexíveis de aprendizagem zero-shot que se podem adaptar instantaneamente a novos ambientes sem novo treino, simplesmente modificando os prompts de texto fornecidos ao sistema. Esta flexibilidade é crucial para criar soluções de IA multimodal escaláveis, capazes de raciocinar sobre texto e imagens. Os utilizadores que pretendem gerir os conjuntos de dados utilizados para fundamentar estes sistemas recorrem frequentemente a ferramentas como a Ultralytics Platform para organizar e anotar eficazmente as suas informações.









