Prompt Engineering
Domina la ingeniería de prompts para IA y visión artificial. Aprende a optimizar las entradas para LLM y modelos multimodales como Ultralytics YOLO26 para obtener resultados superiores.
La ingeniería de prompts es el proceso estratégico de diseñar, perfeccionar y optimizar el texto de entrada para guiar a los modelos de Inteligencia artificial (AI) hacia la generación de resultados precisos, relevantes y de alta calidad. Esta disciplina, que ganó protagonismo inicialmente con el auge de los modelos de lenguaje de gran tamaño (LLMs) como GPT-4, ha evolucionado hasta convertirse en una habilidad fundamental para interactuar con sistemas de IA generativa en distintas modalidades, como texto, imagen y vídeo. En lugar de modificar los pesos del modelo subyacente mediante un nuevo entrenamiento, la ingeniería de prompts aprovecha los conocimientos existentes del modelo planteando la tarea de forma que el sistema pueda entenderla mejor, conectando la intención humana con la ejecución de la máquina.
Mecánica de los prompts eficaces#
En esencia, la ingeniería de prompts se basa en comprender cómo los modelos fundacionales procesan el contexto y las instrucciones. Un prompt bien construido reduce la ambigüedad al proporcionar restricciones explícitas, formatos de salida deseados (como JSON o Markdown) e información contextual relevante. Los profesionales avanzados utilizan técnicas como el aprendizaje con pocos ejemplos, en el que el usuario proporciona algunos ejemplos de pares de entrada y salida dentro del prompt para mostrar el patrón deseado.
Otra estrategia eficaz es el prompting de cadena de pensamiento, que anima al modelo a descomponer las tareas de razonamiento complejas en pasos intermedios. Esto mejora significativamente el rendimiento en consultas que requieren mucho razonamiento lógico. Además, optimizar el uso de la ventana de contexto—el límite de la cantidad de texto que un modelo puede procesar a la vez—es crucial para mantener la coherencia en interacciones largas. Recursos externos, como la guía de OpenAI sobre el diseño de prompts, destacan la importancia del perfeccionamiento iterativo para gestionar eficazmente los casos límite.
Relevancia en la visión artificial#
Aunque suele asociarse al texto, la ingeniería de prompts es cada vez más importante en la visión artificial (CV). Los modelos multimodales modernos y los detectores de vocabulario abierto, como YOLO-World, permiten a los usuarios definir objetivos de detección mediante el procesamiento del lenguaje natural (NLP) en lugar de utilizar identificadores numéricos de clase predefinidos.
En este contexto, el «prompt» es una descripción textual del objeto (por ejemplo, «persona con un casco rojo»). Esta capacidad, conocida como aprendizaje zero-shot, permite a los sistemas detectar objetos con los que no se han entrenado explícitamente, aprovechando las asociaciones aprendidas entre las características visuales y las representaciones semánticas. En entornos de producción de alta velocidad en los que las clases son fijas, los desarrolladores podrían pasar finalmente de modelos guiados por prompts a modelos eficientes y reentrenados, como YOLO26, pero la ingeniería de prompts sigue siendo clave para la creación rápida de prototipos y la flexibilidad.
Aplicaciones en el mundo real#
La ingeniería de prompts aporta valor en diversos sectores al permitir una automatización flexible e inteligente:
- Analítica visual dinámica: En la IA en el comercio minorista, los responsables de tienda utilizan modelos de visión basados en prompts para buscar artículos específicos sin intervención técnica. Se puede pedir al sistema que haga un seguimiento de «estanterías vacías» un día y de «productos mal colocados» al siguiente. Esta flexibilidad permite a las empresas adaptar inmediatamente sus sistemas de detección de objetos a las tendencias estacionales.
- Creación automatizada de contenido: Los equipos de marketing se basan en prompts detallados para guiar a los generadores de texto a imagen, como Stable Diffusion o Midjourney. Al diseñar prompts que especifican la iluminación, el estilo artístico y la composición, los diseñadores pueden generar rápidamente recursos visuales.
- Recuperación inteligente de conocimientos: En la atención al cliente, los ingenieros diseñan «prompts de sistema» que indican a los chatbots que respondan a las consultas utilizando únicamente datos verificados de la empresa. Este es un componente clave de la generación aumentada por recuperación (RAG), que garantiza que la IA mantenga una personalidad útil y evite las alucinaciones en los LLM.
Implementación con Ultralytics#
El siguiente ejemplo muestra cómo se aplica la ingeniería de prompts mediante programación utilizando el paquete ultralytics. Aquí utilizamos un modelo YOLO-World que acepta prompts de texto para definir dinámicamente qué objetos buscar, a diferencia de los modelos estándar, como YOLO26, que utilizan listas de clases fijas.
from ultralytics import YOLO
# Load a YOLO-World model capable of interpreting text prompts
model = YOLO("yolov8s-world.pt")
# Apply prompt engineering to define custom classes dynamically
# The model maps these text descriptions to visual features
model.set_classes(["person in safety vest", "forklift", "blue hardhat"])
# Run inference on an image
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show results - the model only detects objects matching the prompts
results[0].show()Diferenciación de conceptos relacionados#
Para implementar soluciones de IA de forma eficaz mediante la plataforma Ultralytics, es importante distinguir la ingeniería de prompts de técnicas de optimización similares:
- Ingeniería de prompts frente a Prompt Tuning: La ingeniería de prompts consiste en crear manualmente entradas en lenguaje natural. En cambio, el ajuste de prompts es un método de ajuste fino eficiente en parámetros (PEFT) que aprende «prompts blandos» (representaciones vectoriales continuas) durante una fase de entrenamiento. Estos prompts blandos son optimizaciones matemáticas invisibles para el usuario.
- Ingeniería de prompts frente a Fine-Tuning: El ajuste fino actualiza permanentemente los pesos de un modelo utilizando un conjunto de datos de entrenamiento específico para especializarlo en una tarea. La ingeniería de prompts no cambia el modelo en sí, sino que solo optimiza la entrada durante la inferencia en tiempo real.
- Ingeniería de prompts frente a Prompt Injection: Mientras que la ingeniería es constructiva, la inyección de prompts es una vulnerabilidad de seguridad en la que entradas maliciosas manipulan el modelo para que ignore sus restricciones de seguridad. Garantizar la seguridad de la IA requiere una defensa sólida frente a este tipo de prompts adversarios.









