Prompt Caching
Descubre cómo el almacenamiento en caché de prompts optimiza la IA generativa al reducir la latencia y los costos. Aprende su papel en los LLMs y la visión artificial en tiempo real con Ultralytics YOLO26.
La caché de prompts es una estrategia de optimización avanzada utilizada principalmente en generative AI para reducir significativamente los costes y mejorar los tiempos de respuesta durante la inferencia. En el ámbito de los Large Language Models (LLMs), procesar texto requiere convertir las entradas en secuencias numéricas conocidas como tokens. A menudo, una gran parte de los datos de entrada, como una instrucción de sistema detallada, un documento legal extenso o una base de código, permanece estática en muchas consultas de usuario diferentes. En lugar de volver a procesar estas secciones inmutables en cada nueva solicitud, la caché de prompts almacena los estados matemáticos precalculados (a menudo denominados caché de Clave-Valor) en la memoria. Esto permite que el inference engine omita cálculos redundantes y centre la potencia de cálculo únicamente en las partes nuevas y dinámicas del prompt del usuario.
Mecanismos y beneficios#
La mecánica fundamental de la caché de prompts se basa en la arquitectura de los Transformers, que procesan los datos de forma secuencial. Al identificar el prefijo repetitivo de un prompt, el sistema puede cargar los estados correspondientes del attention mechanism directamente desde la memoria de alta velocidad.
- Latencia reducida: La caché reduce drásticamente la inference latency, concretamente el Tiempo hasta el Primer Token (TTFT). Esto garantiza que las aplicaciones en tiempo real, como los chatbots interactivos, se sientan instantáneas para el usuario.
- Eficiencia de costes: Dado que los proveedores de Cloud Computing suelen facturar en función de la duración del cálculo o el procesamiento de tokens, omitir el trabajo pesado para el contexto estático genera un ahorro sustancial.
- Mayor rendimiento: Al liberar recursos de GPU, los servidores pueden gestionar un mayor volumen de solicitudes simultáneas, lo que hace que toda la infraestructura de model serving sea más escalable.
Aplicaciones en el mundo real#
El almacenamiento en caché de prompts está transformando sectores que dependen de un contexto de datos pesado.
-
Asistentes de programación: En el desarrollo de software, herramientas como GitHub Copilot utilizan una gran cantidad de contexto de los archivos abiertos y la estructura del repositorio del usuario. Al almacenar en caché los embeddings de la base de código, el modelo puede ofrecer sugerencias de autocompletado de código en tiempo real sin tener que volver a analizar toda la estructura de archivos del proyecto en cada pulsación de tecla.
-
Análisis legal y médico: Los profesionales suelen consultar AI Agents utilizando documentos estáticos masivos, como archivos de jurisprudencia o historiales de pacientes. Mediante la Retrieval-Augmented Generation (RAG), el sistema recupera fragmentos de texto relevantes. La caché de prompts garantiza que el contexto fundamental de estos documentos recuperados no necesite ser recalculados para las preguntas de seguimiento, lo que agiliza el flujo de trabajo de Question Answering.
Relevancia en visión artificial#
Aunque tradicionalmente se asocia con el texto, el concepto de caché es vital en la Computer Vision (CV) multimodal. Modelos como YOLO-World permiten a los usuarios detectar objetos utilizando prompts de texto de vocabulario abierto. Cuando un usuario define una lista de clases (por ejemplo, "persona, mochila, coche"), el modelo calcula los embeddings de texto para estas clases. Almacenar en caché estos embeddings evita que el modelo tenga que volver a codificar los prompts de texto para cada fotograma de vídeo, lo que permite una Real-Time Inference de alta velocidad.
Distinción de términos relacionados#
- Frente a la Prompt Engineering: La ingeniería de prompts implica el esfuerzo humano de diseñar la entrada de texto óptima para guiar al modelo. La caché de prompts es una optimización computacional del backend que almacena el procesamiento que hace la máquina de ese texto.
- Frente al Prompt Tuning: El ajuste de prompts es una técnica de Transfer Learning que actualiza Model Weights específicos (prompts blandos) para adaptar un modelo a una tarea. La caché no cambia los parámetros del modelo; solo memoriza los estados de activación durante la ejecución.
Ejemplo de código: Almacenamiento en caché de embeddings de texto en visión#
El siguiente fragmento de Python demuestra el concepto de "almacenar en caché" un prompt en un contexto de visión utilizando el paquete ultralytics. Al configurar las clases una sola vez en un modelo de YOLO-World, los embeddings de texto se calculan y se almacenan (persisten), lo que permite al modelo predecir de manera eficiente en múltiples imágenes sin volver a procesar la descripción de texto.
from ultralytics import YOLOWorld
# Load a YOLO-World model capable of open-vocabulary detection
model = YOLOWorld("yolov8s-world.pt")
# "Cache" the prompt: Define classes once.
# The model computes and stores text embeddings for these specific terms.
model.set_classes(["helmet", "reflective vest", "gloves"])
# Run inference repeatedly. The text prompt is not re-computed for each call.
# This mimics the efficiency gains of prompt caching in LLMs.
results_1 = model.predict("construction_site_1.jpg")
results_2 = model.predict("construction_site_2.jpg")Para gestionar conjuntos de datos y desplegar estos modelos optimizados, la Ultralytics Platform proporciona un entorno completo para anotar datos, entrenar modelos de vanguardia como YOLO26 y supervisar el rendimiento del despliegue en varios dispositivos de Edge AI.






