Prompt Caching
Descubre cómo la caché de prompts optimiza la IA generativa al reducir la latencia y los costes. Aprende cuál es su función en los LLM y en la visión artificial en tiempo real con Ultralytics YOLO26.
El almacenamiento en caché de prompts es una estrategia avanzada de optimización que se utiliza principalmente en la IA generativa para reducir significativamente los costes y mejorar los tiempos de respuesta durante la inferencia. En el ámbito de los modelos de lenguaje de gran tamaño (LLMs), el procesamiento de texto requiere convertir las entradas en secuencias numéricas conocidas como tokens. A menudo, una gran parte de los datos de entrada —como una instrucción de sistema detallada, un documento jurídico extenso o una base de código— permanece estática en muchas consultas de usuario diferentes. En lugar de volver a procesar estas secciones invariables para cada nueva solicitud, el almacenamiento en caché de prompts guarda en la memoria los estados matemáticos precalculados, a menudo denominados caché de clave-valor. Esto permite que el motor de inferencia omita los cálculos redundantes y concentre la potencia computacional únicamente en las partes nuevas y dinámicas del prompt del usuario.
Mecanismos y ventajas#
El funcionamiento fundamental del almacenamiento en caché de prompts se basa en la arquitectura de los Transformers, que procesan los datos secuencialmente. Al identificar el prefijo repetitivo de un prompt, el sistema puede cargar directamente desde la memoria de alta velocidad los estados correspondientes del mecanismo de atención.
- Menor latencia: El almacenamiento en caché reduce drásticamente la latencia de inferencia, concretamente el tiempo hasta el primer token (TTFT). Esto garantiza que las aplicaciones en tiempo real, como los chatbots interactivos, parezcan instantáneas para el usuario.
- Eficiencia de costes: Como los proveedores de computación en la nube suelen facturar en función de la duración del cálculo o del procesamiento de tokens, omitir el procesamiento intensivo del contexto estático se traduce en un ahorro considerable.
- Mayor rendimiento: Al liberar recursos de GPU, los servidores pueden gestionar un mayor volumen de solicitudes simultáneas, lo que hace que toda la infraestructura de servicio de modelos sea más escalable.
Aplicaciones en el mundo real#
El almacenamiento en caché de prompts está transformando las industrias que dependen de contextos de datos extensos.
-
Asistentes de programación: En el desarrollo de software, herramientas como GitHub Copilot utilizan grandes cantidades de contexto de los archivos abiertos del usuario y de la estructura del repositorio. Al almacenar en caché los embeddings de la base de código, el modelo puede proporcionar sugerencias de finalización de código en tiempo real sin tener que volver a analizar la estructura completa de archivos del proyecto con cada pulsación de tecla.
-
Análisis jurídico y médico: Los profesionales suelen consultar agentes de IA sobre documentos estáticos de gran tamaño, como archivos de jurisprudencia o historiales médicos de pacientes. Mediante la generación aumentada por recuperación (RAG), el sistema recupera fragmentos de texto relevantes. El almacenamiento en caché de prompts garantiza que el contexto fundamental de estos documentos recuperados no tenga que volver a calcularse para las preguntas de seguimiento, lo que agiliza el flujo de trabajo de respuesta a preguntas.
Relevancia en la visión artificial#
Aunque tradicionalmente se asociaba al texto, el concepto de almacenamiento en caché es esencial en la visión artificial (CV) multimodal. Los modelos como YOLO-World permiten detectar objetos mediante prompts de texto de vocabulario abierto. Cuando un usuario define una lista de clases (por ejemplo, "persona, mochila, coche"), el modelo calcula embeddings de texto para esas clases. Al almacenar estos embeddings en caché, se evita que el modelo tenga que volver a codificar los prompts de texto para cada fotograma de vídeo, lo que permite realizar inferencias en tiempo real a alta velocidad.
Diferenciación de términos relacionados#
- Frente a la ingeniería de prompts: La ingeniería de prompts implica el trabajo humano de diseñar la entrada de texto óptima para guiar al modelo. El almacenamiento en caché de prompts es una optimización computacional del backend que guarda el procesamiento que la máquina realiza sobre ese texto.
- Frente al ajuste de prompts: El ajuste de prompts es una técnica de aprendizaje por transferencia que actualiza determinados pesos del modelo (prompts blandos) para adaptar un modelo a una tarea. El almacenamiento en caché no modifica los parámetros del modelo; solo memoriza los estados de activación durante la ejecución.
Ejemplo de código: almacenamiento en caché de embeddings de texto en visión#
El siguiente fragmento de Python demuestra el concepto de «almacenamiento en caché» de un prompt en un contexto de visión mediante el paquete ultralytics. Al establecer las clases una sola vez en un modelo YOLO-World, los embeddings de texto se calculan y almacenan (persisten), lo que permite al modelo realizar predicciones de forma eficiente sobre varias imágenes sin volver a procesar la descripción textual.
from ultralytics import YOLOWorld
# Load a YOLO-World model capable of open-vocabulary detection
model = YOLOWorld("yolov8s-world.pt")
# "Cache" the prompt: Define classes once.
# The model computes and stores text embeddings for these specific terms.
model.set_classes(["helmet", "reflective vest", "gloves"])
# Run inference repeatedly. The text prompt is not re-computed for each call.
# This mimics the efficiency gains of prompt caching in LLMs.
results_1 = model.predict("construction_site_1.jpg")
results_2 = model.predict("construction_site_2.jpg")Para gestionar conjuntos de datos y desplegar estos modelos optimizados, la plataforma de Ultralytics proporciona un entorno integral para anotar datos, entrenar modelos de última generación como YOLO26 y supervisar el rendimiento del despliegue en diversos dispositivos de IA en el perímetro.









