Seguridad lista para empresas: Conforme con ISO 27001 + SOC 2 Type I.
Volver al glosario de Ultralytics

Chunked Prefill

Aprende cómo el prefill segmentado mejora la latencia y el rendimiento de la inferencia de LLM dividiendo las indicaciones largas en fragmentos de tokens para un servicio más fluido bajo cargas de trabajo concurrentes.

La precarga fragmentada es una técnica de programación de inferencia que divide un mensaje de entrada largo en grupos más pequeños de tokens en lugar de procesar todo el mensaje en una sola operación ininterrumpida. Un motor de inferencia puede intercalar estos fragmentos con la generación de tokens para otras solicitudes, evitando que un mensaje largo monopolice la GPU. El resultado suele ser una latencia más fluida bajo cargas de trabajo concurrentes, un mejor uso del hardware y un servicio más predecible para aplicaciones interactivas de modelos de lenguaje grandes.

Cómo Funciona la Precarga Fragmentada#

La inferencia autorregresiva de Transformer tiene dos fases principales:

  • Prefill: El modelo procesa todos los tokens de entrada, calcula sus estados de atención y llena la caché KV. La precarga evalúa muchos tokens en paralelo y suele estar limitada por la capacidad de cálculo.
  • Decode: El modelo genera resultados un token a la vez mientras lee los estados almacenados previamente en caché. La decodificación suele estar limitada por el ancho de banda de la memoria en lugar de por el cálculo bruto.

Sin la fragmentación, una solicitud de 20,000 tokens puede ocupar un paso de inferencia durante mucho más tiempo que una solicitud corta. Las generaciones activas pueden entonces experimentar pausas, lo que aumenta la latencia entre tokens incluso si sus propios mensajes son pequeños.

Con la precarga fragmentada, el planificador asigna a cada iteración un presupuesto de tokens. Primero programa las operaciones de decodificación activas y luego utiliza el presupuesto restante para uno o más fragmentos de mensajes. Si un mensaje no cabe, sus tokens restantes esperan para una iteración posterior. La guía de optimización de vLLM actual describe este enfoque como una forma de combinar el trabajo de precarga pesado en cálculo con la decodificación pesada en memoria.

La fragmentación cambia el momento en que se procesan los tokens del mensaje, no su orden ni su significado. Cada fragmento completado amplía el estado de atención almacenado en caché de la solicitud hasta que todo el mensaje esté listo y pueda comenzar la decodificación.

Por Qué Importa la Precarga Fragmentada#

La precarga fragmentada aborda objetivos de rendimiento competitivos en el servido de modelos de producción:

  • Latencia entre tokens: Priorizar las solicitudes de decodificación existentes ayuda a que las respuestas en streaming continúen sin largas pausas.
  • Tiempo hasta el primer token: Los fragmentos grandes terminan un nuevo mensaje antes, mientras que los fragmentos muy pequeños pueden retrasar su primer token generado.
  • Rendimiento: Combinar el trabajo de precarga y decodificación puede utilizar el cálculo de la GPU y el ancho de banda de la memoria de manera más eficaz.
  • Equidad: Es menos probable que los mensajes largos bloqueen muchas solicitudes interactivas cortas.

Por lo tanto, la configuración del fragmento o del presupuesto de tokens es un compromiso. La configuración del planificador de vLLM ofrece controles para límites de tokens por lotes, precargas parciales y umbrales para mensajes largos. Los presupuestos más pequeños suelen favorecer una decodificación receptiva, mientras que los presupuestos más grandes favorecen una ingesta de mensajes más rápida.

La fragmentación no elimina todos los cuellos de botella. Los contextos largos siguen consumiendo memoria caché, y una admisión demasiado agresiva puede causar presión en la caché, suplantación de solicitudes o trabajo repetido. Los operadores deben medir la latencia de inferencia mediana y de cola, el tiempo hasta el primer token, la latencia entre tokens, el rendimiento y el uso de la memoria de la GPU bajo distribuciones de mensajes realistas.

Conceptos de Inferencia Relacionados#

La precarga fragmentada está estrechamente relacionada con varias optimizaciones pero cumple un propósito distinto:

  • Procesamiento por lotes continuo: Agrega y elimina solicitudes dinámicamente durante la generación. La precarga fragmentada lo complementa haciendo que el procesamiento de mensajes largos sea programable en los límites a nivel de token.
  • Almacenamiento en caché de mensajes: Reutiliza estados calculados previamente para un prefijo de mensaje repetido. La precarga fragmentada programa un nuevo cálculo; no omite dicho cálculo.
  • Gestión de caché KV paginada: Organiza los estados de atención almacenados en caché en bloques de memoria. La descripción general de TensorRT-LLM de NVIDIA incluye almacenamiento en caché paginado y procesamiento por lotes en curso junto con optimizaciones de procesamiento de mensajes.
  • Procesamiento por lotes dinámico: Combina solicitudes separadas en lotes, como se explica en la guía de procesamiento por lotes dinámico de NVIDIA Triton. No divide necesariamente un mensaje largo individual en precargas parciales.
  • Precarga y decodificación desagregadas: Ejecuta las fases en trabajadores separados. La guía de implementación de precarga y decodificación de NVIDIA muestra cómo las etapas se pueden escalar de forma independiente en su lugar.

Although the Ultralytics YOLO26 Triton deployment workflow supports scalable computer vision inference and automatic batching, standard YOLO object detection does not have an autoregressive text-prefill phase. Chunked prefill applies primarily to generative language and multimodal models.

Aplicaciones en el mundo real#

  1. Asistentes de documentos: Un asistente aumentado por recuperación puede recibir un informe largo mientras atiende simultáneamente a usuarios con preguntas breves. Fragmentar la precarga del informe permite que los chats en curso sigan decodificándose en lugar de congelarse hasta que se procese todo el contexto.

  2. Análisis de vídeo multimodal: Un modelo de visión-lenguaje puede recibir características de imagen, descripciones de objetos y una instrucción de texto larga. Una canalización de visión puede producir primero detecciones usando la predicción de Ultralytics YOLO, y luego enviar contexto visual estructurado al modelo generativo. La precarga fragmentada ayuda a programar los tokens visuales y textuales resultantes junto con otras solicitudes. El flujo de trabajo multimodal de codificación-precarga-decodificación de NVIDIA ilustra por qué gestionar estas etapas de forma independiente puede mejorar la escalabilidad.

Guía de Implementación Práctica#

Habilita la precarga fragmentada únicamente a través de un motor de servicio que sea compatible oficialmente con la arquitectura de destino. Por ejemplo, la configuración del backend de TensorRT-LLM documenta los controles de contexto fragmentado para las implementaciones compatibles.

Realiza pruebas comparativas con concurrencia, longitudes de entrada y longitudes de salida realistas en lugar de depender de una sola solicitud. Comienza con el presupuesto de tokens recomendado por el entorno de ejecución, luego ajústalo mientras observas el tiempo hasta el primer token y la latencia entre tokens. Por último, prueba cargas de trabajo mixtas que contengan mensajes muy largos y muy cortos; aquí es donde la precarga fragmentada proporciona su valor operativo más claro.

Explore solutions

Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu viaje con el futuro del aprendizaje automático