Attention Sinks
Descubre cómo los sumideros de atención estabilizan los LLM y VLM para generar secuencias infinitas. Aprende a optimizar la memoria y desplegar una IA estable con Ultralytics YOLO26.
Los sumideros de atención son un fenómeno crítico descubierto en la arquitectura de los modernos grandes modelos de lenguaje (LLMs) y modelos de visión-lenguaje (VLMs) que garantiza la estabilidad durante la generación continua de texto o datos de formato largo. En un mecanismo de atención, las redes neuronales asignan dinámicamente «pesos» a distintas partes de la entrada. Los investigadores observaron que los modelos autorregresivos vuelcan inherentemente una cantidad enorme de puntuaciones de atención sobrantes sobre los primeros tokens de una secuencia, independientemente de su significado semántico real. Estos tokens iniciales actúan como un «sumidero de atención» y proporcionan un anclaje matemático que evita que las puntuaciones de atención del modelo colapsen. Al mantener permanentemente estos tokens sumidero en la caché KV del modelo, los desarrolladores pueden habilitar la generación de secuencias infinitas sin degradar la precisión ni provocar fallos por límites de memoria.
Cómo estabilizan los modelos los sumideros de atención#
La necesidad de los sumideros de atención surge de la operación Softmax utilizada en Transformers. Como las puntuaciones de atención siempre deben sumar 1, el modelo necesita un lugar donde asignar la atención innecesaria al procesar datos muy localizados. Los primeros tokens de un prompt absorben este exceso de forma natural.
Históricamente, al generar secuencias muy largas, los ingenieros utilizaban técnicas de ventanas que expulsaban de la memoria los tokens más antiguos. Sin embargo, descartar los tokens sumidero iniciales provocaba un colapso inmediato del rendimiento. Las implementaciones modernas, como StreamingLLM, conservan explícitamente estos tokens iniciales junto con los tokens más recientes. Este enfoque de gestión de memoria altamente optimizado se está investigando activamente en los desarrollos de visión de OpenAI y la investigación de Google DeepMind, y cuenta con compatibilidad nativa en el ecosistema de PyTorch.
Diferenciación entre conceptos de atención relacionados#
Para comprender plenamente cómo optimizan el contexto los modelos de IA, resulta útil contrastar los sumideros de atención con otras estrategias de memoria y hardware:
- Sumideros de atención frente a la atención de ventana deslizante: la atención de ventana deslizante restringe el foco del modelo a un número fijo de tokens recientes para ahorrar memoria. Sin embargo, las ventanas deslizantes estrictas descartan los primeros tokens, lo que provoca inestabilidad. Los sumideros de atención modifican este comportamiento anclando la ventana en esos primeros tokens cruciales.
- Sumideros de atención frente a Flash Attention: Flash Attention es una optimización a nivel de hardware que acelera las lecturas y escrituras de memoria en la GPU. En cambio, los sumideros de atención son un descubrimiento arquitectónico sobre qué tokens deben conservarse en la memoria para mantener la estabilidad lógica.
Aplicaciones en el mundo real#
El descubrimiento de los sumideros de atención ha desbloqueado capacidades de procesamiento continuo altamente eficientes en diversos sectores.
-
Agentes de IA y chatbots continuos: al conservar los sumideros de atención, un agente de IA o un bot de atención al cliente puede transmitir un diálogo ininterrumpido durante horas. Olvida selectivamente los tokens intermedios mientras conserva el sumidero inicial y el contexto reciente, evitando errores de falta de memoria y preservando la coherencia de la conversación.
-
Comprensión de vídeo en tiempo real: en la videovigilancia inteligente y la supervisión continua, mantener una ventana de contexto estable es fundamental. Los modelos pueden analizar transmisiones de vídeo continuas durante días, igualando la eficiencia de las arquitecturas de visión optimizadas para el edge.
Implementación de inferencia continua eficiente#
Aunque los sumideros de atención optimizan principalmente los enormes modelos generativos, aplicar bucles de inferencia eficientes y conscientes de la memoria es universalmente importante en la visión por computador (CV). Al procesar flujos de vídeo continuos con Ultralytics YOLO26, aprovechar los generadores de Python garantiza la estabilidad de la memoria durante largos periodos, de forma similar a la gestión de una ventana de contexto localizada.
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 model for efficient, real-time edge processing
model = YOLO("yolo26n.pt")
# Process a continuous video stream efficiently without memory overflow
results = model.predict(source="rtsp://continuous_camera_stream", stream=True)
# Iterate through the generator to maintain a stable memory footprint over time
for frame_result in results:
print(f"Detected {len(frame_result.boxes)} objects in the current frame.")Ampliar estas canalizaciones eficientes y continuas de detección de objetos para su uso empresarial requiere herramientas de gestión sólidas. Los desarrolladores pueden utilizar la Ultralytics Platform para simplificar el despliegue de modelos y la gestión automatizada de conjuntos de datos, lo que permite a los equipos crear aplicaciones de visión estables y de larga duración con facilidad.









