Ultralytics YOLO27:
Volver al glosario de Ultralytics

Longformer

Explora la arquitectura Longformer para procesar secuencias de datos largas de forma eficiente. Descubre cómo la atención dispersa supera las limitaciones de memoria en PLN y visión por ordenador.

Longformer es un tipo especializado de arquitectura de aprendizaje profundo diseñada para procesar secuencias largas de datos de forma eficiente y superar las limitaciones de los modelos tradicionales. Introducido originalmente para abordar las restricciones de los Transformers estándar, que normalmente tienen dificultades con secuencias de más de 512 tokens debido a las limitaciones de memoria, Longformer emplea un mecanismo de atención modificado. Al reducir la complejidad computacional de cuadrática a lineal, esta arquitectura permite a los sistemas de IA analizar documentos completos, transcripciones extensas o secuencias genéticas complejas en una sola pasada sin truncar la entrada.

El problema del cuello de botella de la atención#

Para comprender la importancia de Longformer, es fundamental examinar la limitación de predecesores como BERT y los primeros modelos GPT-3. Los transformers estándar utilizan una operación de «autoatención» en la que cada token (palabra o parte de una palabra) presta atención a todos los demás tokens de la secuencia. Esto genera un coste computacional cuadrático: duplicar la longitud de la secuencia cuadruplica la memoria necesaria en la GPU. En consecuencia, la mayoría de los modelos estándar imponen un límite estricto al tamaño de entrada, lo que a menudo obliga a los científicos de datos a dividir los documentos en segmentos más pequeños y desconectados, con la consiguiente pérdida de contexto.

Longformer resuelve este problema introduciendo la atención dispersa. En lugar de una conexión completa entre todos los elementos, utiliza una combinación de atención local en ventanas y atención global:

  • Atención en ventana deslizante: cada token solo presta atención a sus vecinos inmediatos. Esto captura el contexto local y la estructura sintáctica, de forma similar a cómo una red neuronal convolucional (CNN) procesa las imágenes.
  • Ventana deslizante dilatada: para aumentar el campo receptivo sin incrementar el coste computacional, la ventana puede incorporar espacios, lo que permite al modelo ver más «lejos» en el texto.
  • Atención global: determinados tokens preseleccionados (como el token de clasificación [CLS]) prestan atención a todos los demás tokens de la secuencia, y todos los tokens les prestan atención a ellos. Esto garantiza que el modelo conserve una comprensión de alto nivel de toda la entrada para tareas como el resumen de textos.

Aplicaciones en el mundo real#

La capacidad de procesar miles de tokens simultáneamente abre nuevas posibilidades para el procesamiento del lenguaje natural (NLP) y otros campos.

1. Análisis de documentos jurídicos y médicos#

En sectores como el jurídico y el sanitario, los documentos rara vez son breves. Un contrato legal o el historial médico de un paciente pueden abarcar decenas de páginas. Los modelos de lenguaje de gran tamaño (LLMs) tradicionales exigirían fragmentar estos documentos, lo que podría hacer que se pasaran por alto dependencias cruciales entre una cláusula de la página 1 y una definición de la página 30. Longformer permite realizar reconocimiento de entidades nombradas (NER) y clasificación sobre todo el documento de una sola vez, garantizando que el contexto global influya en la interpretación de términos específicos.

2. Respuesta a preguntas de formato largo (QA)#

Los sistemas estándar de respuesta a preguntas suelen tener dificultades cuando la respuesta a una pregunta requiere sintetizar información distribuida por un artículo extenso. Al mantener todo el texto en memoria, los modelos basados en Longformer pueden realizar razonamiento de varios saltos y conectar hechos encontrados en distintos párrafos para generar una respuesta completa. Esto es fundamental para los sistemas automatizados de soporte técnico y las herramientas de investigación académica.

Diferenciación de términos clave#

  • Longformer frente a Transformer: el Transformer estándar utiliza una atención completa de $N^2$, lo que lo hace preciso, pero costoso desde el punto de vista computacional para entradas largas. Longformer utiliza una atención dispersa de $N$, con una pérdida insignificante de capacidad teórica a cambio de enormes mejoras de eficiencia, lo que permite entradas de 4.096 tokens o más.
  • Longformer frente a Transformer-XL: aunque ambos gestionan secuencias largas, Transformer-XL depende de un mecanismo recurrente (almacena en caché los estados anteriores) para recordar segmentos previos. Longformer procesa la secuencia larga de forma nativa y de una sola vez, lo que simplifica el entrenamiento en paralelo en plataformas como Ultralytics Platform.
  • Longformer frente a BigBird: son arquitecturas muy similares desarrolladas aproximadamente al mismo tiempo. Ambas utilizan mecanismos de atención dispersa para lograr un escalado lineal. BigBird introduce un componente específico de atención aleatoria además de las ventanas deslizantes.

Conceptos de implementación#

Aunque Longformer es una arquitectura y no una función específica, es fundamental comprender cómo preparar los datos para modelos con contexto largo. En frameworks modernos como PyTorch, esto suele implicar gestionar embeddings que superan los límites estándar.

El siguiente ejemplo muestra cómo crear un tensor de entrada simulado para un escenario de contexto largo y lo contrasta con el tamaño habitual utilizado en modelos de detección estándar como YOLO26.

import torch

# Standard BERT-like models typically cap at 512 tokens
standard_input = torch.randint(0, 30000, (1, 512))

# Longformer architectures can handle significantly larger inputs (e.g., 4096)
# This allows the model to "see" the entire sequence at once.
long_context_input = torch.randint(0, 30000, (1, 4096))

print(f"Standard Input Shape: {standard_input.shape}")
print(f"Long Context Input Shape: {long_context_input.shape}")

# In computer vision, a similar concept applies when processing high-res images
# without downsampling, preserving fine-grained details.

Relevancia para la visión artificial#

Aunque se diseñaron originalmente para texto, los principios en los que se basa Longformer han influido en la visión artificial. El concepto de limitar la atención a un vecindario local es análogo a las operaciones localizadas de las tareas visuales. Los Vision Transformers (ViT) se enfrentan a problemas de escalado similares con imágenes de alta resolución, porque el número de píxeles (o parches) puede ser enorme. Las técnicas derivadas de la atención dispersa de Longformer se utilizan para mejorar la eficiencia de la clasificación de imágenes y la detección de objetos, ayudando a modelos como YOLO26 a mantener velocidades elevadas mientras procesan datos visuales detallados.

Para obtener más información sobre los detalles arquitectónicos, el artículo original sobre Longformer de AllenAI proporciona benchmarks exhaustivos y justificaciones teóricas. Además, el entrenamiento eficiente de modelos tan grandes suele beneficiarse de técnicas como la precisión mixta y los algoritmos de optimización avanzados.

Explore solutions

Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu recorrido hacia el futuro del aprendizaje automático