YOLO Vision 2026:
Voltar para o Glossário da Ultralytics

Longformer

Explora a arquitetura Longformer para processar sequências de dados longas de forma eficiente. Aprende como a atenção esparsa supera os limites de memória para NLP e Computer Vision.

O Longformer é um tipo especializado de arquitetura de Deep Learning projetado para processar longas sequências de dados de forma eficiente, superando as limitações dos modelos tradicionais. Originalmente introduzido para resolver as restrições dos Transformers padrão, que normalmente enfrentam dificuldades com sequências maiores que 512 tokens devido a restrições de memória, o Longformer emprega um mecanismo de atenção modificado. Ao reduzir a complexidade computacional de quadrática para linear, esta arquitetura permite que sistemas de IA analisem documentos inteiros, transcrições longas ou sequências genéticas complexas em uma única passagem, sem truncar a entrada.

O Problema do Gargalo de Atenção#

Para entender a importância do Longformer, é essencial analisar as limitações de predecessores como os modelos BERT e os iniciais GPT-3. Os transformers padrão utilizam uma operação de "autoatenção" na qual cada token (palavra ou parte de uma palavra) presta atenção em todos os outros tokens da sequência. Isso cria um custo computacional quadrático; dobrar o comprimento da sequência quadruplica a memória necessária na GPU. Consequentemente, a maioria dos modelos padrão impõe um limite estrito ao tamanho da entrada, muitas vezes forçando cientistas de dados a dividir documentos em segmentos menores e desconectados, o que resulta em perda de contexto.

O Longformer resolve isso introduzindo a Atenção Esparsa. Em vez de uma conexão total de todos para todos, ele utiliza uma combinação de atenção local em janela e atenção global:

  • Atenção de Janela Deslizante: Cada token presta atenção apenas aos seus vizinhos imediatos. Isso captura o contexto local e a estrutura sintática, de forma semelhante a como uma Convolutional Neural Network (CNN) processa imagens.
  • Janela Deslizante Dilatada: Para aumentar o receptive field sem aumentar a computação, a janela pode incorporar lacunas, permitindo que o modelo enxergue "mais longe" no texto.
  • Atenção Global: Tokens pré-selecionados específicos (como o token de classificação [CLS]) prestam atenção a todos os outros tokens na sequência, e todos os tokens prestam atenção neles. Isso garante que o modelo retenha uma compreensão de alto nível de toda a entrada para tarefas como text summarization.

Aplicações no Mundo Real#

A capacidade de processar milhares de tokens simultaneamente abre novas possibilidades para o Natural Language Processing (NLP) e áreas afins.

Análise de Documentos Jurídicos e Médicos#

Em setores como direito e saúde, os documentos raramente são curtos. Um contrato jurídico ou o histórico médico de um paciente podem abranger dezenas de páginas. Os Large Language Models (LLMs) tradicionais exigiriam que esses documentos fossem fragmentados, o que poderia perder dependências cruciais entre uma cláusula na página 1 e uma definição na página 30. O Longformer permite realizar Named Entity Recognition (NER) e classificação em todo o documento de uma só vez, garantindo que o contexto global influencie a interpretação de termos específicos.

Resposta a Perguntas (QA) de Formato Longo#

Sistemas padrão de Question Answering frequentemente enfrentam dificuldades quando a resposta a uma pergunta exige sintetizar informações distribuídas ao longo de um artigo extenso. Ao manter o texto completo na memória, os modelos baseados em Longformer podem realizar raciocínio de múltiplos saltos, conectando fatos encontrados em diferentes parágrafos para gerar uma resposta abrangente. Isso é fundamental para sistemas automatizados de suporte técnico e ferramentas de pesquisa acadêmica.

Diferenciando termos-chave#

  • Longformer vs. Transformer: O Transformer padrão utiliza atenção completa $N^2$, tornando-o preciso, mas computacionalmente caro para entradas longas. O Longformer utiliza atenção esparsa $N$, trocando uma quantidade negligenciável de capacidade teórica por ganhos massivos de eficiência, permitindo entradas de 4.096 tokens ou mais.
  • Longformer vs. Transformer-XL: Embora ambos lidem com sequências longas, o Transformer-XL depende de um mecanismo de recorrência (fazendo cache de estados anteriores) para lembrar de segmentos passados. O Longformer processa a sequência longa nativamente de uma só vez, o que simplifica o treinamento paralelo em plataformas como a Ultralytics Platform.
  • Longformer vs. BigBird: Estas são arquiteturas muito semelhantes desenvolvidas na mesma época. Ambas utilizam mecanismos de atenção esparsa para alcançar escalabilidade linear. O BigBird introduz um componente específico de atenção aleatória além das janelas deslizantes.

Conceitos de Implementação#

Embora o Longformer seja uma arquitetura e não uma função específica, entender como preparar dados para modelos de contexto longo é crucial. Em frameworks modernos como o PyTorch, isso geralmente envolve o gerenciamento de embeddings que excedem os limites padrão.

O exemplo a seguir demonstra a criação de um tensor de entrada simulado para um cenário de contexto longo, contrastando-o com o tamanho típico usado em modelos de detecção padrão como o YOLO26.

import torch

# Standard BERT-like models typically cap at 512 tokens
standard_input = torch.randint(0, 30000, (1, 512))

# Longformer architectures can handle significantly larger inputs (e.g., 4096)
# This allows the model to "see" the entire sequence at once.
long_context_input = torch.randint(0, 30000, (1, 4096))

print(f"Standard Input Shape: {standard_input.shape}")
print(f"Long Context Input Shape: {long_context_input.shape}")

# In computer vision, a similar concept applies when processing high-res images
# without downsampling, preserving fine-grained details.

Relevância para a Visão Computacional#

Embora originalmente projetado para texto, os princípios por trás do Longformer influenciaram a Computer Vision. O conceito de limitar a atenção a uma vizinhança local é análogo às operações localizadas em tarefas visuais. Os Vision Transformers (ViT) enfrentam problemas de escala semelhantes com imagens de alta resolução porque o número de pixels (ou patches) pode ser enorme. Técnicas derivadas da atenção esparsa do Longformer são usadas para melhorar a eficiência da image classification e da object detection, ajudando modelos como o YOLO26 a manter altas velocidades ao processar dados visuais detalhados.

Para leituras adicionais sobre as especificidades arquiteturais, o artigo original sobre o Longformer da AllenAI fornece benchmarks detalhados e justificativas teóricas. Além disso, o treinamento eficiente de modelos tão grandes frequentemente se beneficia de técnicas como mixed precision e optimization algorithms avançados.

Explore solutions

Real-time AI that works with your team

IA em robótica

Potencialize máquinas mais inteligentes com modelos Ultralytics YOLO. A IA de visão em robótica impulsiona a navegação autônoma, percepção, rastreamento de objetos e controle em tempo real.
Sabe mais
Real-time AI that works with your team

IA na Logística

Otimize a logística com modelos Ultralytics YOLO. A IA de visão permite a inspeção de pacotes, triagem, rastreamento de veículos e monitoramento de segurança em armazéns em tempo real.
Sabe mais
Real-time AI that works with your team

IA no varejo

Reinvente o varejo com modelos Ultralytics YOLO. A IA de visão impulsiona o rastreamento de inventário, monitoramento de prateleiras, gerenciamento de filas e percepções mais inteligentes sobre o cliente.
Sabe mais
Real-time AI that works with your team

IA na Saúde

Constrói soluções de saúde com modelos Ultralytics YOLO. A visão AI na saúde impulsiona imagens médicas mais rápidas, diagnósticos mais inteligentes e monitorização do paciente.
Sabe mais
Real-time AI that works with your team

IA na Fabricação

Otimize a fabricação com modelos Ultralytics YOLO. A IA de visão impulsiona o controle de qualidade, detecção de defeitos, conformidade com EPI e automação de linhas de montagem.
Sabe mais
Real-time AI that works with your operation

IA no Setor Automóvel

Aplica visão computacional no setor automóvel com modelos Ultralytics YOLO. A visão AI eleva a segurança rodoviária, a assistência ao condutor e a automação de veículos para estradas mais inteligentes.
Sabe mais
Real-time AI tailored to your operation

IA na Agricultura

Leva a visão AI para a agricultura inteligente com os modelos Ultralytics YOLO. Potencia a monitorização de culturas, o seguimento de gado e a agricultura de precisão para colheitas maiores e mais inteligentes.
Sabe mais
Real-time AI that works with your team

IA em robótica

Potencialize máquinas mais inteligentes com modelos Ultralytics YOLO. A IA de visão em robótica impulsiona a navegação autônoma, percepção, rastreamento de objetos e controle em tempo real.
Sabe mais
Real-time AI that works with your team

IA na Logística

Otimize a logística com modelos Ultralytics YOLO. A IA de visão permite a inspeção de pacotes, triagem, rastreamento de veículos e monitoramento de segurança em armazéns em tempo real.
Sabe mais
Real-time AI that works with your team

IA no varejo

Reinvente o varejo com modelos Ultralytics YOLO. A IA de visão impulsiona o rastreamento de inventário, monitoramento de prateleiras, gerenciamento de filas e percepções mais inteligentes sobre o cliente.
Sabe mais
Real-time AI that works with your team

IA na Saúde

Constrói soluções de saúde com modelos Ultralytics YOLO. A visão AI na saúde impulsiona imagens médicas mais rápidas, diagnósticos mais inteligentes e monitorização do paciente.
Sabe mais
Real-time AI that works with your team

IA na Fabricação

Otimize a fabricação com modelos Ultralytics YOLO. A IA de visão impulsiona o controle de qualidade, detecção de defeitos, conformidade com EPI e automação de linhas de montagem.
Sabe mais
Real-time AI that works with your operation

IA no Setor Automóvel

Aplica visão computacional no setor automóvel com modelos Ultralytics YOLO. A visão AI eleva a segurança rodoviária, a assistência ao condutor e a automação de veículos para estradas mais inteligentes.
Sabe mais
Real-time AI tailored to your operation

IA na Agricultura

Leva a visão AI para a agricultura inteligente com os modelos Ultralytics YOLO. Potencia a monitorização de culturas, o seguimento de gado e a agricultura de precisão para colheitas maiores e mais inteligentes.
Sabe mais
Real-time AI that works with your team

IA em robótica

Potencialize máquinas mais inteligentes com modelos Ultralytics YOLO. A IA de visão em robótica impulsiona a navegação autônoma, percepção, rastreamento de objetos e controle em tempo real.
Sabe mais
Real-time AI that works with your team

IA na Logística

Otimize a logística com modelos Ultralytics YOLO. A IA de visão permite a inspeção de pacotes, triagem, rastreamento de veículos e monitoramento de segurança em armazéns em tempo real.
Sabe mais
Real-time AI that works with your team

IA no varejo

Reinvente o varejo com modelos Ultralytics YOLO. A IA de visão impulsiona o rastreamento de inventário, monitoramento de prateleiras, gerenciamento de filas e percepções mais inteligentes sobre o cliente.
Sabe mais
Real-time AI that works with your team

IA na Saúde

Constrói soluções de saúde com modelos Ultralytics YOLO. A visão AI na saúde impulsiona imagens médicas mais rápidas, diagnósticos mais inteligentes e monitorização do paciente.
Sabe mais
Real-time AI that works with your team

IA na Fabricação

Otimize a fabricação com modelos Ultralytics YOLO. A IA de visão impulsiona o controle de qualidade, detecção de defeitos, conformidade com EPI e automação de linhas de montagem.
Sabe mais
Real-time AI that works with your operation

IA no Setor Automóvel

Aplica visão computacional no setor automóvel com modelos Ultralytics YOLO. A visão AI eleva a segurança rodoviária, a assistência ao condutor e a automação de veículos para estradas mais inteligentes.
Sabe mais
Real-time AI tailored to your operation

IA na Agricultura

Leva a visão AI para a agricultura inteligente com os modelos Ultralytics YOLO. Potencia a monitorização de culturas, o seguimento de gado e a agricultura de precisão para colheitas maiores e mais inteligentes.
Sabe mais

Vamos construir o futuro da IA juntos!

Começa a tua jornada com o futuro da aprendizagem automática