Ultralytics YOLO27:
Voltar ao Glossário da Ultralytics

Longformer

Explore a arquitetura Longformer para processar sequências longas de dados de forma eficiente. Saiba como a atenção esparsa ultrapassa os limites de memória em NLP e Visão Computacional.

O Longformer é um tipo especializado de arquitetura de Aprendizagem Profunda concebido para processar sequências longas de dados de forma eficiente, superando as limitações dos modelos tradicionais. Apresentado originalmente para resolver as limitações dos Transformers padrão, que normalmente têm dificuldades com sequências superiores a 512 tokens devido às restrições de memória, o Longformer utiliza um mecanismo de atenção modificado. Ao reduzir a complexidade computacional de quadrática para linear, esta arquitetura permite que os sistemas de IA analisem documentos inteiros, transcrições extensas ou sequências genéticas complexas numa única passagem, sem truncar a entrada.

O problema do gargalo da atenção#

Para compreender a importância do Longformer, é essencial analisar a limitação de predecessores como o BERT e os primeiros modelos GPT-3. Os Transformers padrão utilizam uma operação de "atenção própria", na qual cada token (palavra ou parte de uma palavra) presta atenção a todos os outros tokens da sequência. Isto cria um custo computacional quadrático; duplicar o comprimento da sequência quadruplica a memória necessária na GPU. Consequentemente, a maioria dos modelos padrão impõe um limite estrito ao tamanho da entrada, obrigando frequentemente os cientistas de dados a dividir os documentos em segmentos mais pequenos e desconectados, o que resulta numa perda de contexto.

O Longformer resolve este problema ao introduzir a Atenção Esparsa. Em vez de uma ligação completa entre todos os tokens, utiliza uma combinação de atenção local em janelas e atenção global:

  • Atenção em Janela Deslizante: cada token presta atenção apenas aos seus vizinhos imediatos. Isto capta o contexto local e a estrutura sintática, de forma semelhante à maneira como uma Rede Neural Convolucional (CNN) processa imagens.
  • Janela Deslizante Dilatada: para aumentar o campo recetivo sem aumentar a computação, a janela pode incorporar intervalos, permitindo que o modelo veja mais longe no texto.
  • Atenção Global: tokens específicos preselecionados (como o token de classificação [CLS]) prestam atenção a todos os outros tokens da sequência, e todos os tokens prestam atenção a eles. Isto garante que o modelo retenha uma compreensão de alto nível de toda a entrada para tarefas como o resumo de texto.

Aplicações no mundo real#

A capacidade de processar milhares de tokens em simultâneo abre novas possibilidades para o Processamento de Linguagem Natural (NLP) e muito mais.

1. Análise de Documentos Jurídicos e Médicos#

Em setores como o jurídico e o da saúde, os documentos raramente são curtos. Um contrato jurídico ou o historial médico de um paciente pode abranger dezenas de páginas. Os Modelos de Linguagem de Grande Escala (LLMs) tradicionais exigiriam que esses documentos fossem fragmentados, podendo perder dependências cruciais entre uma cláusula na página 1 e uma definição na página 30. O Longformer permite executar Reconhecimento de Entidades Nomeadas (NER) e classificação em todo o documento de uma só vez, garantindo que o contexto global influencie a interpretação de termos específicos.

2. Resposta a Perguntas de Texto Longo (QA)#

Os sistemas padrão de Resposta a Perguntas têm frequentemente dificuldades quando a resposta a uma pergunta exige a síntese de informações distribuídas por um artigo extenso. Ao manter o texto completo na memória, os modelos baseados no Longformer podem realizar raciocínio em vários saltos, ligando factos encontrados em diferentes parágrafos para gerar uma resposta abrangente. Isto é essencial para sistemas automatizados de suporte técnico e ferramentas de investigação académica.

Distinção entre Termos Fundamentais#

  • Longformer vs. Transformer: o Transformer padrão utiliza atenção completa $N^2$, o que o torna preciso, mas computacionalmente dispendioso para entradas longas. O Longformer utiliza atenção esparsa $N$, trocando uma quantidade insignificante de capacidade teórica por enormes ganhos de eficiência e permitindo entradas de 4.096 tokens ou mais.
  • Longformer vs. Transformer-XL: embora ambos processem sequências longas, o Transformer-XL depende de um mecanismo de recorrência (armazenando em cache estados anteriores) para se lembrar de segmentos passados. O Longformer processa a sequência longa nativamente de uma só vez, o que simplifica o treino paralelo em plataformas como a Ultralytics Platform.
  • Longformer vs. BigBird: estas são arquiteturas muito semelhantes, desenvolvidas aproximadamente na mesma altura. Ambas utilizam mecanismos de atenção esparsa para obter escalabilidade linear. O BigBird introduz um componente específico de atenção aleatória, além das janelas deslizantes.

Conceitos de Implementação#

Embora o Longformer seja uma arquitetura e não uma função específica, compreender como preparar dados para modelos com contexto longo é crucial. Em frameworks modernos como o PyTorch, isto envolve frequentemente gerir embeddings que excedem os limites padrão.

O exemplo seguinte demonstra a criação de um tensor de entrada simulado para um cenário de contexto longo, contrastando-o com o tamanho típico utilizado em modelos de deteção padrão como o YOLO26.

import torch

# Standard BERT-like models typically cap at 512 tokens
standard_input = torch.randint(0, 30000, (1, 512))

# Longformer architectures can handle significantly larger inputs (e.g., 4096)
# This allows the model to "see" the entire sequence at once.
long_context_input = torch.randint(0, 30000, (1, 4096))

print(f"Standard Input Shape: {standard_input.shape}")
print(f"Long Context Input Shape: {long_context_input.shape}")

# In computer vision, a similar concept applies when processing high-res images
# without downsampling, preserving fine-grained details.

Relevância para a Visão Computacional#

Embora tenha sido originalmente concebido para texto, os princípios subjacentes ao Longformer influenciaram a Visão Computacional. O conceito de limitar a atenção a uma vizinhança local é análogo às operações localizadas em tarefas visuais. Os Vision Transformers (ViT) enfrentam problemas de escalabilidade semelhantes com imagens de alta resolução, porque o número de píxeis (ou patches) pode ser enorme. Técnicas derivadas da atenção esparsa do Longformer são utilizadas para melhorar a eficiência da classificação de imagens e da deteção de objetos, ajudando modelos como o YOLO26 a manter velocidades elevadas ao processar dados visuais detalhados.

Para obter mais informações sobre os detalhes arquiteturais, o artigo original sobre o Longformer da AllenAI apresenta benchmarks aprofundados e justificações teóricas. Além disso, o treino eficiente de modelos tão grandes beneficia frequentemente de técnicas como a precisão mista e algoritmos de otimização avançados.

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática