Ultralytics YOLO27:
Voltar ao Glossário da Ultralytics

Sequence-to-Sequence Models

Saiba como os modelos de sequência para sequência (Seq2Seq) potenciam a tradução e o NLP. Explore arquiteturas de codificador-descodificador, Transformers e a integração com o Ultralytics YOLO26.

Os modelos sequência a sequência (Seq2Seq) são uma classe poderosa de arquiteturas de aprendizagem automática concebidas para converter sequências de um domínio em sequências de outro. Ao contrário das tarefas padrão de classificação de imagens, em que os tamanhos da entrada e da saída são fixos, os modelos Seq2Seq destacam-se no processamento de entradas e saídas de comprimentos variáveis. Esta flexibilidade torna-os a base de muitas aplicações modernas de processamento de linguagem natural (NLP), como tradução e sumarização, nas quais o comprimento da frase de entrada não determina necessariamente o comprimento da frase de saída.

Arquitetura principal e funcionalidade#

A estrutura fundamental de um modelo Seq2Seq baseia-se na arquitetura codificador-descodificador. Esta arquitetura divide o modelo em dois componentes principais que trabalham em conjunto para processar dados sequenciais.

  • O codificador: Este componente processa a sequência de entrada (por exemplo, uma frase em inglês ou uma sequência de frames de áudio), um elemento de cada vez. Comprime a informação num vetor de contexto de comprimento fixo, também conhecido como estado oculto. Nas arquiteturas tradicionais, o codificador é frequentemente construído com Redes Neuronais Recorrentes (RNN) ou redes de Memória de Longo e Curto Prazo (LSTM), concebidas para reter informação ao longo dos passos temporais.
  • O descodificador: Depois de a entrada ser codificada, o descodificador recebe o vetor de contexto e prevê a sequência de saída (por exemplo, a frase correspondente em francês) passo a passo. Utiliza a previsão anterior para influenciar a seguinte, garantindo continuidade gramatical e contextual.

Embora as primeiras versões dependessem fortemente de RNN, os modelos Seq2Seq modernos utilizam predominantemente a arquitetura Transformer. Os Transformers utilizam o mecanismo de atenção, que permite ao modelo "prestar atenção" a partes específicas da sequência de entrada, independentemente da distância a que se encontram do passo atual, melhorando significativamente o desempenho em sequências longas, conforme detalhado no artigo seminal Attention Is All You Need.

Aplicações no mundo real#

A versatilidade dos modelos Seq2Seq permite-lhes colmatar a distância entre a análise de texto e a visão computacional, possibilitando interações multimodais complexas.

  • Tradução automática: Talvez a aplicação mais conhecida, os modelos Seq2Seq potenciam ferramentas como o Google Translate. O modelo recebe uma frase numa língua de origem e produz uma frase numa língua de destino, lidando fluentemente com diferenças de gramática e estrutura frásica.
  • Sumarização de texto: Estes modelos podem receber documentos ou artigos longos e gerar resumos concisos. Ao compreender o significado central do texto de entrada, o descodificador produz uma sequência mais curta que conserva as informações essenciais, uma técnica fundamental para a agregação automatizada de notícias.
  • Geração de legendas para imagens: Ao combinar visão e linguagem, um modelo Seq2Seq pode descrever o conteúdo de uma imagem. Uma Rede Neural Convolucional (CNN) atua como codificador para extrair características visuais, enquanto uma RNN atua como descodificador para gerar uma frase descritiva. Este é um exemplo notável de um modelo multimodal.
  • Reconhecimento de fala: Nestes sistemas, a entrada é uma sequência de frames de sinais de áudio e a saída é uma sequência de caracteres ou palavras de texto. Esta tecnologia é a base de assistentes virtuais como a Siri e a Alexa.

Exemplo de código: bloco de construção básico#

Embora as frameworks de alto nível abstraiam grande parte da complexidade, é útil compreender o mecanismo subjacente. O código seguinte demonstra uma camada LSTM básica em PyTorch, que frequentemente atua como a unidade recorrente no codificador ou descodificador de um modelo Seq2Seq tradicional.

import torch
import torch.nn as nn

# Initialize an LSTM layer (common in Seq2Seq encoders)
# input_size: number of features per time step (e.g., word embedding size)
# hidden_size: size of the context vector/hidden state
lstm_layer = nn.LSTM(input_size=10, hidden_size=20, batch_first=True)

# Create a dummy input sequence: Batch size 3, Sequence length 5, Features 10
input_seq = torch.randn(3, 5, 10)

# Pass the sequence through the LSTM
# output contains features for each time step; hn is the final hidden state
output, (hn, cn) = lstm_layer(input_seq)

print(f"Output shape: {output.shape}")  # Shape: [3, 5, 20]
print(f"Final Hidden State shape: {hn.shape}")  # Shape: [1, 3, 20]

Comparação com conceitos relacionados#

É importante distinguir os modelos Seq2Seq de outras arquiteturas para compreender a sua utilidade específica.

  • Vs. classificação padrão: Os classificadores padrão, como os utilizados na classificação de imagens básica, mapeiam uma única entrada (como uma imagem) para uma única etiqueta de classe. Em contrapartida, os modelos Seq2Seq mapeiam sequências para sequências, permitindo comprimentos de saída variáveis.
  • Vs. deteção de objetos: Modelos como o Ultralytics YOLO26 concentram-se na deteção espacial dentro de um único frame, identificando objetos e as suas localizações. Enquanto o YOLO processa imagens estruturalmente, os modelos Seq2Seq processam dados temporalmente. No entanto, os domínios sobrepõem-se em tarefas como o rastreio de objetos, nas quais a identificação das trajetórias dos objetos ao longo dos frames de vídeo envolve a análise de dados sequenciais.
  • Vs. Transformers: A arquitetura Transformer é a evolução moderna dos modelos Seq2Seq. Enquanto os modelos Seq2Seq originais dependiam fortemente de RNN e de Unidades Recorrentes com Portas (GRU), os Transformers utilizam a autoatenção para processar sequências em paralelo, oferecendo melhorias significativas de velocidade e precisão.

Importância no ecossistema de IA#

Os modelos Seq2Seq mudaram fundamentalmente a forma como as máquinas interagem com a linguagem humana e os dados temporais. A sua capacidade de processar dados dependentes de sequências permitiu a criação de chatbots sofisticados, tradutores automáticos e ferramentas de geração de código. Para os programadores que trabalham com os grandes conjuntos de dados necessários para treinar estes modelos, a utilização da Ultralytics Platform pode simplificar os fluxos de trabalho de gestão de dados e implementação de modelos. À medida que a investigação avança na área da IA generativa, os princípios da modelação de sequências continuam a ser centrais para o desenvolvimento de Grandes Modelos de Linguagem (LLMs) e de sistemas avançados de compreensão de vídeo.

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática