YOLO Vision 2026:
Voltar ao Glossário da Ultralytics

Diffusion Language Models

Aprende como os modelos de linguagem por difusão geram e editam texto através de desruído iterativo, com informações sobre Transformers, aplicações, benefícios e limitações.

Os modelos de linguagem de difusão são modelos generativos que produzem ou editam texto por meio de remoção iterativa de ruído, em vez de gerar cada token estritamente da esquerda para a direita. Eles começam com uma sequência corrompida — geralmente contendo tokens mascarados, substituídos ou incertos — e refinam repetidamente várias posições até que o texto se torne coerente. Essa abordagem combina ideias de modelagem de linguagem e modelos de difusão, oferecendo uma alternativa à geração convencional do próximo token.

Como funcionam os modelos de linguagem de difusão#

Primeiro, o texto é dividido por meio da tokenização em palavras, subpalavras, caracteres ou outras unidades discretas. Durante o treinamento, um processo progressivo de corrupção remove gradualmente informações das sequências de tokens. Dependendo da implementação, os tokens podem ser substituídos por símbolos de máscara, alternativas amostradas ou representações contínuas ruidosas chamadas embeddings.

O modelo aprende o processo inverso: prever versões mais limpas das sequências corrompidas. No momento da inferência, ele começa com um bloco fortemente mascarado ou ruidoso e executa várias etapas de refinamento. As primeiras etapas estabelecem o significado e a estrutura gerais, enquanto as etapas posteriores corrigem o vocabulário, a gramática, a formatação e a consistência local.

Muitos modelos de linguagem de difusão usam um Transformer para processar a sequência. Os Transformers são adequados para essa tarefa porque o mecanismo de atenção deles pode relacionar cada token ao contexto ao redor. A documentação do Transformer do PyTorch apresenta uma visão geral útil dessa arquitetura subjacente.

Ao contrário de um sistema fixo de preenchimento de lacunas, a geração por difusão pode reconsiderar repetidamente as previsões. Um token selecionado durante uma etapa não é necessariamente permanente; iterações posteriores podem revisá-lo quando o restante da sequência oferece um contexto melhor. A visão geral da Google DeepMind sobre difusão de texto ilustra esse padrão de geração iterativa em nível de bloco.

Modelos de difusão vs. conceitos relacionados#

Vários termos intimamente relacionados descrevem objetivos ou arquiteturas diferentes:

  • Modelos de linguagem grandes autorregressivos geram tokens em sequência, com cada previsão condicionada à saída anterior. Esse processo causal é demonstrado no tutorial de geração de texto autorregressiva do TensorFlow. Em vez disso, os modelos de difusão podem atualizar várias posições durante cada etapa de refinamento.
  • Modelos de linguagem mascarados preveem tokens ocultos deliberadamente usando o contexto dos dois lados. O exemplo de modelagem de linguagem mascarada do Keras demonstra esse objetivo de treinamento. Os modelos de linguagem de difusão ampliam essa ideia para um processo completo de geração com vários níveis de corrupção e iterações de remoção de ruído.
  • Stable Diffusion é um sistema de geração de imagens, não um modelo de linguagem grande. Os serviços de imagens Stable Diffusion da Stability AI geram e editam conteúdo visual, enquanto os modelos de linguagem de difusão operam sobre tokens de texto ou suas representações.
  • Transformers de difusão descrevem o uso de Transformers em sistemas de difusão, normalmente para geração de imagens ou vídeos. Um modelo de linguagem de difusão é definido pelo seu objetivo de geração de texto, e não apenas pela arquitetura da sua rede neural.

Aplicações no mundo real#

Uma aplicação concreta é a edição de documentos e código. Em vez de anexar texto após um cursor, um modelo de linguagem de difusão pode refinar um rascunho inteiro ou um trecho selecionado. Por exemplo, ele pode reconstruir uma função ausente enquanto revisa nomes de variáveis, importações e comentários em todo o bloco. A capacidade de usar o contexto anterior e posterior é valiosa quando correções em um local afetam outro.

Uma segunda aplicação é a análise multimodal. Um sistema de visão pode extrair informações factuais de uma imagem, após o que um modelo de linguagem de difusão pode compor iterativamente um relatório, uma legenda ou uma resposta fundamentada nessas observações. Por exemplo, a deteção de objetos pode identificar veículos e pessoas em uma cena de trânsito antes que o componente de linguagem redija um resumo do incidente.

O fluxo de trabalho a seguir usa o Ultralytics YOLO26 para criar contexto visual estruturado para a geração de linguagem posterior:

from ultralytics import YOLO

# Run object detection on a sample image
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]

# Convert detections into compact language-model context
detections = result.summary()
object_names = sorted({item["name"] for item in detections})

visual_context = ", ".join(object_names)
print(visual_context)

O fluxo de trabalho de previsão do YOLO retorna saídas estruturadas, enquanto o método Results.summary() converte as deteções em dicionários mais fáceis de passar para um pipeline de linguagem. Essa separação permite que o modelo de visão forneça observações fundamentadas, enquanto o modelo de linguagem gerencia a composição iterativa.

Benefícios, limitações e orientações práticas#

Os modelos de linguagem de difusão podem propor vários tokens em paralelo, revisar escolhas anteriores e oferecer suporte natural ao preenchimento interno ou à edição condicionada. No entanto, a previsão paralela não garante menor latência de ponta a ponta: a geração ainda exige várias etapas de remoção de ruído, e a velocidade depende do comprimento da sequência, do tamanho do modelo, do hardware e da estratégia de amostragem.

O texto também é discreto, o que torna a corrupção gradual menos natural do que a adição de ruído a pixels contínuos de uma imagem. Sistemas mal configurados podem produzir repetições, omitir detalhes necessários, alterar texto correto sem necessidade ou ter dificuldade para determinar o comprimento da saída.

As equipes devem avaliar a precisão da tarefa, a factualidade, a estabilidade da edição, a latência e o uso de recursos em prompts representativos. As orientações do Google Cloud sobre avaliação de IA generativa recomendam combinar métricas automatizadas com avaliação humana, pois a qualidade da linguagem depende do contexto. Implantações de alto impacto também devem seguir um processo estruturado, como o NIST AI Risk Management Framework.

Para aplicações visuais, a Ultralytics Platform oferece suporte à anotação de conjuntos de dados, ao treinamento de modelos, à implantação e ao monitoramento, ajudando as equipes a criar o componente de perceção capaz de fundamentar fluxos de trabalho de linguagem posteriores baseados em difusão.

Explore solutions

Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática