Ultralytics YOLO27:
IA para visão

O que são modelos de difusão? Um guia rápido e abrangente

Acompanha-nos enquanto exploramos como os modelos de difusão podem ser utilizados para criar conteúdo realista e redefinir áreas como o design, a música e o cinema através de várias aplicações.

ABAbirami Vina9 min read
Um guia para modelos de difusão em IA generativa

A utilização de ferramentas de IA generativa, como o Midjourney e o Sora, para criar conteúdo está a tornar-se cada vez mais comum, e há um interesse crescente em compreender o funcionamento interno dessas ferramentas. De facto, um estudo recente mostra que 94% das pessoas estão dispostas a aprender novas competências para trabalhar com IA generativa. Compreender como funcionam os modelos de IA generativa pode ajudar-te a utilizar estas ferramentas de forma mais eficaz e a tirar o máximo partido delas.

No centro de ferramentas como o Midjourney e o Sora estão modelos de difusão avançados — modelos de IA generativa capazes de criar imagens, vídeos, texto e áudio para várias aplicações. Por exemplo, os modelos de difusão são uma excelente opção para produzir vídeos curtos de marketing para plataformas de redes sociais como o TikTok e o YouTube Shorts. Neste artigo, vamos explorar como funcionam os modelos de difusão e onde podem ser utilizados. Vamos começar!

A inspiração por detrás dos modelos de difusão avançados#

Em física, a difusão é o processo através do qual as moléculas se dispersam de zonas de maior concentração para zonas de menor concentração. O conceito de difusão está intimamente relacionado com o movimento browniano, no qual as partículas se movem aleatoriamente ao colidir com moléculas num fluido e se dispersam gradualmente ao longo do tempo.

Estes conceitos inspiraram o desenvolvimento de modelos de difusão em IA generativa. Os modelos de difusão funcionam adicionando gradualmente ruído aos dados e aprendendo depois a inverter esse processo para gerar dados novos e de alta qualidade, como texto, imagens ou som. É semelhante à ideia de difusão inversa em física. Teoricamente, a difusão pode ser seguida para trás, de modo a devolver as partículas ao seu estado original. Da mesma forma, os modelos de difusão aprendem a inverter o ruído adicionado para criar dados novos e realistas a partir de entradas ruidosas.

Um exemplo da utilização de modelos de difusão para geração de imagens

A analisar o funcionamento interno dos modelos de difusão#

De forma geral, a arquitetura de um modelo de difusão envolve duas etapas principais. Primeiro, o modelo aprende a adicionar ruído gradualmente ao conjunto de dados. Depois, é treinado para inverter esse processo e devolver os dados ao seu estado original. Vamos analisar mais detalhadamente como isto funciona.

Pré-processamento de dados#

Antes de nos debruçarmos sobre o núcleo de um modelo de difusão, é importante lembrar que quaisquer dados utilizados para treinar o modelo devem ser pré-processados. Por exemplo, se estiveres a treinar um modelo de difusão para gerar imagens, o conjunto de dados de treino de imagens precisa de ser limpo primeiro. O pré-processamento de dados de imagem pode envolver a remoção de valores atípicos que possam afetar os resultados, a normalização dos valores dos píxeis para que todas as imagens estejam à mesma escala e a utilização de aumento de dados para introduzir mais variedade. As etapas de pré-processamento de dados ajudam a garantir a qualidade dos dados de treino, e isto aplica-se não só aos modelos de difusão, mas a qualquer modelo de IA.

Exemplos de aumento de dados de imagem

Fig. 2 Exemplos de aumento de dados de imagem.

Processo de difusão direta#

Após o pré-processamento dos dados, a etapa seguinte é o processo de difusão direta. Vamos focar-nos no treino de um modelo de difusão para gerar imagens. O processo começa com a amostragem de uma distribuição simples, como uma distribuição gaussiana. Por outras palavras, é selecionado algum ruído aleatório. Como mostrado na imagem abaixo, o modelo transforma gradualmente a imagem através de uma série de etapas. A imagem começa nítida e torna-se cada vez mais ruidosa à medida que avança por cada etapa, acabando por se transformar em ruído quase completo.

Processo de difusão direta

Fig. 3. Processo de difusão direta.

Cada etapa baseia-se na anterior, e o ruído é adicionado de forma controlada e incremental através de uma cadeia de Markov. Uma cadeia de Markov é um modelo matemático no qual a probabilidade do estado seguinte depende apenas do estado atual. É utilizada para prever resultados futuros com base nas condições presentes. À medida que cada etapa adiciona complexidade aos dados, podemos captar os padrões e detalhes mais intrincados da distribuição dos dados da imagem original. A adição de ruído gaussiano também gera amostras diversificadas e realistas à medida que a difusão se desenrola.

Processo de difusão inversa#

O processo de difusão inversa começa quando o processo de difusão direta transforma uma amostra num estado ruidoso e complexo. Gradualmente, mapeia a amostra ruidosa de volta ao seu estado original através de uma série de transformações inversas. As etapas que revertem o processo de adição de ruído são orientadas por uma cadeia de Markov inversa.

Processo de difusão inversa

Fig. 4. Processo de difusão inversa.

Durante o processo inverso, os modelos de difusão aprendem a gerar dados novos começando com uma amostra de ruído aleatório e refinando-a gradualmente até obter uma saída nítida e detalhada. Os dados gerados acabam por se assemelhar bastante ao conjunto de dados original. Esta capacidade torna os modelos de difusão excelentes para tarefas como síntese de imagens, conclusão de dados e redução de ruído. Na secção seguinte, vamos explorar mais aplicações dos modelos de difusão.

Aplicações dos modelos de difusão#

O processo de difusão passo a passo permite que um modelo de difusão gere de forma eficiente distribuições de dados complexas sem ser sobrecarregado pela elevada dimensionalidade dos dados. Vamos analisar algumas aplicações em que os modelos de difusão se destacam.

Design gráfico#

Os modelos de difusão podem ser utilizados para gerar rapidamente conteúdo visual gráfico. Os designers e artistas humanos podem fornecer esboços, layouts ou até algumas ideias simples e rudimentares do que pretendem, e os modelos podem dar vida a essas ideias. Isto pode acelerar todo o processo de design, oferecer uma vasta gama de novas possibilidades desde o conceito inicial até ao produto final e poupar muito tempo valioso aos designers humanos.

Designs gráficos criados por modelos de difusão

Fig. 5. Designs gráficos criados por modelos de difusão.

Design de música e som#

Os modelos de difusão também podem ser adaptados para gerar paisagens sonoras muito originais ou notas musicais. Isto oferece novas formas de os músicos e artistas visualizarem e criarem experiências auditivas. Eis alguns casos de utilização dos modelos de difusão no domínio da criação de som e música:

  • Transferência de voz: Os modelos de difusão podem ser utilizados para transformar um som noutro, como converter uma amostra de bumbo numa sonoridade de caixa para criar combinações sonoras únicas.
  • Variabilidade e humanização do som: A difusão de áudio pode introduzir pequenas variações nos sons para adicionar um elemento humano ao áudio digital, simulando atuações de instrumentos ao vivo.
  • Ajustes de design sonoro: Estes modelos podem ser utilizados para alterar subtilmente um som (como melhorar uma amostra do bater de uma porta) e modificar as suas características a um nível mais profundo do que com EQ ou filtragem tradicionais.
  • Geração de melodias: Também podem ajudar a gerar novas melodias e inspirar artistas de forma semelhante à exploração de bibliotecas de amostras.

Uma visualização da difusão de áudio

Fig. 6 Uma visualização da difusão de áudio.

Cinema e animação#

Outro caso de utilização interessante dos modelos de difusão é a criação de excertos de filmes e animações. Podem ser utilizados para gerar personagens, fundos realistas e até elementos dinâmicos dentro das cenas. A utilização de modelos de difusão pode ser uma grande vantagem para as produtoras. Simplifica o fluxo de trabalho geral e abre espaço para mais experimentação e criatividade na narrativa visual. Alguns excertos criados com estes modelos são comparáveis a excertos reais de animações ou filmes. É até possível utilizar estes modelos para criar filmes completos.

Uma cena da curta-metragem Seasons criada com modelos de difusão

Fig. 7. Uma cena da curta-metragem Seasons, criada com modelos de difusão.

Modelos de difusão populares#

Agora que já aprendemos sobre algumas das aplicações dos modelos de difusão, vamos conhecer alguns modelos de difusão populares que podes experimentar.

  • Stable Diffusion: Criado pela Stability AI, o Stable Diffusion é um modelo eficiente conhecido por converter prompts de texto em imagens realistas. Tem uma sólida reputação na geração de imagens de alta qualidade. Também pode ser modificado para cinema e animação.
  • DALL-E 3: O DALL-E 3 é a versão mais recente do modelo de geração de imagens da OpenAI. Está integrado no ChatGPT e oferece muitas melhorias na qualidade da geração de imagens em relação à versão anterior, o DALL-E 2.
  • Sora: O Sora é o modelo de texto para vídeo da OpenAI, capaz de gerar vídeos 1080p altamente realistas com duração até um minuto. Alguns dos vídeos criados com o Sora podem ser facilmente confundidos com imagens reais.
  • Imagen: Desenvolvido pela Google, o Imagen é um modelo de difusão de texto para imagem reconhecido pelo seu fotorrealismo e pela sua compreensão avançada da linguagem.

Desafios e limitações relacionados com os modelos de difusão#

Embora os modelos de difusão ofereçam benefícios em muitos setores, também devemos ter em conta alguns dos desafios que os acompanham. Um dos desafios é o facto de o processo de treino exigir muitos recursos. Embora os avanços na aceleração de hardware possam ajudar, esta pode ser dispendiosa. Outro problema é a capacidade limitada dos modelos de difusão para generalizar para dados que não conhecem. A sua adaptação a domínios específicos pode exigir muito ajuste fino ou um novo treino.

A integração destes modelos em tarefas do mundo real traz o seu próprio conjunto de desafios. É essencial que aquilo que a IA gera corresponda efetivamente às intenções humanas. Existem também preocupações éticas, como o risco de estes modelos absorverem e refletirem preconceitos presentes nos dados utilizados no seu treino. Além disso, gerir as expectativas dos utilizadores e aperfeiçoar continuamente os modelos com base no feedback pode tornar-se um esforço permanente para garantir que estas ferramentas são tão eficazes e fiáveis quanto possível.

O futuro dos modelos de difusão#

Os modelos de difusão são um conceito fascinante de IA generativa que ajuda a criar imagens, vídeos e sons de alta qualidade em muitos domínios diferentes. Embora possam apresentar alguns desafios de implementação, como exigências computacionais e preocupações éticas, a comunidade de IA trabalha constantemente para melhorar a sua eficiência e impacto. Os modelos de difusão estão preparados para transformar setores como o cinema, a produção musical e a criação de conteúdo digital à medida que continuam a evoluir.

Vamos aprender e explorar em conjunto! Consulta o nosso repositório no GitHub para conhecer os nossos contributos para a IA. Descobre como estamos a redefinir setores como a indústria e os cuidados de saúde com tecnologia de IA de ponta.

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática