Gerar vídeos com o Veo da Google DeepMind
Saiba mais sobre o Veo, o mais recente modelo de geração de vídeo da Google DeepMind, que pode criar facilmente vídeos 1080P de alta qualidade a partir de prompts de texto, imagem e vídeo.

Durante a apresentação do Google I/O de 2024, em 14 de maio, foram partilhadas as atualizações mais recentes da DeepMind, a sua divisão de IA. Um dos avanços mais entusiasmantes apresentados foi o seu mais recente modelo generativo de vídeo, o Veo. O Veo consegue criar vídeos 1080P de alta qualidade com base em prompts de texto, imagem e vídeo. Também permite editar vídeos gerados com prompts subsequentes. O Veo leva a IA generativa para o nível seguinte. Vamos analisar mais de perto as funcionalidades que o Veo oferece.
Compreender as capacidades do Veo#
O Veo é um modelo generativo de vídeo que utiliza uma compreensão profunda da linguagem e dos elementos visuais para criar vídeos que correspondem estreitamente à visão criativa do utilizador. Consegue captar com precisão o tom e os detalhes de prompts mais longos, tornando-se uma ferramenta poderosa para criadores que querem transformar as suas ideias em conteúdos de vídeo precisos.
O utilizador pode ter um controlo criativo inovador sobre o vídeo gerado, porque o Veo compreende técnicas cinematográficas como "time-lapse" e "planos aéreos de uma paisagem". Este controlo criativo permite aos utilizadores criar vídeos em que pessoas, animais e objetos se movem naturalmente. Os vídeos gerados pelo Veo são envolventes e visualmente atraentes, porque é difícil perceber que foram gerados por um modelo de IA.
O Veo vai além da simples criação de vídeos a partir de prompts. Se forneceres um vídeo gerado anteriormente e um pedido de edição específico, como inserir caiaques numa vista aérea de uma linha costeira, o Veo consegue integrar essa alteração no vídeo original de forma harmoniosa, produzindo uma versão atualizada.

Fig. 1. Um exemplo de edição de vídeo com o Veo.
Eis mais algumas funcionalidades que o Veo oferece:
- Edição com máscara: o Veo pode ajudar-te a editar áreas definidas de um vídeo.
- Criação de vídeos inspirados em imagens: utilizando uma imagem e um prompt de texto, o Veo pode gerar vídeos que refletem o estilo da imagem e seguem as instruções do prompt.
- Clips de vídeo prolongados: o Veo pode criar e prolongar clips de vídeo até 60 segundos ou mais, a partir de um único prompt ou de uma sequência de prompts que, em conjunto, contam uma história.
Vídeos impressionantes gerados pelo Veo#
Vamos analisar alguns dos vídeos que o Veo gerou e perceber por que são tão impressionantes.
Gerar um vídeo em time-lapse a partir de um prompt de texto curto é um desafio. Normalmente, o prompt de texto curto não consegue transmitir com precisão as alterações e os movimentos na cena do time-lapse. Por isso, é surpreendente que o Veo consiga compreender o que esperar de um time-lapse sem entrar em detalhes.

Fig. 2. Um frame do vídeo em time-lapse gerado pelo Veo.
Da mesma forma, gerar vídeos com física precisa não é fácil. O modelo de IA precisa de compreender e simular leis da física, como a gravidade, o momento e as colisões, para que os movimentos e as interações pareçam realistas. É impressionante que o Veo consiga modelar estas dinâmicas com precisão sem orientação detalhada dos prompts de texto.

Fig. 3. Um frame de um vídeo gerado com o Veo capta com precisão a física do movimento das medusas.
Até agora, só tínhamos visto vídeos mais curtos gerados por IA devido às limitações computacionais e à complexidade de manter a coerência em sequências mais longas. Na apresentação do Google I/O de 2024, foi demonstrada a capacidade impressionante do Veo de criar vídeos mais longos e complexos.

Fig. 4. Frames do vídeo mais longo do Veo apresentado na apresentação do Google I/O de 2024.
Como funciona o Veo?#
Tal como muitos outros modelos de IA, o Veo apoia-se nos avanços de modelos anteriores. Baseia-se em avanços anteriores, como a Rede Generativa de Consultas (GQN), DVD-GAN, Imagen-Video, Phenaki, WALT, VideoPoet e Lumiere, bem como na arquitetura Transformer proprietária da Google e no Gemini. Além disso, para melhorar a capacidade do Veo de interpretar prompts com precisão, as legendas de cada vídeo no seu conjunto de dados de treino eram mais detalhadas.
Com base no fluxo de trabalho geral do modelo partilhado pela Google, eis como funciona o Veo:
- Prompts de entrada: forneces um prompt de texto e, opcionalmente, um prompt de imagem.
- Codificação: o prompt de texto é processado por um codificador UL2, e o prompt de imagem é processado por um codificador de imagem.
- Prompt incorporado: as saídas dos codificadores de texto e de imagem são combinadas para formar um único prompt incorporado.
- Modelo de difusão latente: o prompt incorporado e um vídeo comprimido com ruído são enviados para este modelo, que os utiliza para gerar um vídeo comprimido. O Veo utiliza representações de vídeo comprimidas e de alta qualidade, conhecidas como latentes, para melhorar a eficiência sem comprometer a qualidade.
- Descodificação: o passo final descodifica a saída de vídeo 1080p a partir do vídeo comprimido.

Fig. 5. Como funciona o Veo.
Um estudo de caso convincente sobre produção cinematográfica#
Para testar as capacidades do Veo, a Google colaborou com o cineasta Donald Glover e o seu estúdio criativo, Gilga. Utilizaram o Veo para explorar várias técnicas criativas, incluindo planos de seguimento dinâmicos, que exigem movimentos precisos e um enquadramento consistente.

Fig. 6. Utilização do Veo no processo de produção cinematográfica.
Tradicionalmente, os cineastas enfrentam limitações devido a restrições de tempo e recursos. Com o Veo, Glover e a sua equipa puderam experimentar e gerar rapidamente planos complexos, o que, por sua vez, proporcionou mais flexibilidade e inovação no processo de produção cinematográfica.
Com o Veo, Glover e a sua equipa puderam experimentar e gerar rapidamente planos complexos antes das filmagens. Por exemplo, puderam testar vários planos de seguimento dinâmicos para ver como ficariam e fazer os ajustes necessários. Este processo de pré-visualização ajudou-os a aperfeiçoar as suas ideias e a garantir que os planos funcionariam como previsto, reduzindo, em última análise, o número de takes necessários durante as filmagens. Conseguiram criar um estudo de caso convincente para demonstrar o potencial do Veo para transformar a indústria cinematográfica. A ferramenta oferece uma forma mais rápida e eficiente de dar vida a visões criativas.
Utilizações práticas do Veo em vários setores#
As capacidades avançadas de geração de vídeo do Veo têm aplicações práticas em muitos setores. Na publicidade, pode produzir rapidamente anúncios personalizados e de alta qualidade para públicos-alvo, poupando tempo e custos de produção. Na educação, o Veo pode criar vídeos didáticos envolventes, facilitando a compreensão de conceitos complexos.
As empresas podem utilizar o Veo para formação e comunicações empresariais. Os profissionais de saúde podem utilizar o Veo para simular procedimentos médicos para fins de formação. No que diz respeito a eventos virtuais e conferências, o Veo pode criar simulações realistas de locais e palcos, proporcionando aos participantes uma experiência envolvente e interativa a partir de qualquer lugar. Os organizadores beneficiam de um alcance alargado e de informações valiosas para eventos futuros. Graças ao Veo, abriram-se inúmeras oportunidades.
Quando um modelo de IA tem potencial para chegar a diferentes setores, é importante ter em mente a segurança e a ética na IA. Para permitir uma adoção mais ampla e garantir uma utilização responsável, a Google implementou várias medidas de segurança. Os vídeos criados pelo Veo têm uma marca de água através do SynthID, uma ferramenta para inserir marcas de água e identificar conteúdos gerados por IA. O SynthID assegura a transparência e ajuda a reduzir os riscos relacionados com a privacidade, os direitos de autor e os enviesamentos. Além disso, todos os vídeos gerados passam por filtros de segurança e processos de verificação de memorização. Estas salvaguardas tornam o Veo numa ferramenta valiosa e ética que apoia uma produção de vídeo responsável e inovadora.
Onde aceder ao Veo#
Nas próximas semanas, a Google começará a disponibilizar algumas das funcionalidades inovadoras do Veo a criadores selecionados através do VideoFX, uma nova ferramenta disponível em labs.google. Esta iniciativa permite o acesso antecipado às capacidades avançadas de geração de vídeo do Veo, dando aos criadores a oportunidade de experimentar as suas funcionalidades inovadoras. A lista de espera do Veo está atualmente aberta, convidando os criadores interessados a inscreverem-se e a utilizarem as poderosas ferramentas do Veo nos seus projetos.
Mais informações sobre as atualizações de IA generativa da DeepMind em 2024#
Além do Veo, a DeepMind introduziu várias atualizações de vanguarda em IA generativa para 2024. Uma dessas atualizações é o Imagen 3, o seu modelo de texto para imagem mais avançado até à data. O Imagen 3 destaca-se na criação de imagens fotorrealistas e realistas. Compreende profundamente os prompts em linguagem natural e capta detalhes intrincados, minimizando simultaneamente os artefactos visuais.

Fig. 7. Uma imagem gerada com o Imagen 3.
A DeepMind também desenvolveu o Lyria, o seu modelo mais avançado para geração de música com IA. Como parte deste esforço, a DeepMind criou um conjunto de ferramentas de IA para música chamado Music AI Sandbox. Estas ferramentas permitem aos músicos e produtores explorar novas possibilidades criativas na composição musical e na transformação sonora.

Fig. 8. Um exemplo da interface de utilizador das ferramentas de IA para música da DeepMind.
Tal como no Veo, a DeepMind também implementou várias medidas de segurança relativamente às suas outras atualizações. O SynthID será utilizado em todas estas atualizações como ferramenta para inserir marcas de água e identificar conteúdos gerados por IA. Estas atualizações da DeepMind prometem transformar vários setores, oferecendo ferramentas avançadas, eficientes e responsáveis para criar conteúdos visuais e áudio de alta qualidade.
Navegar pela próxima fase da IA generativa#
Os avanços da DeepMind em IA generativa em 2024, incluindo o Veo, o Imagen 3 e o Lyria, representam um salto considerável nas capacidades da IA. O Veo transforma a criação de vídeos com a sua capacidade de gerar vídeos 1080p de alta qualidade a partir de prompts simples, tornando-se uma ferramenta versátil para cineastas e criadores de conteúdos. O Imagen 3 destaca-se na produção de imagens fotorrealistas, enquanto o Lyria introduz novas possibilidades na geração de música com ferramentas avançadas de IA.
Estas tecnologias prometem transformar vários setores, fornecendo ferramentas eficientes e responsáveis para criar conteúdos visuais e áudio de alta qualidade. Com medidas de segurança como o SynthID, que asseguram uma utilização ética, a DeepMind continua a expandir os limites da IA, abrindo caminho a aplicações inovadoras no futuro.
Explora a IA visitando o nosso repositório no GitHub e juntando-te à nossa comunidade. Explora as nossas páginas de soluções para saber como a IA é aplicada na indústria transformadora e na agricultura.









