Google DeepMind’ın Veo'su ile videolar oluşturma
Google DeepMind'ın metin, görsel ve video istemlerinden zahmetsizce yüksek kaliteli 1080P videolar oluşturabilen en yeni üretken video modeli Veo hakkında daha fazla bilgi edin.

14 Mayıs’ta gerçekleştirilen Google'ın 2024 I/O sunumunda, yapay zekâ bölümleri DeepMind’den en son güncellemeleri paylaştılar. Paylaşılan en heyecan verici gelişmelerden biri, en yeni üretken video modelleri Veo’ydu. Veo, metin, görsel ve video istemlerine dayalı olarak yüksek kaliteli 1080P videolar oluşturabilir. Hatta oluşturulan videoları sonraki istemlerle düzenlemenize olanak tanır. Veo, üretken yapay zekâyı bir sonraki seviyeye taşıyor. Veo’nun sunduğu özelliklere daha yakından bakalım.
Veo’nun yeteneklerini anlama#
Veo, kullanıcının yaratıcı vizyonuyla yakından örtüşen videolar oluşturmak için dili ve görselleri derinlemesine anlayan üretken bir video modelidir. Uzun istemlerin tonunu ve ayrıntılarını doğru şekilde yakalayabilir; bu da fikirlerini kusursuz video içeriklerine dönüştürmek isteyen içerik üreticileri için onu güçlü bir araç hâline getirir.
Veo, "timelapse" ve "bir manzaranın havadan çekimleri" gibi film tekniklerini anlayabildiği için kullanıcı, oluşturulan video üzerinde çığır açan bir yaratıcı kontrole sahip olabilir. Bu yaratıcı kontrol, kullanıcıların insanların, hayvanların ve nesnelerin doğal şekilde hareket ettiği videolar oluşturmasını mümkün kılar. Veo tarafından oluşturulan videolar ilgi çekici ve görsel açıdan etkileyicidir; çünkü bunların bir yapay zekâ modeli tarafından oluşturulduğunu fark etmek zordur.
Veo, yalnızca istemlerden video oluşturmanın ötesine geçer. Daha önce oluşturulmuş bir video ve kıyı şeridinin havadan görünümüne kanolar eklemek gibi belirli bir düzenleme isteği sağlarsanız, Veo bu değişikliği orijinal videoya sorunsuz şekilde entegre ederek güncellenmiş bir sürüm oluşturabilir.

Şekil 1. Veo kullanılarak video düzenleme örneği.
Veo’nun sunduğu diğer bazı özellikler şunlardır:
- Maskeli Düzenleme: Veo, bir videonun belirli alanlarını düzenlemenize yardımcı olabilir.
- Görselden İlham Alan Video Oluşturma: Veo, bir görsel ve metin istemi kullanarak görselin tarzını yansıtan ve istemin yönlendirmelerini izleyen videolar oluşturabilir.
- Uzatılmış Video Klipleri: Veo, tek bir istemden veya birlikte bir hikâye anlatan istemler dizisinden 60 saniye veya daha uzun video klipleri oluşturabilir ve bunları uzatabilir.
Veo’nun oluşturduğu nefes kesici videolar#
Veo’nun oluşturduğu videolardan bazılarını ve bunların neden bu kadar nefes kesici olduğunu inceleyelim.
Kısa bir metin isteminden timelapse videosu oluşturmak zordur. Kısa metin istemi, genellikle timelapse sahnesindeki değişimleri ve hareketleri doğru şekilde aktaramaz. Bu nedenle Veo’nun ayrıntılara girmeden bir timelapse’ten ne beklemesi gerektiğini anlayabilmesi şaşırtıcıdır.

Şekil 2. Veo’nun oluşturduğu hızlandırılmış videodan bir kare.
Benzer şekilde, fizik kurallarını doğru şekilde yansıtan videolar oluşturmak kolay değildir. Yapay zekâ modelinin, hareketlerin ve etkileşimlerin gerçekçi görünmesi için yer çekimi, momentum ve çarpışmalar gibi fizik yasalarını anlaması ve simüle etmesi gerekir. Veo’nun bu dinamikleri metin istemlerinden gelen ayrıntılı yönlendirmeler olmadan doğru şekilde modelleyebilmesi etkileyicidir.

Şekil 3. Veo kullanılarak oluşturulan bir videodan alınan bu kare, denizanalarının hareket fiziğini doğru şekilde yakalar.
Şimdiye kadar, hesaplama sınırlamaları ve daha uzun diziler boyunca tutarlılığı korumanın zorluğu nedeniyle yapay zekâ tarafından oluşturulan yalnızca daha kısa videolar gördük. Google’ın 2024 I/O sunumunda, Veo’nun daha uzun ve daha karmaşık videolar oluşturma konusundaki akıl almaz yeteneği gösterildi.

Şekil 4. Google 2024 I/O sunumunda gösterilen daha uzun Veo videosundan kareler.
Veo nasıl çalışır?#
Diğer birçok yapay zekâ modeli gibi Veo da öncüllerinin çalışmalarından yararlanır. Üretken Sorgu Ağı (GQN), DVD-GAN, Imagen-Video, Phenaki, WALT, VideoPoet ve Lumiere gibi önceki gelişmelerin yanı sıra Google’ın özel Transformer mimarisinden ve Gemini’den yararlanır. Ayrıca Veo’nun istemleri doğru şekilde yorumlama yeteneğini geliştirmek için eğitim veri kümesindeki her videonun açıklamaları daha ayrıntılı hâle getirilmiştir.
Google’ın paylaştığı kabaca model iş akışına göre Veo şu şekilde çalışır:
- Girdi İstemleri: Bir metin istemi ve isteğe bağlı olarak bir görsel istemi sağlarsınız.
- Kodlama: Metin istemi bir UL2 Encoder tarafından, görsel istemi ise bir görsel kodlayıcı tarafından işlenir.
- Gömülü İstem: Metin ve görsel kodlayıcılardan elde edilen çıktılar, tek bir gömülü istem oluşturmak üzere birleştirilir.
- Gizli Difüzyon Modeli: Gömülü istem ve gürültülü, sıkıştırılmış video bu modele aktarılır ve model bunları kullanarak sıkıştırılmış bir video oluşturur. Veo, kaliteyi korurken verimliliği artırmak için gizli temsiller olarak bilinen yüksek kaliteli, sıkıştırılmış video temsillerini kullanır.
- Kod Çözme: Son adımda, 1080p video çıktısının kodu sıkıştırılmış videodan çözülür.

Şekil 5. Veo’nun çalışma şekli.
Film yapımında etkileyici bir vaka çalışması#
Google, Veo’nun yeteneklerini test etmek için film yapımcısı Donald Glover ve yaratıcı stüdyosu Gilga ile iş birliği yaptı. Hassas hareket ve tutarlı kadrajlama gerektiren dinamik takip çekimleri de dâhil olmak üzere çeşitli yaratıcı teknikleri keşfetmek için Veo’yu kullandılar.

Şekil 6. Film yapım sürecinde Veo’nun kullanımı.
Geleneksel olarak film yapımcıları, zaman ve kaynak kısıtlamaları nedeniyle sınırlamalarla karşılaşır. Veo sayesinde Glover ve ekibi karmaşık çekimleri hızlıca deneyip oluşturabildi; bu da film yapım sürecinde daha fazla esneklik ve yenilik sağladı.
Glover ve ekibi, gerçek çekimlerden önce Veo ile karmaşık çekimleri hızlıca deneyip oluşturabildi. Örneğin, çeşitli dinamik takip çekimlerinin nasıl görüneceğini test edebilir ve gerektiğinde ayarlamalar yapabilirlerdi. Bu ön görselleştirme süreci, fikirlerini geliştirmelerine ve çekimlerin amaçlandığı şekilde işe yarayacağından emin olmalarına yardımcı oldu; sonuç olarak gerçek çekimler sırasında gereken tekrar sayısı azaldı. Veo’nun film sektörünü değiştirme potansiyelini göstermek için etkileyici bir vaka çalışması oluşturabildiler. Veo, yaratıcı vizyonları hayata geçirmek için daha hızlı ve verimli bir yol sunar.
Veo’nun çeşitli sektörlerdeki pratik kullanım alanları#
Veo’nun gelişmiş video oluşturma yetenekleri, birçok sektörde pratik uygulamalara sahiptir. Reklamcılıkta hedef kitlelere yönelik özelleştirilmiş, yüksek kaliteli reklamları hızlıca üreterek zamandan ve prodüksiyon maliyetlerinden tasarruf sağlayabilir. Eğitimde ise Veo, ilgi çekici öğretici videolar oluşturarak karmaşık kavramların anlaşılmasını kolaylaştırabilir.
İşletmeler, eğitim ve kurumsal iletişim için Veo’yu kullanabilir. Sağlık hizmetleri profesyonelleri, eğitim amacıyla tıbbi prosedürleri simüle etmek için Veo’dan yararlanabilir. Sanal etkinlikler ve konferanslar söz konusu olduğunda Veo, mekânların ve sahnelerin gerçeğe yakın simülasyonlarını oluşturarak katılımcılara her yerden ilgi çekici ve etkileşimli bir deneyim sunabilir. Organizatörler daha geniş erişimden ve gelecekteki etkinlikler için değerli içgörülerden yararlanır. Veo sayesinde sayısız fırsat ortaya çıktı.
Bir yapay zekâ modeli farklı sektörleri etkileme potansiyeline sahip olduğunda güvenliği ve etik yapay zekâyı göz önünde bulundurmak önemlidir. Daha geniş çapta benimsenmesini mümkün kılmak ve sorumlu kullanımı güvence altına almak için Google çeşitli güvenlik önlemleri uygulamıştır. Veo tarafından oluşturulan videolar, yapay zekâ tarafından oluşturulan içerikleri filigranlamak ve tanımlamak için kullanılan SynthID ile filigranlanır. SynthID şeffaflığı güvence altına alır ve gizlilik, telif hakkı ve önyargı risklerini azaltmaya yardımcı olur. Bunun yanı sıra oluşturulan tüm videolar güvenlik filtrelerinden ve ezberleme denetimi süreçlerinden geçirilir. Bu önlemler, Veo’yu sorumlu ve yenilikçi video üretimini destekleyen değerli ve etik bir araç hâline getirir.
Veo’ya nereden erişilir?#
Google, önümüzdeki haftalarda Veo’nun çığır açan bazı özelliklerini labs.google adresinde bulunan yeni bir araç olan VideoFX aracılığıyla seçili içerik üreticilerine sunmaya başlayacak. Bu girişim, Veo’nun gelişmiş video oluşturma yeteneklerine erken erişim sağlayarak içerik üreticilerine yenilikçi özelliklerini deneme fırsatı verir. Veo bekleme listesi şu anda açıktır; ilgilenen içerik üreticileri kaydolarak Veo’nun güçlü araçlarını projelerinde kullanabilir.
DeepMind’in 2024 üretken yapay zekâ güncellemeleri hakkında daha fazla bilgi#
DeepMind, Veo’nun yanı sıra 2024 yılı için üretken yapay zekâ alanında birçok son teknoloji güncelleme sundu. Bu güncellemelerden biri, şimdiye kadarki en gelişmiş metinden görsele modeli olan Imagen 3’tür. Imagen 3, fotogerçekçi ve gerçeğe yakın görseller oluşturma konusunda üstündür. Doğal dil istemlerini derinlemesine anlar, görsel bozulmaları en aza indirirken karmaşık ayrıntıları yakalar.

Şekil 7. Imagen 3 kullanılarak oluşturulmuş bir görsel.
DeepMind ayrıca yapay zekâ ile müzik üretmeye yönelik en gelişmiş modeli olan Lyria’yı geliştirdi. Bu çalışmanın bir parçası olarak DeepMind, Music AI Sandbox adlı bir müzik yapay zekâ araçları paketi oluşturdu. Bu araçlar, müzisyenlerin ve yapımcıların müzik besteleme ve ses dönüştürme alanlarında yeni yaratıcı olanakları keşfetmesini sağlar.

Şekil 8. DeepMind’in yapay zekâ müzik araçlarının örnek kullanıcı arayüzü.
DeepMind, Veo’ya benzer şekilde diğer güncellemeleriyle ilgili olarak da çeşitli güvenlik önlemleri uygulamıştır. SynthID, yapay zekâ tarafından oluşturulan içeriği filigranlamak ve tanımlamak için bu güncellemelerin tamamında bir araç olarak kullanılacaktır. DeepMind’in bu güncellemeleri, yüksek kaliteli görsel ve ses içeriği oluşturmak için gelişmiş, verimli ve sorumlu araçlar sunarak çeşitli sektörleri dönüştürme sözü veriyor.
Üretken yapay zekânın bir sonraki aşamasını keşfetmek#
Veo, Imagen 3 ve Lyria dâhil olmak üzere DeepMind’in 2024 üretken yapay zekâ gelişmeleri, yapay zekâ yeteneklerinde önemli bir sıçramaya işaret ediyor. Veo, basit istemlerden yüksek kaliteli 1080p videolar oluşturma yeteneğiyle video üretimini dönüştürerek film yapımcıları ve içerik üreticileri için çok yönlü bir araç hâline geliyor. Imagen 3, fotogerçekçi görseller üretme konusunda öne çıkarken Lyria, gelişmiş yapay zekâ araçlarıyla müzik üretiminde yeni olanaklar sunuyor.
Bu teknolojiler, yüksek kaliteli görsel ve ses içeriği oluşturmak için verimli ve sorumlu araçlar sağlayarak çeşitli sektörleri dönüştürme sözü veriyor. SynthID gibi güvenlik önlemleri etik kullanımı güvence altına alırken DeepMind, yapay zekânın sınırlarını genişletmeye ve gelecekte yenilikçi uygulamaların önünü açmaya devam ediyor.
GitHub depomuzu ziyaret ederek ve topluluğumuza katılarak yapay zekâyı keşfetmeye başlayabilirsin. Yapay zekânın üretim ve tarım alanlarında nasıl uygulandığını öğrenmek için çözümler sayfalarımızı incele.









