Ultralytics YOLO27:
Vision-KI

Videos mit Veo von Google DeepMind generieren

Erfahre mehr über Veo, das neueste generative Videomodell von Google DeepMind, das mühelos hochwertige 1080P-Videos aus Text-, Bild- und Videoeingaben erstellen kann.

ABAbirami Vina8 min read
Das generative Videomodell Veo von Google DeepMind

Während der Google-I/O-Präsentation 2024 am 14. Mai wurden die neuesten Entwicklungen von DeepMind, der KI-Sparte des Unternehmens, vorgestellt. Eine der spannendsten vorgestellten Neuerungen war das neueste generative Videomodell Veo. Veo kann auf Grundlage von Text-, Bild- und Videoprompts hochwertige Videos in 1080P erstellen. Außerdem kannst du generierte Videos mit nachfolgenden Prompts bearbeiten. Veo hebt generative KI auf die nächste Stufe. Sehen wir uns die Funktionen von Veo genauer an.

Veo und seine Fähigkeiten verstehen#

Veo ist ein generatives Videomodell, das ein tiefgreifendes Verständnis von Sprache und Bildern nutzt, um Videos zu erstellen, die der kreativen Vorstellung des Benutzers sehr genau entsprechen. Es kann Tonalität und Details längerer Prompts präzise erfassen und ist damit ein leistungsstarkes Werkzeug für Kreative, die ihre Ideen in präzise Videoinhalte umsetzen möchten.

Der Benutzer erhält eine beispiellose kreative Kontrolle über das generierte Video, da Veo Filmtechniken wie „Timelapse“ und „Luftaufnahmen einer Landschaft“ versteht. Diese kreative Kontrolle ermöglicht es Benutzern, Videos zu erstellen, in denen sich Menschen, Tiere und Objekte natürlich bewegen. Von Veo generierte Videos wirken ansprechend und visuell attraktiv, da nur schwer zu erkennen ist, dass sie von einem KI-Modell erstellt wurden.

Veo kann mehr, als lediglich Videos aus Prompts zu erstellen. Wenn du ein zuvor generiertes Video und eine konkrete Bearbeitungsanweisung bereitstellst, etwa zum Einfügen von Kajaks in eine Luftaufnahme einer Küste, kann Veo diese Änderung nahtlos in das ursprüngliche Video integrieren und eine aktualisierte Version erzeugen.

Ein Beispiel für die Videobearbeitung mit Veo

Abb. 1 Ein Beispiel für die Videobearbeitung mit Veo.

Hier sind einige weitere Funktionen von Veo:

  • Bearbeitung mit Masken: Veo unterstützt dich bei der Bearbeitung definierter Bereiche eines Videos.
  • Bildinspirierte Videogenerierung: Mithilfe eines Bildes und eines Textprompts kann Veo Videos erstellen, die den Stil des Bildes widerspiegeln und den Vorgaben des Prompts folgen.
  • Erweiterte Videoclips: Veo kann Videoclips mit einer Länge von 60 Sekunden oder mehr erstellen und erweitern – entweder aus einem einzelnen Prompt oder aus einer Folge von Prompts, die gemeinsam eine Geschichte erzählen.

Atemberaubende von Veo generierte Videos#

Sehen wir uns einige der von Veo generierten Videos an und betrachten wir, was sie so atemberaubend macht.

Die Generierung eines Zeitraffervideos aus einem kurzen Textprompt ist anspruchsvoll. In der Regel kann der kurze Textprompt Veränderungen und Bewegungen innerhalb der Zeitrafferszene nicht präzise vermitteln. Daher ist es erstaunlich, dass Veo versteht, was von einem Zeitraffer zu erwarten ist, ohne dass die Details ausdrücklich beschrieben werden müssen.

Ein Einzelbild aus dem von Veo generierten Zeitraffervideo

Abb. 2 Ein Einzelbild aus dem von Veo generierten Zeitraffervideo.

Auch die Generierung von Videos mit einer korrekten Physik ist nicht einfach. Das KI-Modell muss physikalische Gesetze wie Schwerkraft, Impuls und Kollisionen verstehen und simulieren, damit Bewegungen und Interaktionen realistisch wirken. Es ist beeindruckend, dass Veo diese Dynamik ohne detaillierte Anweisungen in Textprompts präzise modellieren kann.

Ein Einzelbild aus einem mit Veo generierten Video, das die Physik der Quallenbewegung zeigt

Abb. 3 Ein Einzelbild aus einem mit Veo generierten Video, das die Physik der Quallenbewegung präzise erfasst.

Bislang haben wir aufgrund von Rechenbeschränkungen und der Schwierigkeit, die Konsistenz über längere Sequenzen hinweg zu wahren, nur kürzere, von KI generierte Videos gesehen. Bei Googles I/O-Präsentation 2024 wurde Veos verblüffende Fähigkeit gezeigt, längere und komplexere Videos zu erstellen.

Einzelbilder aus dem längeren Veo-Video, das bei der Google-I/O-Präsentation 2024 gezeigt wurde

Abb. 4 Einzelbilder aus dem längeren Veo-Video, das bei der Google-I/O-Präsentation 2024 gezeigt wurde.

Wie funktioniert Veo?#

Wie viele andere KI-Modelle steht auch Veo auf den Schultern von Giganten. Es baut auf früheren Entwicklungen wie dem Netzwerk für generative Abfragen (GQN), DVD-GAN, Imagen-Video, Phenaki, WALT, VideoPoet und Lumiere sowie Googles proprietärer Transformer-Architektur und Gemini auf. Um Veos Fähigkeit zur präzisen Interpretation von Prompts zu verbessern, waren außerdem die Bildunterschriften der einzelnen Videos im Trainingsdatensatz detaillierter.

Auf Grundlage des von Google vorgestellten groben Modellablaufs funktioniert Veo folgendermaßen:

  • Eingabeprompts: Du stellst einen Textprompt und optional einen Bildprompt bereit.
  • Kodierung: Der Textprompt wird von einem UL2 Encoder verarbeitet, der Bildprompt von einem Bildencoder.
  • Eingebetteter Prompt: Die Ausgaben der Text- und Bildencoder werden zu einem einzigen eingebetteten Prompt kombiniert.
  • Latentes Diffusionsmodell: Der eingebettete Prompt und ein verrauschtes komprimiertes Video werden an dieses Modell übergeben, das daraus ein komprimiertes Video generiert. Veo verwendet hochwertige komprimierte Videorepräsentationen, sogenannte latente Repräsentationen, um die Effizienz zu steigern und gleichzeitig die Qualität zu erhalten.
  • Dekodierung: Im letzten Schritt wird die 1080p-Videoausgabe aus dem komprimierten Video dekodiert.

Diagramm zur Funktionsweise von Veo

Abb. 5 Funktionsweise von Veo.

Eine überzeugende Fallstudie zur Filmproduktion#

Um Veos Fähigkeiten zu testen, arbeitete Google mit dem Filmemacher Donald Glover und dessen Kreativstudio Gilga zusammen. Sie nutzten Veo, um verschiedene kreative Techniken zu erkunden, darunter dynamische Kamerafahrten, die präzise Bewegungen und eine gleichbleibende Bildkomposition erfordern.

Veo im Filmproduktionsprozess

Abb. 6 Veo im Filmproduktionsprozess.

Traditionell sind Filmemacher aufgrund von Zeit- und Ressourcenbeschränkungen eingeschränkt. Mit Veo konnten Glover und sein Team schnell mit komplexen Einstellungen experimentieren und diese generieren, was wiederum mehr Flexibilität und Innovation im Filmproduktionsprozess ermöglichte.

Mit Veo konnten Glover und sein Team vor den eigentlichen Dreharbeiten schnell mit komplexen Einstellungen experimentieren und diese generieren. So konnten sie beispielsweise verschiedene dynamische Kamerafahrten testen, um zu sehen, wie sie wirken würden, und bei Bedarf Anpassungen vornehmen. Dieser Prozess der Vorvisualisierung half ihnen, ihre Ideen zu verfeinern und sicherzustellen, dass die Einstellungen wie vorgesehen funktionieren würden. Dadurch ließ sich letztlich die Zahl der während der eigentlichen Dreharbeiten erforderlichen Takes reduzieren. So konnten sie eine überzeugende Fallstudie erstellen, die Veos Potenzial zur Veränderung der Filmbranche demonstriert. Veo bietet eine schnellere und effizientere Möglichkeit, kreative Vorstellungen zum Leben zu erwecken.

Praktische Einsatzmöglichkeiten von Veo in verschiedenen Branchen#

Veos fortschrittliche Funktionen zur Videogenerierung lassen sich in vielen Branchen praktisch einsetzen. In der Werbung kann Veo schnell maßgeschneiderte, hochwertige Werbespots für bestimmte Zielgruppen erstellen und so Zeit und Produktionskosten sparen. Im Bildungsbereich kann Veo ansprechende Lehrvideos erstellen, die das Verständnis komplexer Konzepte erleichtern.

Unternehmen können Veo für Schulungen und die Unternehmenskommunikation einsetzen. Fachkräfte im Gesundheitswesen könnten Veo nutzen, um medizinische Verfahren zu Schulungszwecken zu simulieren. Für virtuelle Veranstaltungen und Konferenzen kann Veo realitätsnahe Simulationen von Veranstaltungsorten und Bühnen erstellen und Teilnehmern von überall aus ein ansprechendes und interaktives Erlebnis bieten. Veranstalter profitieren von einer größeren Reichweite und wertvollen Erkenntnissen für künftige Veranstaltungen. Dank Veo haben sich unzählige Möglichkeiten eröffnet.

Wenn ein KI-Modell das Potenzial hat, verschiedene Branchen zu erreichen, ist es wichtig, Sicherheit und ethische Aspekte der KI zu berücksichtigen. Um eine breitere Einführung zu ermöglichen und eine verantwortungsvolle Nutzung sicherzustellen, hat Google mehrere Sicherheitsmaßnahmen implementiert. Mit Veo erstellte Videos werden mithilfe von SynthID mit einem Wasserzeichen versehen. SynthID ist ein Werkzeug zur Kennzeichnung und Identifizierung KI-generierter Inhalte. SynthID sorgt für Transparenz und trägt dazu bei, Risiken in Bezug auf Datenschutz, Urheberrecht und Verzerrungen zu mindern. Darüber hinaus durchlaufen alle generierten Videos Sicherheitsfilter und Prüfungen auf eine mögliche Übernahme aus den Trainingsdaten. Diese Schutzmaßnahmen machen Veo zu einem wertvollen und ethisch vertretbaren Werkzeug, das eine verantwortungsvolle und innovative Videoproduktion unterstützt.

Wo du Veo nutzen kannst#

In den kommenden Wochen wird Google ausgewählten Kreativen über VideoFX, ein neues unter labs.google verfügbares Werkzeug, einige der bahnbrechenden Funktionen von Veo anbieten. Diese Initiative ermöglicht den frühzeitigen Zugang zu Veos fortschrittlichen Funktionen zur Videogenerierung und gibt Kreativen die Möglichkeit, mit den innovativen Funktionen zu experimentieren. Die Warteliste für Veo ist derzeit geöffnet und lädt interessierte Kreative ein, sich anzumelden und Veos leistungsstarke Werkzeuge in ihren Projekten zu nutzen.

Weitere Informationen zu DeepMinds generativen KI-Neuerungen 2024#

Neben Veo hat DeepMind 2024 mehrere wegweisende Neuerungen im Bereich der generativen KI vorgestellt. Eine davon ist Imagen 3, das bislang fortschrittlichste Text-zu-Bild-Modell des Unternehmens. Imagen 3 zeichnet sich durch die Erstellung fotorealistischer, lebensechter Bilder aus. Das Modell versteht Prompts in natürlicher Sprache umfassend und erfasst komplexe Details, während es visuelle Artefakte minimiert.

Ein mit Imagen 3 generiertes Bild

Abb. 7 Ein mit Imagen 3 generiertes Bild.

DeepMind hat außerdem Lyria entwickelt, sein bislang fortschrittlichstes Modell zur Generierung von KI-Musik. Im Rahmen dieser Initiative hat DeepMind eine Suite von KI-Werkzeugen für Musik namens Music AI Sandbox entwickelt. Diese Werkzeuge ermöglichen es Musikern und Produzenten, neue kreative Möglichkeiten für die Komposition und Klangtransformation zu erkunden.

Ein Beispiel für die Benutzeroberfläche von DeepMinds KI-Werkzeugen für Musik

Abb. 8 Ein Beispiel für die Benutzeroberfläche von DeepMinds KI-Werkzeugen für Musik.

Ähnlich wie bei Veo hat DeepMind auch für seine anderen Neuerungen mehrere Sicherheitsmaßnahmen implementiert. SynthID wird bei diesen Neuerungen als Werkzeug zur Kennzeichnung und Identifizierung KI-generierter Inhalte eingesetzt. Diese Entwicklungen von DeepMind versprechen, verschiedene Branchen zu verändern, indem sie fortschrittliche, effiziente und verantwortungsvolle Werkzeuge für die Erstellung hochwertiger visueller und auditiver Inhalte bereitstellen.

Die nächste Phase der generativen KI#

DeepMinds Fortschritte im Bereich der generativen KI im Jahr 2024, darunter Veo, Imagen 3 und Lyria, markieren einen deutlichen Sprung bei den Fähigkeiten von KI-Systemen. Veo verändert die Videoproduktion durch seine Fähigkeit, aus einfachen Prompts hochwertige Videos in 1080p zu generieren, und ist damit ein vielseitiges Werkzeug für Filmemacher und Content-Ersteller. Imagen 3 überzeugt bei der Erstellung fotorealistischer Bilder, während Lyria mit fortschrittlichen KI-Werkzeugen neue Möglichkeiten für die Musikgenerierung eröffnet.

Diese Technologien versprechen, verschiedene Branchen zu verändern, indem sie effiziente und verantwortungsvolle Werkzeuge für die Erstellung hochwertiger visueller und auditiver Inhalte bereitstellen. Mit Sicherheitsmaßnahmen wie SynthID, die eine ethische Nutzung gewährleisten, erweitert DeepMind kontinuierlich die Grenzen der KI und ebnet den Weg für innovative Anwendungen in der Zukunft.

Tauche in die Welt der KI ein, indem du unser GitHub-Repository besuchst und unserer Community beitrittst. Auf unseren Lösungsseiten erfährst du, wie KI in der Fertigung und der Landwirtschaft eingesetzt wird.

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens