Ultralytics YOLO27:
Vision-KI

Was sind Diffusionsmodelle? Ein kurzer und umfassender Leitfaden

Entdecke mit uns, wie Diffusionsmodelle zur Erstellung realistischer Inhalte eingesetzt werden können und mit vielfältigen Anwendungen Bereiche wie Design, Musik und Film neu definieren.

ABAbirami Vina8 min read
Ein Leitfaden zu Diffusionsmodellen in der generativen KI

Die Verwendung von Tools für generative KI wie Midjourney und Sora zur Erstellung von Inhalten wird immer üblicher, und das Interesse daran, hinter die Kulissen dieser Tools zu blicken, wächst. Eine aktuelle Studie zeigt, dass 94 % der Menschen bereit sind, neue Fähigkeiten zu erlernen, um mit generativer KI zu arbeiten. Wenn du verstehst, wie Modelle für generative KI funktionieren, kannst du diese Tools effektiver nutzen und ihr volles Potenzial ausschöpfen.

Das Herzstück von Tools wie Midjourney und Sora sind fortschrittliche Diffusionsmodelle – Modelle für generative KI, die für verschiedene Anwendungen Bilder, Videos, Text und Audio erstellen können. Diffusionsmodelle eignen sich beispielsweise hervorragend zur Erstellung kurzer Marketingvideos für soziale Plattformen wie TikTok und YouTube Shorts. In diesem Artikel sehen wir uns an, wie Diffusionsmodelle funktionieren und wo sie eingesetzt werden können. Legen wir los!

Die Inspiration hinter fortschrittlichen Diffusionsmodellen#

In der Physik ist Diffusion der Prozess, bei dem sich Moleküle von Bereichen höherer Konzentration in Bereiche niedrigerer Konzentration ausbreiten. Das Konzept der Diffusion steht in engem Zusammenhang mit der Brownschen Bewegung, bei der sich Teilchen zufällig bewegen, wenn sie mit Molekülen in einer Flüssigkeit zusammenstoßen, und sich mit der Zeit allmählich ausbreiten.

Diese Konzepte inspirierten die Entwicklung von Diffusionsmodellen für generative KI. Diffusionsmodelle fügen Daten schrittweise Rauschen hinzu und lernen anschließend, diesen Prozess umzukehren, um neue, hochwertige Daten wie Text, Bilder oder Töne zu erzeugen. Das ähnelt der Vorstellung einer umgekehrten Diffusion in der Physik. Theoretisch lässt sich Diffusion rückwärts verfolgen, um Teilchen in ihren ursprünglichen Zustand zurückzuversetzen. Auf ähnliche Weise lernen Diffusionsmodelle, das hinzugefügte Rauschen umzukehren und aus verrauschten Eingaben realistische neue Daten zu erzeugen.

Ein Beispiel für die Verwendung von Diffusionsmodellen zur Bilderzeugung

Ein Blick unter die Haube von Diffusionsmodellen#

Die Architektur eines Diffusionsmodells umfasst im Allgemeinen zwei wesentliche Schritte. Zunächst lernt das Modell, dem Datensatz schrittweise Rauschen hinzuzufügen. Anschließend wird es darauf trainiert, diesen Prozess umzukehren und die Daten in ihren ursprünglichen Zustand zurückzuführen. Sehen wir uns genauer an, wie das funktioniert.

Datenvorverarbeitung#

Bevor wir uns mit dem Kern eines Diffusionsmodells befassen, ist es wichtig zu beachten, dass alle Daten, mit denen das Modell trainiert wird, vorverarbeitet werden sollten. Wenn du beispielsweise ein Diffusionsmodell zur Bilderzeugung trainierst, muss der Trainingsdatensatz mit Bildern zunächst bereinigt werden. Die Vorverarbeitung von Bilddaten kann das Entfernen von Ausreißern umfassen, die die Ergebnisse beeinflussen könnten, ebenso wie die Normalisierung der Pixelwerte, damit sich alle Bilder auf derselben Skala befinden, und den Einsatz von Datenerweiterung, um für mehr Vielfalt zu sorgen. Schritte zur Datenvorverarbeitung tragen dazu bei, die Qualität der Trainingsdaten sicherzustellen – und das gilt nicht nur für Diffusionsmodelle, sondern für jedes KI-Modell.

Beispiele für die Datenerweiterung von Bilddaten

Abb. 2. Beispiele für die Datenerweiterung von Bilddaten.

Vorwärts gerichteter Diffusionsprozess#

Nach der Datenvorverarbeitung folgt der vorwärts gerichtete Diffusionsprozess. Konzentrieren wir uns auf das Trainieren eines Diffusionsmodells zur Bilderzeugung. Der Prozess beginnt mit einer Stichprobe aus einer einfachen Verteilung, etwa einer Gauß-Verteilung. Mit anderen Worten: Es wird zufälliges Rauschen ausgewählt. Wie im folgenden Bild dargestellt, transformiert das Modell das Bild schrittweise in einer Reihe von Schritten. Das Bild ist zunächst klar und wird mit jedem Schritt zunehmend verrauschter, bis es am Ende schließlich fast vollständig aus Rauschen besteht.

Vorwärts gerichteter Diffusionsprozess

Abb. 3. Vorwärts gerichteter Diffusionsprozess.

Jeder Schritt baut auf dem vorherigen auf, und mithilfe einer Markov-Kette wird kontrolliert und schrittweise Rauschen hinzugefügt. Eine Markov-Kette ist ein mathematisches Modell, bei dem die Wahrscheinlichkeit des nächsten Zustands ausschließlich vom aktuellen Zustand abhängt. Sie wird verwendet, um auf Grundlage der aktuellen Bedingungen zukünftige Ergebnisse vorherzusagen. Da jeder Schritt die Komplexität der Daten erhöht, können wir die feinsten Muster und Details der ursprünglichen Datenverteilung des Bildes erfassen. Die Zugabe von Gauß-Rauschen erzeugt außerdem vielfältige und realistische Stichproben, während sich die Diffusion entfaltet.

Umgekehrter Diffusionsprozess#

Der umgekehrte Diffusionsprozess beginnt, sobald der vorwärts gerichtete Diffusionsprozess eine Stichprobe in einen verrauschten, komplexen Zustand überführt hat. Mithilfe einer Reihe inverser Transformationen wird die verrauschte Stichprobe schrittweise wieder in ihren ursprünglichen Zustand überführt. Die Schritte, mit denen der Prozess der Rauscherzeugung umgekehrt wird, werden von einer umgekehrten Markov-Kette gesteuert.

Umgekehrter Diffusionsprozess

Abb. 4. Umgekehrter Diffusionsprozess.

Während des umgekehrten Prozesses lernen Diffusionsmodelle, neue Daten zu erzeugen, indem sie mit einer Stichprobe aus zufälligem Rauschen beginnen und diese schrittweise zu einer klaren, detaillierten Ausgabe verfeinern. Die erzeugten Daten ähneln am Ende stark dem ursprünglichen Datensatz. Diese Fähigkeit macht Diffusionsmodelle besonders geeignet für Aufgaben wie Bildsynthese, Datenvervollständigung und Entrauschung. Im nächsten Abschnitt sehen wir uns weitere Anwendungen von Diffusionsmodellen an.

Die Anwendungen von Diffusionsmodellen#

Der schrittweise Diffusionsprozess ermöglicht es einem Diffusionsmodell, komplexe Datenverteilungen effizient zu erzeugen, ohne von der hohen Dimensionalität der Daten überfordert zu werden. Sehen wir uns einige Anwendungen an, in denen Diffusionsmodelle besonders leistungsfähig sind.

Grafikdesign#

Diffusionsmodelle können verwendet werden, um schnell visuelle Inhalte für Grafiken zu erzeugen. Menschliche Designer und Künstler können Entwurfsskizzen, Layouts oder sogar einfache grobe Vorstellungen davon liefern, was sie möchten, und die Modelle können diese Ideen zum Leben erwecken. Dadurch kann der gesamte Designprozess beschleunigt werden, vom ersten Konzept bis zum fertigen Produkt eine große Bandbreite neuer Möglichkeiten eröffnet werden und menschlichen Designern viel wertvolle Zeit erspart werden.

Von Diffusionsmodellen erstellte Grafikdesigns

Abb. 5. Von Diffusionsmodellen erstellte Grafikdesigns.

Musik und Sounddesign#

Diffusionsmodelle können auch angepasst werden, um einzigartige Klanglandschaften oder Musiknoten zu erzeugen. Sie eröffnen Musikern und Künstlern neue Möglichkeiten, akustische Erlebnisse zu visualisieren und zu gestalten. Hier sind einige Anwendungsfälle von Diffusionsmodellen im Bereich der Erzeugung von Klängen und Musik:

  • Stimmübertragung: Diffusionsmodelle können verwendet werden, um einen Klang in einen anderen umzuwandeln, beispielsweise ein Kickdrum-Sample in einen Snare-Klang, und so einzigartige Klangkombinationen zu erzeugen.
  • Klangvariabilität und Humanisierung: Audiodiffusion kann leichte Variationen in Klänge einbringen und digitalen Audioaufnahmen durch die Simulation von Live-Instrumentalauftritten eine menschliche Note verleihen.
  • Anpassungen am Sounddesign: Diese Modelle können einen Klang subtil verändern, etwa ein Sample eines zuschlagenden Türgeräuschs verstärken, um seine Eigenschaften auf einer tieferen Ebene als mit herkömmlicher Entzerrung oder Filterung zu verändern.
  • Melodieerzeugung: Sie können auch dabei helfen, neue Melodien zu erzeugen und Künstler ähnlich wie beim Durchstöbern von Sample-Paketen zu inspirieren.

Eine Visualisierung der Audiodiffusion

Abb. 6. Eine Visualisierung der Audiodiffusion.

Film und Animation#

Ein weiterer interessanter Anwendungsfall von Diffusionsmodellen ist die Erstellung von Film- und Animationsclips. Sie können verwendet werden, um Figuren zu erzeugen, realistische Hintergründe und sogar dynamische Elemente innerhalb von Szenen zu erstellen. Der Einsatz von Diffusionsmodellen kann für Produktionsunternehmen ein großer Vorteil sein. Er optimiert den gesamten Arbeitsablauf und schafft Raum für mehr Experimente und Kreativität beim visuellen Geschichtenerzählen. Einige mit diesen Modellen erstellte Clips sind mit echten Animations- oder Filmclips vergleichbar. Es ist sogar möglich, mit diesen Modellen ganze Filme zu erstellen.

Eine Szene aus dem mit Diffusionsmodellen erstellten Kurzfilm Seasons

Abb. 7. Eine Szene aus dem Kurzfilm Seasons, der mit Diffusionsmodellen erstellt wurde.

Beliebte Diffusionsmodelle#

Nachdem wir nun einige Anwendungen von Diffusionsmodellen kennengelernt haben, sehen wir uns einige beliebte Diffusionsmodelle an, die du ausprobieren kannst.

  • Stable Diffusion: Stable Diffusion wurde von Stability AI entwickelt und ist ein effizientes Modell, das dafür bekannt ist, Text-Prompts in realistische Bilder umzuwandeln. Es genießt einen ausgezeichneten Ruf für die Erzeugung hochwertiger Bilder. Es kann auch für Film und Animation angepasst werden.
  • DALL-E 3: DALL-E 3 ist die neueste Version des Bilderzeugungsmodells von OpenAI. Es ist in ChatGPT integriert und bietet gegenüber der vorherigen Version DALL-E 2 zahlreiche Verbesserungen bei der Bildqualität.
  • Sora: Sora ist das Text-zu-Video-Modell von OpenAI, das hochrealistische Videos mit 1080p und einer Länge von bis zu einer Minute erzeugen kann. Einige der mit Sora erstellten Videoclips können leicht mit echtem Filmmaterial verwechselt werden.
  • Imagen: Imagen wurde von Google entwickelt und ist ein Text-zu-Bild-Diffusionsmodell, das für seinen Fotorealismus und sein fortschrittliches Sprachverständnis bekannt ist.

Herausforderungen und Einschränkungen im Zusammenhang mit Diffusionsmodellen#

Diffusionsmodelle bieten zwar Vorteile in vielen Branchen, doch wir sollten auch einige der damit verbundenen Herausforderungen berücksichtigen. Eine Herausforderung besteht darin, dass der Trainingsprozess sehr ressourcenintensiv ist. Fortschritte bei der Hardwarebeschleunigung können zwar helfen, aber kostspielig sein. Ein weiteres Problem ist die eingeschränkte Fähigkeit von Diffusionsmodellen, auf ihnen unbekannte Daten zu generalisieren. Ihre Anpassung an bestimmte Anwendungsbereiche kann umfangreiches Feinabstimmen oder erneutes Training erfordern.

Die Integration dieser Modelle in reale Aufgaben bringt eigene Herausforderungen mit sich. Entscheidend ist, dass die von der KI erzeugten Ergebnisse tatsächlich den Vorstellungen der Menschen entsprechen. Außerdem gibt es ethische Bedenken, etwa das Risiko, dass diese Modelle Verzerrungen aus ihren Trainingsdaten übernehmen und widerspiegeln. Darüber hinaus können die Verwaltung der Erwartungen der Nutzer und die kontinuierliche Verfeinerung der Modelle auf Grundlage von Feedback zu einem fortlaufenden Aufwand werden, um sicherzustellen, dass diese Tools möglichst effektiv und zuverlässig sind.

Die Zukunft der Diffusionsmodelle#

Diffusionsmodelle sind ein faszinierendes Konzept der generativen KI, das in vielen verschiedenen Bereichen bei der Erstellung hochwertiger Bilder, Videos und Klänge hilft. Auch wenn ihre Implementierung einige Herausforderungen mit sich bringen kann, etwa den Rechenaufwand und ethische Bedenken, arbeitet die KI-Community kontinuierlich daran, ihre Effizienz und Wirkung zu verbessern. Diffusionsmodelle stehen bereit, Branchen wie Film, Musikproduktion und die Erstellung digitaler Inhalte zu verändern, während sie sich weiterentwickeln.

Lass uns gemeinsam lernen und entdecken! Besuche unser GitHub-Repository, um unsere Beiträge zur KI zu sehen. Erfahre, wie wir Branchen wie Fertigung und Gesundheitswesen mit modernster KI-Technologie neu definieren.

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens