Sicherheit für Unternehmen: ISO 27001 + SOC 2 Type I-konform.
Zurück zum Ultralytics Glossar

Diffusion Language Models

Erfahre, wie Diffusions-Sprachmodelle Text durch iteratives Denoising generieren und bearbeiten, mit Einblicken in Transformer, Anwendungen, Vorteile und Einschränkungen.

Diffusion-Sprachmodelle sind generative Modelle, die Text durch iteratives Entrauschen erzeugen oder bearbeiten, anstatt jedes Token strikt von links nach rechts zu generieren. Sie beginnen mit einer korrumpierten Sequenz – die häufig maskierte, ersetzte oder unsichere Token enthält – und verfeinern wiederholt mehrere Positionen, bis der Text kohärent wird. Dieser Ansatz kombiniert Ideen aus der Sprachmodellierung und von Diffusion-Modellen und bietet eine Alternative zur herkömmlichen Generierung des nächsten Tokens.

Link to this sectionWie Diffusion-Sprachmodelle funktionieren#

Text wird zunächst durch Tokenisierung in Wörter, Subwörter, Zeichen oder andere diskrete Einheiten unterteilt. Während des Trainings entfernt ein Vorwärts-Korruptionsprozess schrittweise Informationen aus Token-Sequenzen. Je nach Implementierung können Token durch Maskierungssymbole, abgetastete Alternativen oder verrauschte kontinuierliche Darstellungen, sogenannte Embeddings, ersetzt werden.

Das Modell lernt den umgekehrten Prozess: sauberere Versionen korrupter Sequenzen vorherzusagen. Zur Inferenzzeit beginnt es mit einem stark maskierten oder verrauschten Block und führt mehrere Verfeinerungsschritte aus. Frühe Schritte etablieren eine breite Bedeutung und Struktur, während spätere Schritte Vokabular, Grammatik, Formatierung und lokale Konsistenz korrigieren.

Viele Diffusion-Sprachmodelle verwenden einen Transformer zur Verarbeitung der Sequenz. Transformer sind für diese Aufgabe gut geeignet, da ihr Aufmerksamkeitsmechanismus jedes Token mit dem umliegenden Kontext in Beziehung setzen kann. Die PyTorch Transformer-Dokumentation bietet eine nützliche Übersicht über diese zugrunde liegende Architektur.

Im Gegensatz zu einem festen Lückentextsystem kann die Diffusionsgenerierung Vorhersagen wiederholt überdenken. Ein während eines Schritts ausgewähltes Token ist nicht unbedingt permanent; spätere Iterationen können es revidieren, wenn der Rest der Sequenz einen besseren Kontext liefert. Die Übersicht zur Textdiffusion von Google DeepMind veranschaulicht dieses blockbasierte, iterative Generierungsmuster.

Link to this sectionDiffusion-Modelle im Vergleich zu verwandten Konzepten#

Mehrere eng verwandte Begriffe beschreiben unterschiedliche Ziele oder Architekturen:

  • Autoregressive große Sprachmodelle generieren Token in einer Sequenz, wobei jede Vorhersage von früheren Ausgaben abhängt. Dieser kausale Prozess wird im Tutorial zur autoregressiven Textgenerierung von TensorFlow demonstriert. Diffusion-Modelle können stattdessen viele Positionen während jedes Verfeinerungsschritts aktualisieren.
  • Maskierte Sprachmodelle sagen bewusst versteckte Token mithilfe von Kontext auf beiden Seiten voraus. Das Keras-Beispiel für maskierte Sprachmodellierung demonstriert dieses Trainingsziel. Diffusion-Sprachmodelle erweitern diese Idee zu einem vollständigen Generierungsprozess mit mehreren Korruptionsstufen und Entrauschungsiterationen.
  • Stable Diffusion ist ein Bilderzeugungssystem und kein großes Sprachmodell. Die Stable Diffusion-Bilddienste von Stability AI generieren und bearbeiten visuelle Inhalte, während Diffusion-Sprachmodelle auf Text-Token oder deren Darstellungen operieren.
  • Diffusion Transformers beschreiben die Verwendung von Transformern innerhalb von Diffusionssystemen, typischerweise für die Bild- oder Videogenerierung. Ein Diffusion-Sprachmodell ist durch sein Textgenerierungsziel definiert und nicht allein durch seine neuronale Netzwerkarchitektur.

Link to this sectionPraxisanwendungen#

Eine konkrete Anwendung ist die Dokumenten- und Codebearbeitung. Anstatt Text hinter einem Cursor anzuhängen, kann ein Diffusion-Sprachmodell einen gesamten Entwurf oder einen ausgewählten Bereich verfeinern. Beispielsweise könnte es eine fehlende Funktion rekonstruieren und gleichzeitig Variablennamen, Importe und Kommentare im gesamten Block überarbeiten. Die Fähigkeit, sowohl den vorherigen als auch den nachfolgenden Kontext zu nutzen, ist wertvoll, wenn Korrekturen an einer Stelle eine andere beeinflussen.

Eine zweite Anwendung ist die multimodale Analyse. Ein Vision-System kann faktische Informationen aus einem Bild extrahieren, wonach ein Diffusion-Sprachmodell iterativ einen Bericht, eine Bildunterschrift oder eine Antwort verfassen kann, die auf diesen Beobachtungen basiert. Beispielsweise kann die Objekterkennung Fahrzeuge und Personen in einer Verkehrsszene identifizieren, bevor die Sprachkomponente eine Vorfallszusammenfassung entwirft.

Der folgende Workflow verwendet Ultralytics YOLO26, um strukturierten visuellen Kontext für die nachgeschaltete Sprachgenerierung zu erstellen:

from ultralytics import YOLO

# Run object detection on a sample image
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]

# Convert detections into compact language-model context
detections = result.summary()
object_names = sorted({item["name"] for item in detections})

visual_context = ", ".join(object_names)
print(visual_context)

Der YOLO-Vorhersageworkflow gibt strukturierte Ausgaben zurück, während die Results.summary()-Methode Erkennungen in Wörterbücher konvertiert, die einfacher an eine Sprach-Pipeline übergeben werden können. Diese Trennung ermöglicht es dem Vision-Modell, fundierte Beobachtungen zu liefern, während das Sprachmodell die iterative Zusammensetzung übernimmt.

Link to this sectionVorteile, Einschränkungen und praktische Hinweise#

Diffusion-Sprachmodelle können mehrere Token parallel vorschlagen, frühere Entscheidungen revidieren und das Einfügen (Infilling) oder die eingeschränkte Bearbeitung auf natürliche Weise unterstützen. Die parallele Vorhersage garantiert jedoch keine geringere Latenz von Ende zu Ende: Die Generierung erfordert nach wie vor mehrere Entrauschungsschritte, und die Geschwindigkeit hängt von Sequenzlänge, Modellgröße, Hardware und Sampling-Strategie ab.

Text ist zudem diskret, wodurch eine schrittweise Korruption weniger natürlich ist als das Hinzufügen von Rauschen zu kontinuierlichen Bildpixeln. Schlecht konfigurierte Systeme neigen möglicherweise zu Wiederholungen, lassen erforderliche Details aus, ändern korrekten Text unnötig oder haben Schwierigkeiten, die Ausgabelänge zu bestimmen.

Teams sollten Aufgabengenauigkeit, Faktizität, Bearbeitungsstabilität, Latenz und Ressourcennutzung anhand repräsentativer Prompts evaluieren. Die Google Cloud-Leitlinien zur Evaluierung generativer KI empfehlen, automatisierte Metriken mit menschlicher Bewertung zu kombinieren, da die Sprachqualität kontextabhängig ist. Wirkungsvolle Bereitstellungen sollten außerdem einem strukturierten Prozess wie dem NIST AI Risk Management Framework folgen.

Für visuelle Anwendungen unterstützt die Ultralytics Platform die Datensatzannotation, das Modelltraining, die Bereitstellung und das Monitoring, wodurch Teams die Wahrnehmungskomponente aufbauen können, die nachgeschaltete diffusionsbasierte Sprach-Workflows unterstützt.

Explore solutions

Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr

Lass uns gemeinsam die Zukunft der KI bauen!

Beginne deine Reise mit der Zukunft des maschinellen Lernens