YOLO Vision 2026:
Zurück zum Glossar von Ultralytics

Diffusion Language Models

Lerne, wie Diffusionssprachmodelle Texte durch iteratives Entrauschen erzeugen und bearbeiten, und erhalte Einblicke in Transformer, Anwendungen, Vorteile und Einschränkungen.

Sprachmodelle auf Diffusionsbasis sind generative Modelle, die Text durch iteratives Entrauschen erzeugen oder bearbeiten, anstatt jedes Token strikt von links nach rechts zu generieren. Sie beginnen mit einer beschädigten Sequenz, die häufig maskierte, ersetzte oder unsichere Token enthält, und verfeinern wiederholt mehrere Positionen, bis der Text schlüssig wird. Dieser Ansatz verbindet Konzepte aus der Sprachmodellierung und Diffusionsmodellen und bietet eine Alternative zur herkömmlichen Generierung des jeweils nächsten Tokens.

Funktionsweise von Sprachmodellen auf Diffusionsbasis#

Zunächst wird Text durch Tokenisierung in Wörter, Wortteile, Zeichen oder andere diskrete Einheiten aufgeteilt. Während des Trainings entfernt ein schrittweiser Vorwärtsprozess der Beschädigung nach und nach Informationen aus Tokenfolgen. Je nach Implementierung können Token durch Maskensymbole, zufällig ausgewählte Alternativen oder verrauschte kontinuierliche Repräsentationen ersetzt werden, die als Embeddings bezeichnet werden.

Das Modell lernt den umgekehrten Prozess: Es sagt sauberere Versionen beschädigter Sequenzen voraus. Zum Zeitpunkt der Inferenz beginnt es mit einem stark maskierten oder verrauschten Block und führt mehrere Verfeinerungsschritte durch. In den frühen Schritten werden die übergeordnete Bedeutung und Struktur festgelegt, während spätere Schritte Wortwahl, Grammatik, Formatierung und lokale Konsistenz korrigieren.

Viele Sprachmodelle auf Diffusionsbasis verwenden einen Transformer, um die Sequenz zu verarbeiten. Transformer eignen sich für diese Aufgabe gut, weil ihr Aufmerksamkeitsmechanismus jedes Token mit dem umgebenden Kontext in Beziehung setzen kann. Die PyTorch Transformer-Dokumentation bietet einen nützlichen Überblick über diese zugrunde liegende Architektur.

Im Gegensatz zu einem starren Lückentextsystem kann die Diffusionsgenerierung Vorhersagen wiederholt neu bewerten. Ein in einem Schritt ausgewähltes Token ist nicht zwangsläufig endgültig; spätere Iterationen können es ändern, wenn der Rest der Sequenz einen besseren Kontext liefert. Die Übersicht von Google DeepMind zur Textdiffusion veranschaulicht dieses blockweise, iterative Generierungsmuster.

Diffusionsmodelle im Vergleich zu verwandten Konzepten#

Mehrere eng verwandte Begriffe bezeichnen unterschiedliche Zielsetzungen oder Architekturen:

  • Autoregressive große Sprachmodelle generieren Token in einer Sequenz, wobei jede Vorhersage vom zuvor erzeugten Output abhängt. Dieser kausale Prozess wird im Tutorial zur autoregressiven Textgenerierung von TensorFlow demonstriert. Diffusionsmodelle können stattdessen bei jedem Verfeinerungsschritt viele Positionen aktualisieren.
  • Maskierte Sprachmodelle sagen absichtlich ausgeblendete Token mithilfe des Kontexts auf beiden Seiten voraus. Das Keras-Beispiel zur maskierten Sprachmodellierung veranschaulicht diese Trainingsaufgabe. Sprachmodelle auf Diffusionsbasis erweitern diese Idee zu einem vollständigen Generierungsprozess mit mehreren Beschädigungsstufen und Entrauschungsiterationen.
  • Stable Diffusion ist ein Bildgenerierungssystem und kein großes Sprachmodell. Die Stable-Diffusion-Bilddienste von Stability AI generieren und bearbeiten visuelle Inhalte, während Sprachmodelle auf Diffusionsbasis mit Text-Token oder deren Repräsentationen arbeiten.
  • Diffusions-Transformer bezeichnet den Einsatz von Transformern in Diffusionssystemen, üblicherweise zur Bild- oder Videogenerierung. Ein Sprachmodell auf Diffusionsbasis wird durch seine Zielsetzung der Textgenerierung definiert, nicht allein durch seine neuronale Netzwerkarchitektur.

Anwendungen in der Praxis#

Eine konkrete Anwendung ist die Bearbeitung von Dokumenten und Code. Anstatt Text hinter einem Cursor anzuhängen, kann ein Sprachmodell auf Diffusionsbasis einen vollständigen Entwurf oder einen ausgewählten Textabschnitt verfeinern. Beispielsweise könnte es eine fehlende Funktion rekonstruieren und dabei Variablennamen, Importe und Kommentare im gesamten Block überarbeiten. Die Möglichkeit, sowohl den vorausgehenden als auch den nachfolgenden Kontext zu nutzen, ist wertvoll, wenn sich Korrekturen an einer Stelle auf eine andere auswirken.

Eine zweite Anwendung ist die multimodale Analyse. Ein Bildverarbeitungssystem kann aus einem Bild sachliche Informationen extrahieren. Anschließend kann ein Sprachmodell auf Diffusionsbasis iterativ einen Bericht, eine Bildunterschrift oder eine auf diesen Beobachtungen basierende Antwort formulieren. Beispielsweise kann die Objekterkennung Fahrzeuge und Personen in einer Verkehrsszene identifizieren, bevor die Sprachkomponente eine Zusammenfassung des Vorfalls erstellt.

Der folgende Arbeitsablauf verwendet Ultralytics YOLO26, um strukturierten visuellen Kontext für die nachgelagerte Sprachgenerierung zu erstellen:

from ultralytics import YOLO

# Run object detection on a sample image
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]

# Convert detections into compact language-model context
detections = result.summary()
object_names = sorted({item["name"] for item in detections})

visual_context = ", ".join(object_names)
print(visual_context)

Der YOLO-Vorhersage-Workflow gibt strukturierte Ausgaben zurück, während die Methode Results.summary() Erkennungen in Dictionaries umwandelt, die sich leichter an eine Sprachpipeline übergeben lassen. Durch diese Trennung kann das Bildverarbeitungsmodell fundierte Beobachtungen liefern, während das Sprachmodell die iterative Zusammenstellung übernimmt.

Vorteile, Einschränkungen und praktische Hinweise#

Sprachmodelle auf Diffusionsbasis können mehrere Token parallel vorschlagen, frühere Entscheidungen überarbeiten und Infill oder eingeschränkte Bearbeitung auf natürliche Weise unterstützen. Parallele Vorhersagen garantieren jedoch keine geringere Latenz von Ende zu Ende: Die Generierung erfordert weiterhin mehrere Entrauschungsschritte, und die Geschwindigkeit hängt von Sequenzlänge, Modellgröße, Hardware und Sampling-Strategie ab.

Text ist außerdem diskret, sodass eine schrittweise Beschädigung weniger natürlich ist als das Hinzufügen von Rauschen zu kontinuierlichen Bildpixeln. Schlecht konfigurierte Systeme können Wiederholungen erzeugen, erforderliche Details auslassen, korrekten Text unnötig ändern oder Schwierigkeiten haben, die Ausgabelänge zu bestimmen.

Teams sollten Aufgabengenauigkeit, Faktentreue, Bearbeitungsstabilität, Latenz und Ressourcenverbrauch anhand repräsentativer Prompts bewerten. Die Leitlinien von Google Cloud zur Bewertung generativer KI empfehlen, automatisierte Metriken mit einer menschlichen Bewertung zu kombinieren, da die Qualität von Sprache vom Kontext abhängt. Für Anwendungen mit hoher Auswirkung sollte außerdem ein strukturierter Prozess wie das NIST AI Risk Management Framework befolgt werden.

Für visuelle Anwendungen unterstützt die Ultralytics Platform die Annotation von Datensätzen, das Training, die Bereitstellung und die Überwachung von Modellen. So können Teams die Wahrnehmungskomponente entwickeln, die nachgelagerte Sprach-Workflows auf Diffusionsbasis mit fundiertem Kontext versorgt.

Explore solutions

Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens