YOLO Vision 2026:
Volver al glosario de Ultralytics

Diffusion Language Models

Aprende cómo los modelos de lenguaje de difusión generan y editan texto mediante un proceso iterativo de eliminación de ruido, con información sobre Transformers, aplicaciones, ventajas y limitaciones.

Los modelos de lenguaje por difusión son modelos generativos que producen o editan texto mediante un proceso iterativo de eliminación de ruido, en lugar de generar cada token estrictamente de izquierda a derecha. Comienzan con una secuencia dañada —que a menudo contiene tokens enmascarados, reemplazados o inciertos— y refinan repetidamente varias posiciones hasta que el texto resulta coherente. Este enfoque combina ideas del modelado del lenguaje y los modelos de difusión, y ofrece una alternativa a la generación convencional del siguiente token.

Cómo funcionan los modelos de lenguaje por difusión#

Primero, el texto se divide mediante la tokenización en palabras, subpalabras, caracteres u otras unidades discretas. Durante el entrenamiento, un proceso de corrupción directa elimina gradualmente información de las secuencias de tokens. Según la implementación, los tokens pueden reemplazarse por símbolos de máscara, alternativas muestreadas o representaciones continuas ruidosas denominadas embeddings.

El modelo aprende el proceso inverso: predecir versiones más limpias de las secuencias dañadas. Durante la inferencia, comienza con un bloque muy enmascarado o ruidoso y realiza varios pasos de refinamiento. Los primeros pasos establecen el significado y la estructura generales, mientras que los posteriores corrigen el vocabulario, la gramática, el formato y la coherencia local.

Muchos modelos de lenguaje por difusión utilizan un Transformer para procesar la secuencia. Los Transformer se adaptan bien a esta tarea porque su mecanismo de atención puede relacionar cada token con el contexto circundante. La documentación de PyTorch Transformer ofrece una visión general útil de esta arquitectura subyacente.

A diferencia de un sistema fijo de completar espacios en blanco, la generación por difusión puede reconsiderar repetidamente las predicciones. Un token seleccionado durante un paso no es necesariamente permanente; las iteraciones posteriores pueden revisarlo cuando el resto de la secuencia proporciona un contexto mejor. La visión general de la difusión de texto de Google DeepMind ilustra este patrón de generación iterativa a nivel de bloque.

Modelos de difusión frente a conceptos relacionados#

Varios términos estrechamente relacionados describen objetivos o arquitecturas diferentes:

  • Los modelos de lenguaje grandes autorregresivos generan tokens en secuencia, condicionando cada predicción a la salida anterior. Este proceso causal se muestra en el tutorial de generación de texto autorregresiva de TensorFlow. En cambio, los modelos de difusión pueden actualizar muchas posiciones durante cada paso de refinamiento.
  • Los modelos de lenguaje enmascarados predicen tokens ocultos deliberadamente utilizando el contexto de ambos lados. El ejemplo de modelado del lenguaje enmascarado de Keras muestra este objetivo de entrenamiento. Los modelos de lenguaje por difusión amplían esta idea a un proceso de generación completo con múltiples niveles de corrupción e iteraciones de eliminación de ruido.
  • Stable Diffusion es un sistema de generación de imágenes, no un modelo de lenguaje grande. Los servicios de imágenes de Stable Diffusion de Stability AI generan y editan contenido visual, mientras que los modelos de lenguaje por difusión operan sobre tokens de texto o sus representaciones.
  • Diffusion Transformers describe el uso de Transformer dentro de sistemas de difusión, normalmente para la generación de imágenes o vídeos. Un modelo de lenguaje por difusión se define por su objetivo de generación de texto, no únicamente por la arquitectura de su red neuronal.

Aplicaciones en el mundo real#

Una aplicación concreta es la edición de documentos y código. En lugar de añadir texto después de un cursor, un modelo de lenguaje por difusión puede refinar un borrador completo o un fragmento seleccionado. Por ejemplo, podría reconstruir una función ausente mientras revisa los nombres de variables, las importaciones y los comentarios de todo el bloque. La capacidad de utilizar tanto el contexto anterior como el posterior resulta valiosa cuando las correcciones en una ubicación afectan a otra.

Una segunda aplicación es el análisis multimodal. Un sistema de visión puede extraer información factual de una imagen, tras lo cual un modelo de lenguaje por difusión puede componer iterativamente un informe, un pie de imagen o una respuesta fundamentada en esas observaciones. Por ejemplo, la detección de objetos puede identificar vehículos y personas en una escena de tráfico antes de que el componente de lenguaje redacte un resumen del incidente.

El siguiente flujo de trabajo utiliza Ultralytics YOLO26 para crear contexto visual estructurado destinado a la generación de lenguaje posterior:

from ultralytics import YOLO

# Run object detection on a sample image
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]

# Convert detections into compact language-model context
detections = result.summary()
object_names = sorted({item["name"] for item in detections})

visual_context = ", ".join(object_names)
print(visual_context)

El flujo de trabajo de predicción de YOLO devuelve salidas estructuradas, mientras que el método Results.summary() convierte las detecciones en diccionarios que resulta más sencillo pasar a una canalización de lenguaje. Esta separación permite que el modelo de visión proporcione observaciones fundamentadas, mientras que el modelo de lenguaje se encarga de la composición iterativa.

Ventajas, limitaciones y recomendaciones prácticas#

Los modelos de lenguaje por difusión pueden proponer varios tokens en paralelo, revisar elecciones anteriores y admitir de forma natural el relleno de contenido o la edición restringida. Sin embargo, la predicción en paralelo no garantiza una latencia de extremo a extremo menor: la generación sigue requiriendo varios pasos de eliminación de ruido, y la velocidad depende de la longitud de la secuencia, el tamaño del modelo, el hardware y la estrategia de muestreo.

El texto también es discreto, por lo que la corrupción gradual resulta menos natural que añadir ruido a píxeles de imagen continuos. Los sistemas configurados incorrectamente pueden producir repeticiones, omitir detalles obligatorios, cambiar texto correcto innecesariamente o tener dificultades para determinar la longitud de salida.

Los equipos deben evaluar la precisión de la tarea, la factualidad, la estabilidad de la edición, la latencia y el uso de recursos con prompts representativos. La guía de Google Cloud sobre la evaluación de la IA generativa recomienda combinar métricas automatizadas con evaluación humana, porque la calidad del lenguaje depende del contexto. Las implementaciones de alto impacto también deben seguir un proceso estructurado, como el Marco de gestión de riesgos de IA del NIST.

Para aplicaciones visuales, la Ultralytics Platform admite la anotación de datasets, el entrenamiento de modelos, la implementación y la monitorización, lo que ayuda a los equipos a crear el componente de percepción capaz de fundamentar flujos de trabajo de lenguaje posteriores basados en difusión.

Explore solutions

Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu recorrido hacia el futuro del aprendizaje automático