Diffusion Language Models
Aprende cómo los modelos de lenguaje de difusión generan y editan texto mediante un proceso iterativo de eliminación de ruido, con información sobre Transformers, aplicaciones, ventajas y limitaciones.
Los modelos de lenguaje por difusión son modelos generativos que producen o editan texto mediante un proceso iterativo de eliminación de ruido, en lugar de generar cada token estrictamente de izquierda a derecha. Comienzan con una secuencia dañada —que a menudo contiene tokens enmascarados, reemplazados o inciertos— y refinan repetidamente varias posiciones hasta que el texto resulta coherente. Este enfoque combina ideas del modelado del lenguaje y los modelos de difusión, y ofrece una alternativa a la generación convencional del siguiente token.
Cómo funcionan los modelos de lenguaje por difusión#
Primero, el texto se divide mediante la tokenización en palabras, subpalabras, caracteres u otras unidades discretas. Durante el entrenamiento, un proceso de corrupción directa elimina gradualmente información de las secuencias de tokens. Según la implementación, los tokens pueden reemplazarse por símbolos de máscara, alternativas muestreadas o representaciones continuas ruidosas denominadas embeddings.
El modelo aprende el proceso inverso: predecir versiones más limpias de las secuencias dañadas. Durante la inferencia, comienza con un bloque muy enmascarado o ruidoso y realiza varios pasos de refinamiento. Los primeros pasos establecen el significado y la estructura generales, mientras que los posteriores corrigen el vocabulario, la gramática, el formato y la coherencia local.
Muchos modelos de lenguaje por difusión utilizan un Transformer para procesar la secuencia. Los Transformer se adaptan bien a esta tarea porque su mecanismo de atención puede relacionar cada token con el contexto circundante. La documentación de PyTorch Transformer ofrece una visión general útil de esta arquitectura subyacente.
A diferencia de un sistema fijo de completar espacios en blanco, la generación por difusión puede reconsiderar repetidamente las predicciones. Un token seleccionado durante un paso no es necesariamente permanente; las iteraciones posteriores pueden revisarlo cuando el resto de la secuencia proporciona un contexto mejor. La visión general de la difusión de texto de Google DeepMind ilustra este patrón de generación iterativa a nivel de bloque.
Modelos de difusión frente a conceptos relacionados#
Varios términos estrechamente relacionados describen objetivos o arquitecturas diferentes:
- Los modelos de lenguaje grandes autorregresivos generan tokens en secuencia, condicionando cada predicción a la salida anterior. Este proceso causal se muestra en el tutorial de generación de texto autorregresiva de TensorFlow. En cambio, los modelos de difusión pueden actualizar muchas posiciones durante cada paso de refinamiento.
- Los modelos de lenguaje enmascarados predicen tokens ocultos deliberadamente utilizando el contexto de ambos lados. El ejemplo de modelado del lenguaje enmascarado de Keras muestra este objetivo de entrenamiento. Los modelos de lenguaje por difusión amplían esta idea a un proceso de generación completo con múltiples niveles de corrupción e iteraciones de eliminación de ruido.
- Stable Diffusion es un sistema de generación de imágenes, no un modelo de lenguaje grande. Los servicios de imágenes de Stable Diffusion de Stability AI generan y editan contenido visual, mientras que los modelos de lenguaje por difusión operan sobre tokens de texto o sus representaciones.
- Diffusion Transformers describe el uso de Transformer dentro de sistemas de difusión, normalmente para la generación de imágenes o vídeos. Un modelo de lenguaje por difusión se define por su objetivo de generación de texto, no únicamente por la arquitectura de su red neuronal.
Aplicaciones en el mundo real#
Una aplicación concreta es la edición de documentos y código. En lugar de añadir texto después de un cursor, un modelo de lenguaje por difusión puede refinar un borrador completo o un fragmento seleccionado. Por ejemplo, podría reconstruir una función ausente mientras revisa los nombres de variables, las importaciones y los comentarios de todo el bloque. La capacidad de utilizar tanto el contexto anterior como el posterior resulta valiosa cuando las correcciones en una ubicación afectan a otra.
Una segunda aplicación es el análisis multimodal. Un sistema de visión puede extraer información factual de una imagen, tras lo cual un modelo de lenguaje por difusión puede componer iterativamente un informe, un pie de imagen o una respuesta fundamentada en esas observaciones. Por ejemplo, la detección de objetos puede identificar vehículos y personas en una escena de tráfico antes de que el componente de lenguaje redacte un resumen del incidente.
El siguiente flujo de trabajo utiliza Ultralytics YOLO26 para crear contexto visual estructurado destinado a la generación de lenguaje posterior:
from ultralytics import YOLO
# Run object detection on a sample image
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Convert detections into compact language-model context
detections = result.summary()
object_names = sorted({item["name"] for item in detections})
visual_context = ", ".join(object_names)
print(visual_context)El flujo de trabajo de predicción de YOLO devuelve salidas estructuradas, mientras que el método Results.summary() convierte las detecciones en diccionarios que resulta más sencillo pasar a una canalización de lenguaje. Esta separación permite que el modelo de visión proporcione observaciones fundamentadas, mientras que el modelo de lenguaje se encarga de la composición iterativa.
Ventajas, limitaciones y recomendaciones prácticas#
Los modelos de lenguaje por difusión pueden proponer varios tokens en paralelo, revisar elecciones anteriores y admitir de forma natural el relleno de contenido o la edición restringida. Sin embargo, la predicción en paralelo no garantiza una latencia de extremo a extremo menor: la generación sigue requiriendo varios pasos de eliminación de ruido, y la velocidad depende de la longitud de la secuencia, el tamaño del modelo, el hardware y la estrategia de muestreo.
El texto también es discreto, por lo que la corrupción gradual resulta menos natural que añadir ruido a píxeles de imagen continuos. Los sistemas configurados incorrectamente pueden producir repeticiones, omitir detalles obligatorios, cambiar texto correcto innecesariamente o tener dificultades para determinar la longitud de salida.
Los equipos deben evaluar la precisión de la tarea, la factualidad, la estabilidad de la edición, la latencia y el uso de recursos con prompts representativos. La guía de Google Cloud sobre la evaluación de la IA generativa recomienda combinar métricas automatizadas con evaluación humana, porque la calidad del lenguaje depende del contexto. Las implementaciones de alto impacto también deben seguir un proceso estructurado, como el Marco de gestión de riesgos de IA del NIST.
Para aplicaciones visuales, la Ultralytics Platform admite la anotación de datasets, el entrenamiento de modelos, la implementación y la monitorización, lo que ayuda a los equipos a crear el componente de percepción capaz de fundamentar flujos de trabajo de lenguaje posteriores basados en difusión.






