Modelos de difusión continua de lenguaje (CDLM): qué son y por qué han vuelto en 2026
Generar texto quitando ruido en lugar de predecir token a token: esa es la idea de los CDLM. Desaparecieron de la investigación en 2023, y este año han vuelto con una fuerza que pocos esperaban.
En resumen
- Los CDLM generan texto quitando ruido en vez de token a token. Desaparecieron en 2023 y en 2026 han vuelto con papers que rivalizan con la difusión discreta.
- Los modelos que usas a diario (ChatGPT, Claude, Gemini) son autoregresivos: generan el texto palabra a palabra, token a token, y cada token condiciona al siguiente.
- Continuous Diffusion Language Model: un modelo de lenguaje que genera texto mediante difusión continua,
Si me hubieras preguntado a principios de año por los modelos de difusión continua de lenguaje, te habría dicho que eran una curiosidad histórica. En 2023 la comunidad los enterró: la difusión discreta había ganado, y nadie quería volver atrás. Pues bien, en agosto de 2026 la historia ha dado media vuelta. Sander Dieleman, investigador de DeepMind y uno de los padres de esta línea, acaba de publicar un ensayo de 44 minutos de lectura que lo confirma: los CDLM están de vuelta, y esta vez con argumentos serios.
La señal más clara es lo que dicen los propios títulos de los papers de 2026: "La difusión continua escala de forma competitiva con la difusión discreta para lenguaje" (RePlaid) y "La difusión continua rivaliza con la discreta en modelado de lenguaje" (LangFlow). Hace dos años, una afirmación así se habría tomado a broma. Y no son casos aislados: la primavera de 2026 trajo una pequeña explosión de trabajos en este espacio.
¿Qué diferencia a un modelo de difusión de uno autoregresivo?
Los modelos que usas a diario (ChatGPT, Claude, Gemini) son autoregresivos: generan el texto palabra a palabra, token a token, y cada token condiciona al siguiente. Es una receta increíblemente escalable, pero tiene un coste: la generación es inherentemente secuencial y lenta.
Un modelo de difusión hace lo contrario. En vez de predecir, corrompe: durante el entrenamiento añade ruido poco a poco hasta destruir el texto por completo. Luego aprende a invertir ese proceso, a quitar el ruido. En inferencia, parte de ruido puro y lo va limpiando hasta que emerge el texto. En imágenes y vídeo esto ya es el estándar (Midjourney, Sora, Stable Diffusion). En lenguaje, la historia ha sido más tortuosa, porque el texto no es un continuo: son categorías discretas, tokens, y el ruido gaussiano no encaja de forma natural con ellos.
Ahí nace la división que lo explica todo: la difusión discreta (DDLM) corrompe los tokens directamente, sustituyéndolos por tokens aleatorios o por una máscara. La difusión continua (CDLM) convierte primero los tokens en vectores numéricos (embeddings) y aplica el ruido gaussiano clásico sobre ese espacio continuo. En palabras de Dieleman, es solo una cuestión de cambiar el orden de las operaciones: primero se embebe y luego se corrompe, en vez de corromper y luego embeber.
¿Por qué desaparecieron los CDLM en 2023?
La historia tiene tres actos. En 2021 llegaron los primeros modelos de difusión discretos (multinomial diffusion, D3PM, SUNDAE). En 2022 apareció la oleada continua: Diffusion-LM, DiffuSeq, SSD-LM, GENIE, y los propios SED y CDCD de Dieleman. La idea era elegante: reutilizar toda la maquinaria de difusión continua que estaba arrasando en imagen y audio.
Y entonces, a finales de 2023, la extinción. Dos factores la explican. Primero, el momento ChatGPT: la investigación dejó de perseguir la elegancia teórica y pasó a perseguir rendimiento bruto a escala. Segundo, los números no acompañaban: en mayo de 2023, Gulrajani y Hashimoto midieron el modelo continuo Plaid-1B y resultó 64 veces menos eficiente de entrenar que un autoregresivo. Cuando la comunidad entera vivía obsesionada con la eficiencia de entrenamiento (la era Chinchilla), un método casi dos órdenes de magnitud peor estaba muerto antes de empezar. Todo lo que se publicó a partir de 2024 era difusión discreta.
¿Qué ha pasado en 2025 y 2026 para que vuelvan?
El cambio no fue de golpe. En la segunda mitad de 2025 empezaron a aparecer métodos híbridos que mezclaban lo discreto y lo continuo: Sahoo y colegas descubrieron una "dualidad de difusión" entre el ruido gaussiano continuo y la corrupción discreta uniforme; después vinieron CADD, CCDD y CANDI, cada uno con su receta para combinar ambas familias. En paralelo, los flow maps (la integral de un modelo de difusión, capaz de ir del ruido a los datos en muy pocos pasos) maduraron como marco teórico.
Con esas piezas sobre la mesa, 2026 ha sido la explosión. A principios de año, tres trabajos llevaron los flow maps al terreno categórico (Categorical Flow Maps, Flow Map Language Models, Discrete Flow Maps). En primavera, la "explosión cámbrica": LangFlow, flujos esféricos e hiperesféricos, LDLM, ELF, CoBit, RePlaid. Cada uno recupera una receta de 2022 y la moderniza con embeddings contextuales, schedules de ruido adaptativos y escalado real. La tabla resume los más relevantes:
| Paper (2026) | Enfoque | Idea clave |
|---|---|---|
| RePlaid | Basado en likelihood | Moderniza Plaid (2023) y defiende que escala competitivamente con lo discreto |
| LangFlow | Flow maps + embeddings normalizados | Rivaliza con la difusión discreta en modelado de lenguaje |
| LDLM / ELF | Difusión latente | Embeddings contextuales aprendidos o pre-entrenados y congelados |
| Spherical / Hyperspherical flows | Corrupción en la esfera | Restringen el ruido a la esfera unitaria para mejorar estabilidad |
| CoBit | Embeddings de bits | Extiende Analog Bits al lenguaje |
| Categorical / Discrete Flow Maps | Flow maps discretos | Llevan la destilación de pasos al terreno categórico |
¿Por qué ahora sí tiene sentido?
Dieleman apunta a una razón principal: la destilabilidad. Con los flow maps, un modelo continuo puede aprender a generar en muy pocos pasos, incluso en uno solo, y aun así capturar las correlaciones entre tokens. En la difusión discreta, si generas todo en un paso, los tokens salen necesariamente independientes entre sí: el modelo es incapaz de captar que "inteligencia" y "artificial" suelen ir juntas. Ese muro hace que destilar los DDLM sea un dolor de cabeza.
La destilación a pocos pasos no es solo velocidad: también abre la puerta a guiar la generación con recompensas y a técnicas de post-entrenamiento que antes eran casi imposibles con difusión. Y hay un factor cultural: los métodos continuos se han vuelto mucho más simples de explicar y usar. Ya no hace falta dominar score matching ni ecuaciones diferenciales; basta con entender interpolación lineal entre datos y ruido. Eso ha bajado la barrera de entrada para un montón de grupos de investigación.
No es que lo discreto haya muerto, ojo. DiffusionGemma (Google DeepMind) y Nemotron Diffusion (NVIDIA) han llevado la difusión discreta al gran público con pesos abiertos, y en técnicas como el speculative decoding ya se usa difusión discreta como modelo borrador para acelerar a los autoregresivos. La pregunta ya no es si la difusión sustituirá a la autoregresión, sino cómo convivirán las tres familias.
¿Cómo funcionan por dentro? Los cuatro ingredientes
Si te pica la curiosidad técnica, todo CDLM se reduce a cuatro decisiones:
- Estrategia de embeddings: cómo convertir tokens en vectores. One-hot explícito, embeddings pre-entrenados (de BERT o de un LLM autoregresivo), contextuales (el vector de un token depende de su contexto), o incluso secuencias de bits.
- Función de pérdida: normalmente entropía cruzada sobre el espacio de tokens, la misma que usan los autoregresivos.
- Noise schedule: cómo se reparte el ruido a lo largo del proceso de corrupción. Ahí está el conocido problema de la "disonancia temporal": con vocabularios grandes, la identidad de cada token se pierde rápido, pero el orden relativo entre tokens tarda mucho más en degradarse.
- Self-conditioning: el truco que aparece en casi todos los papers y que más impacto tiene en la calidad. El modelo se alimenta de su propia estimación del dato limpio mientras denoisa.
¿Van a sustituir a ChatGPT y compañía?
No lo creo, al menos no a corto plazo. Y el propio Dieleman tampoco lo ve tan claro: lo más probable es que autoregresión, difusión discreta y difusión continua coexistan, cada una donde rinde mejor. Lo que sí ha cambiado es el consenso: durante años se dio por hecho que lo continuo no escalaba. Trabajos como Cola DLM, que genera por bloques con un prior de flow matching sobre un espacio latente aprendido, demuestran que el enfoque latente sigue teniendo recorrido. Y hay una vía que me parece la más interesante de todas: la integración multimodal. Si imágenes, vídeo y audio ya usan difusión continua, un modelo de lenguaje continuo encajaría en un mismo sistema sin fricción. Eso sí, Dieleman avisa: el reto real no es unificar paradigmas, sino salvar el abismo semántico entre los tokens abstractos del lenguaje y las representaciones sensoriales de bajo nivel.
Mi lectura personal: este resurgimiento es la prueba de que en IA los veredictos nunca son definitivos. En 2023 "todo el mundo sabía" que lo continuo era un callejón sin salida. Dos años y medio después, los títulos de los papers dicen lo contrario. La lección para quien siga este mundillo: cuando un consenso se vuelve demasiado cómodo, es el momento de mirar qué quedó enterrado por el camino.
Preguntas frecuentes
¿Qué significa CDLM?
Continuous Diffusion Language Model: un modelo de lenguaje que genera texto mediante difusión continua, aplicando y revirtiendo ruido gaussiano sobre embeddings de tokens en lugar de predecir token a token.
¿Son más rápidos que los modelos autoregresivos como GPT?
Potencialmente sí. La gran ventaja de 2026 es la destilación: los flow maps permiten generar en muy pocos pasos capturando las correlaciones entre tokens, algo que la difusión discreta no logra en un solo paso. Aún no hay un producto comercial que lo demuestre a gran escala, pero los papers apuntan en esa dirección.
¿Puedo probar un CDLM hoy?
No hay todavía un "ChatGPT de difusión continua" disponible al público. Lo más cercano en difusión de lenguaje son los DDLM de pesos abiertos como DiffusionGemma, que es difusión discreta, no continua. Los CDLM de 2026 son investigación académica.
¿Los modelos de difusión van a sustituir a los LLM actuales?
Lo más probable es que coexistan. La difusión discreta ya se usa para acelerar autoregresivos (speculative decoding) y la continua podría dominar en generación multimodal. Sustituir la autoregresión por completo no es el escenario que maneja nadie serio a corto plazo.
Los CDLM vuelven porque resolvieron su talón de Aquiles (la eficiencia) con las herramientas equivocadas en 2023 y ahora tienen las correctas: flow maps, mejores embeddings y la motivación económica de generar texto más rápido y más barato. El debate discreto vs. continuo está lejos de cerrarse, y eso es bueno. Cuando una línea de investigación muere dos veces y resucita con argumentos mejores, merece atención.