先说清楚:这是一个刚立项的坑,不是成果汇报.没有实验数据,没有结论,只有想法、一张表格,和一个我觉得值得验证的问题.
两种写法
现在的文本生成模型基本都是一条路:自回归.链式分解,从左到右逐 token 生成,训练目标是最小化下一个 token 的交叉熵.这条路成熟得可怕——KV 缓存、采样技巧、工程优化,全都围着它建.但它有两个结构性限制:生成过程单向不可回头,且推理必须串行.
另一条路是从图像生成搬过来的扩散:把文本逐步加噪(对离散文本来说通常是”掩码”),训练模型反向去噪,生成时从一份粗糙的草稿反复修改.好处是并行生成、可全局修改;代价是 likelihood 建模目前明显落后——多篇 scaling law 研究给出约 16 倍的算力差距,这个数字摆在那里,绕不过去.
把两条路装进同一个骨架
如果只是”AR vs 扩散”二选一,讨论已经够多了.我觉得有意思的是:把序列切成块之后,块与块之间和块内部可以各自选择一种机制,形成四种组合:
| 系统 | 块间 | 块内 | 已有工作 |
|---|---|---|---|
| 基线 | —(不分块) | — | 常规自回归 |
| t+t | 自回归 | 自回归 | 分块纯 AR,框架对照 |
| t+d | 自回归 | 扩散 | BD3-LM 一系 |
| d+t | 扩散 | 自回归 | 几乎空白 |
| d+d | 扩散 | 扩散 | MDLM / LLaDA 一系 |
块大小是天然的调和参数:块大小为 1 时整个框架退化成纯自回归,块大小等于序列长度时退化成纯扩散.也就是说,这五种系统可以放在同一个 Transformer 骨架上用开关切换,参数量、数据、训练预算都能严格对齐——这是做干净对比的前提.
为什么盯上 d+t
四个组合里,t+d 和 d+d 都有成熟对标(BD3-LM、MDLM、LLaDA),t+t 是框架对照,只有 d+t(块间扩散、块内自回归)基本没人系统做过.
而且有一篇 ACL 2026 的理论分析给了它一个具体动机:扩散模型并行生成时,需要假设同一批被预测的 token 相互独立(条件独立近似),这个近似会引入一个不可避免的误差下界——块越大,假装独立的 token 越多,误差越大.这解释了为什么目前接近自回归水平的扩散模型都偷偷用着极小的块.
d+t 的结构恰好绕开了这一点:块内部用自回归,词与词之间的依赖是精确的链式分解;扩散只负责块与块之间的全局调度.它是否因此能在”并行度”和”生成质量”之间拿到一个更好的位置——这是我立项时最想验证的问题.
打算怎么做(只是计划)
同一套代码骨架实现五个系统,在通用中文语料上做参数量与 token 预算严格匹配的对比,主指标用每字节比特数(BPB)统一口径,同时报告生成质量与速度.目标是画一张”什么场景适合哪种机制”的边界地图.
不声称谁会全面胜出.已有的负结果——16 倍算力差距、扩散在序列级正确率上的理论劣势——都摆在明面上,这个项目是去测边界,不是去打擂台.
坦白
数学分析系统学过,机器学习的底子是自学的,坦白说比较薄——概率论和信息论都还在补.目前正在做两件事:补这两门的最小必要子集(够读懂扩散的损失函数就行),以及在本地把 PyTorch 训练流程跑通.算力预算来自家里支持的云端租用,实验计划在一年内完成.
这是个兴趣驱动的项目,可能做出东西,也可能做不出来.过程会写在这里.
相关阅读
- Block Diffusion (BD3-LM),ICLR 2025 — arXiv:2503.09573,t+d 的对标实现
- Masked Diffusion Language Models (MDLM) — d+d 路线的代表
- Theoretical Benefit and Limitation of Diffusion Language Model — arXiv:2502.09622
- AR vs. Masked Diffusion: A Controlled Comparison — arXiv:2603.22075
- Scaling Beyond Masked Diffusion Language Models — arXiv:2602.15014
(co-work with glm-5.3-flash)