1099 字
5 分钟
ELF: Embedded Language Flows
ELF 将去噪过程保留在连续嵌入空间,只在最后映射回 token。它还让去噪和解码共享权重,无需额外的解码网络。
论文信息
- 标题: ELF: Embedded Language Flows
- 作者: Keya Hu, Linlu Qiu, Yiyang Lu, Hanhong Zhao, Tianhong Li, Yoon Kim, Jacob Andreas, Kaiming He
- 机构: MIT
- 发布: 2026-05-11, arXiv<2605>2605>.10938
- GitHub: https://github.com/lillian039/ELF
- PDF: https://arxiv.org/pdf/2605.10938
核心问题
当前扩散语言模型(DLM)中,离散方法(MDLM、Duo)显著领先连续方法(Diffusion-LM、CDCD)。这是因为语言本质上是离散的,还是连续方法的设计还不够好?ELF 的实验说明,改进设计可以显著提升连续方法的表现。
方法
核心思路
在连续嵌入空间做 Flow Matching,仅在最后一步 t=1 做离散化。
1. 离散 → 连续编码
- 用 T5 encoder 将 token 序列映射到 768 维连续嵌入
- 编码器仅在训练时使用,推理时无额外开销
- 也探索了从头训练、随机高斯、联合训练编码器(预训练 T5 最优但差距不大)
2. 连续时间 Flow Matching(去噪)
- 线性插值(Rectified Flow):
z_t = t·x + (1-t)·ε - x-prediction 而非 v-prediction:
- 直接预测干净嵌入 x,与最终离散化目标天然对齐
- 使去噪分支和解码分支可以共享权重
- v-prediction 共享权重效果差(消融证实)
- MSE 损失:
L_MSE = E[1/(1-t)² · ‖x̂_θ - x‖²]
3. 最后一步离散化(解码)
- t→1 时,对 clean embedding 加 token-level corruption 得到
z̃ - 同一网络以”decode”模式处理,输出通过 unembedding 矩阵 W 映射到 logits
- 交叉熵损失:
L_CE = CrossEnt(W·x̂_θ(z̃), s) - 推理时 argmax 得到离散 token
- 无需单独 decoder
4. 训练两分支合一
- 80% 概率走 denoising 分支(MSE loss)
- 20% 概率走 decoding 分支(CE loss)
- 同一 batch 内用 masking 选择性应用,无额外训练开销
5. Self-Conditioning + CFG
- Self-conditioning:训练时 50% 概率把上步预测
x̂'拼到输入[z_t, x̂'],推理时不增加前向传播 - Classifier-Free Guidance:ELF 在连续空间操作,CFG 可直接应用于 velocity field
- Self-conditioning CFG(SC-CFG):在 self-conditioning 层面做 guidance
- Input-conditioning CFG:条件生成时的 guidance
- 最佳 scale:无条件 ~3,条件生成 ~2
与之前方法的对比
| 设计选择 | ELF | 之前连续 DLM | 离散 DLM |
|---|---|---|---|
| 离散化时机 | 仅 t=1 | 每步都做 | 始终在 token 空间 |
| 解码器 | 共享权重 | 单独训练 | 不需要 |
| 时间表示 | 连续 FM | DDPM 离散步 | 离散步 |
| CFG | 天然支持 | 困难 | 效果差 |
| 去噪空间 | 自由连续嵌入 | 受离散约束 | 离散 token |
关键实验结论
无条件生成(OWT, Gen PPL ↓)
| 模型 | 1024步 | 32步 | 训练 token |
|---|---|---|---|
| MDLM | ~80 | ~150+ | 524B |
| Duo | ~70 | ~130+ | 524B |
| FLM | ~60 | ~100+ | 524B |
| LangFlow | ~55 | ~95+ | 524B |
| ELF | ~25 | ~24 | 45B(约十分之一) |
- 在所列基准上,ELF 使用约十分之一的训练 token,32 步结果优于其他方法的 1024 步结果
条件生成
| 任务 | 指标 | ELF-B | Duo | MDLM |
|---|---|---|---|---|
| WMT14 De-En | BLEU | 22.89 | 21.02 | 19.89 |
| XSum | ROUGE-L | 27.16 | 26.42 | 24.82 |
Scaling
- ELF-B (105M) → ELF-M (342M) → ELF-L (652M),Gen PPL 持续下降
- 更大模型学习更快(更少 epoch)
关键消融
- x-prediction >> v-prediction(共享权重时差距巨大)
- T5 预训练编码 > 随机/从头训练(但差距不大,ELF 对编码器选择鲁棒)
- Muon 优化器 >> AdamW(特别是 SDE 采样时)
- logit-normal 时间调度 比 uniform 好,少步时优势明显
- SDE 采样 比 ODE 好:γ=1~2 时 Gen PPL 更低,噪声纠正早期去噪错误
- In-context conditioning 比 adaLN-Zero 好,且参数更少(148M→105M)
局限与讨论
- 规模有限:最大 652M,未验证 billion 级别 scaling
- 编码器依赖:T5 预训练编码仍有优势
- 推理步数:32 步已有较好结果,但与 AR 逐 token 生成的延迟还需在相同任务下比较
- 条件任务规模:翻译/摘要只是小规模验证
- 去噪轨迹:早期步产生无意义重复文本,需足够步数才产生连贯输出
核心洞察
ELF 将离散化推迟到终点,减少 token 级约束对连续轨迹的限制,也便于引入 CFG、logit-normal 调度和 SDE 采样。
x-prediction 直接预测干净嵌入,与最终解码目标一致,因此去噪和解码可以共享网络,减少推理开销。
与相关工作的关系
| 方法 | 去噪空间 | 离散化方式 | Decoder | CFG |
|---|---|---|---|---|
| Diffusion-LM | 嵌入空间 | 每步 rounding | 单独训练 | ❌ |
| CDCD | 嵌入空间 | 每步 CE loss | 不需要 | ❌ |
| LD4LG | 压缩潜空间 | 单独 VAE decoder | 单独训练 | ❌ |
| MDLM | 离散 token | 吸收态掩码 | 不需要 | ❌ |
| Duo | 离散 token | 均匀分布 | 不需要 | ❌ |
| FLM/FMLM | simplex/one-hot | 每步 CE loss | 需要 | 弱 |
| ELF | 嵌入空间 | 仅 t=1 | 共享权重 | ✅ |
ELF: Embedded Language Flows
https://blog.lpkt.cn/posts/papers/elf-embedded-language-flows/