1099 字
5 分钟
ELF: Embedded Language Flows

ELF 将去噪过程保留在连续嵌入空间,只在最后映射回 token。它还让去噪和解码共享权重,无需额外的解码网络。

论文信息#

核心问题#

当前扩散语言模型(DLM)中,离散方法(MDLM、Duo)显著领先连续方法(Diffusion-LM、CDCD)。这是因为语言本质上是离散的,还是连续方法的设计还不够好?ELF 的实验说明,改进设计可以显著提升连续方法的表现。

方法#

核心思路#

在连续嵌入空间做 Flow Matching,仅在最后一步 t=1 做离散化。

1. 离散 → 连续编码#

  • 用 T5 encoder 将 token 序列映射到 768 维连续嵌入
  • 编码器仅在训练时使用,推理时无额外开销
  • 也探索了从头训练、随机高斯、联合训练编码器(预训练 T5 最优但差距不大)

2. 连续时间 Flow Matching(去噪)#

  • 线性插值(Rectified Flow):z_t = t·x + (1-t)·ε
  • x-prediction 而非 v-prediction:
    • 直接预测干净嵌入 x,与最终离散化目标天然对齐
    • 使去噪分支和解码分支可以共享权重
    • v-prediction 共享权重效果差(消融证实)
  • MSE 损失:L_MSE = E[1/(1-t)² · ‖x̂_θ - x‖²]

3. 最后一步离散化(解码)#

  • t→1 时,对 clean embedding 加 token-level corruption 得到 z̃
  • 同一网络以”decode”模式处理,输出通过 unembedding 矩阵 W 映射到 logits
  • 交叉熵损失:L_CE = CrossEnt(W·x̂_θ(z̃), s)
  • 推理时 argmax 得到离散 token
  • 无需单独 decoder

4. 训练两分支合一#

  • 80% 概率走 denoising 分支(MSE loss)
  • 20% 概率走 decoding 分支(CE loss)
  • 同一 batch 内用 masking 选择性应用,无额外训练开销

5. Self-Conditioning + CFG#

  • Self-conditioning:训练时 50% 概率把上步预测 x̂' 拼到输入 [z_t, x̂'],推理时不增加前向传播
  • Classifier-Free Guidance:ELF 在连续空间操作,CFG 可直接应用于 velocity field
    • Self-conditioning CFG(SC-CFG):在 self-conditioning 层面做 guidance
    • Input-conditioning CFG:条件生成时的 guidance
    • 最佳 scale:无条件 ~3,条件生成 ~2

与之前方法的对比#

设计选择ELF之前连续 DLM离散 DLM
离散化时机仅 t=1每步都做始终在 token 空间
解码器共享权重单独训练不需要
时间表示连续 FMDDPM 离散步离散步
CFG天然支持困难效果差
去噪空间自由连续嵌入受离散约束离散 token

关键实验结论#

无条件生成(OWT, Gen PPL ↓)#

模型1024步32步训练 token
MDLM~80~150+524B
Duo~70~130+524B
FLM~60~100+524B
LangFlow~55~95+524B
ELF~25~2445B(约十分之一)
  • 在所列基准上,ELF 使用约十分之一的训练 token,32 步结果优于其他方法的 1024 步结果

条件生成#

任务指标ELF-BDuoMDLM
WMT14 De-EnBLEU22.8921.0219.89
XSumROUGE-L27.1626.4224.82

Scaling#

  • ELF-B (105M) → ELF-M (342M) → ELF-L (652M),Gen PPL 持续下降
  • 更大模型学习更快(更少 epoch)

关键消融#

  • x-prediction >> v-prediction(共享权重时差距巨大)
  • T5 预训练编码 > 随机/从头训练(但差距不大,ELF 对编码器选择鲁棒)
  • Muon 优化器 >> AdamW(特别是 SDE 采样时)
  • logit-normal 时间调度 比 uniform 好,少步时优势明显
  • SDE 采样 比 ODE 好:γ=1~2 时 Gen PPL 更低,噪声纠正早期去噪错误
  • In-context conditioning 比 adaLN-Zero 好,且参数更少(148M→105M)

局限与讨论#

  1. 规模有限:最大 652M,未验证 billion 级别 scaling
  2. 编码器依赖:T5 预训练编码仍有优势
  3. 推理步数:32 步已有较好结果,但与 AR 逐 token 生成的延迟还需在相同任务下比较
  4. 条件任务规模:翻译/摘要只是小规模验证
  5. 去噪轨迹:早期步产生无意义重复文本,需足够步数才产生连贯输出

核心洞察#

ELF 将离散化推迟到终点,减少 token 级约束对连续轨迹的限制,也便于引入 CFG、logit-normal 调度和 SDE 采样。

x-prediction 直接预测干净嵌入,与最终解码目标一致,因此去噪和解码可以共享网络,减少推理开销。

与相关工作的关系#

方法去噪空间离散化方式DecoderCFG
Diffusion-LM嵌入空间每步 rounding单独训练❌
CDCD嵌入空间每步 CE loss不需要❌
LD4LG压缩潜空间单独 VAE decoder单独训练❌
MDLM离散 token吸收态掩码不需要❌
Duo离散 token均匀分布不需要❌
FLM/FMLMsimplex/one-hot每步 CE loss需要弱
ELF嵌入空间仅 t=1共享权重✅
ELF: Embedded Language Flows
https://blog.lpkt.cn/posts/papers/elf-embedded-language-flows/
作者
lollipopkit
发布于
2026-06-11
许可协议
CC BY-NC-SA 4.0