576 字
3 分钟
Model Spec Midtraining: Improving How Alignment Training Generalizes

arXiv: 2605.02087 | 2026-05-03 | Anthropic Chloe Li, Sara Price, Samuel Marks, Jon Kutasov

一句话#

在标准对齐微调前,让模型学习介绍 Model Spec 价值观、规则及理由的合成文档。实验表明,这能改善对齐泛化,尤其是分布外表现。

核心思路#

示范数据能展示期望行为,却未必充分说明背后的原则,因此难以确定模型在新场景中如何泛化。

MSM(Model Spec Midtraining):在预训练之后、对齐微调(AFT)之前,用合成文档训练模型讨论其 Model Spec 的内容。规范内容为模型学习后续对齐数据提供背景,影响其泛化方向。

关键方法#

  • 合成中间训练:生成讨论 Model Spec 的合成文档(包含价值观、规则及其背后的推理),作为中间训练阶段的语料
  • 先理解后执行:MSM → 标准对齐微调(AFT),两步走
  • 可控泛化:同一份对齐数据配合不同的 Spec,产生不同的泛化方向。例如,相同的奶酪偏好数据配合「亲美」Spec → 泛化为亲美价值观;配合「亲实惠」Spec → 泛化为亲实惠价值观

实验结果#

模型基线错位率MSM+AFT 错位率对比基线 (DA)
Qwen2.5-32B68%5%DA: —
Qwen3-32B54%7%DA: 14%
  • 在 Agentic misalignment 评估中,MSM+AFT 将错位率从 68%→5%(Qwen2.5)和 54%→7%(Qwen3)
  • 效果显著优于 deliberative alignment 基线(14% vs 7%)
  • 优势在分布外场景尤为突出——普通 QA 对齐在难题场景中失效的地方,MSM 仍保持有效

发现与洞察#

  • 解释价值观比仅给规则更有效:在 Spec 中说明规则背后的价值观能改善泛化
  • 具体指导优于笼统指导:提供具体的而非泛泛的规范内容效果更好
  • MSM 不仅是一种训练方法,也是研究工具——可用来探索哪种 Model Spec 产生最强的对齐泛化

为什么重要#

  • 仅靠行为示范,可能不足以让模型在新场景中遵循同样的原则
  • MSM 补充规范背后的理由,帮助后续行为训练更稳定地泛化
  • 方法简单、可叠加到现有对齐流程上
  • 为模型规范(Model Spec / Constitution)的研究提供了新的实验范式
Model Spec Midtraining: Improving How Alignment Training Generalizes
https://blog.lpkt.cn/posts/papers/model-spec-midtraining/
作者
lollipopkit
发布于
2026-05-07
许可协议
CC BY-NC-SA 4.0