1287 字
6 分钟
DeepSeek-V4 Must-Reads 论文合集
来源:alphaXiv 文件夹「DeepSeek-V4 Must-Reads」— 围绕 DeepSeek-V4 生态的 13 篇核心论文/文章。 文件夹链接:alphaXiv
1. TileLang [arXiv: 2504.17577 / ICLR 2026]
- 提出 Tile 级编程语言 TileLang,通过显式内存放置、数据移动、并行调度原语提供更细粒度的底层控制
- 核心机制:统一的 Fused Tile-level Dataflow Graph (FTG),结合 Tile Recommendation(硬件感知默认值)和 Tile Inference(约束传播自动补全)
- 用 <70 行 Python 表达多种 AI 算法,代码量减少高达 85.5%;H100 上3.02× 平均加速 vs Triton,AMD 上 2.65×
对应 DeepSeek-V4 并行策略 中的 TileLang 融合通信 kernel。
2. On-Policy Distillation [Thinking Machines Lab 博客]
- 核心:从学生模型自身采样轨迹,教师对每个 token 打分(Reverse KL),on-policy 相关性 + 稠密监督信号
- 相比 SFT(off-policy)成本降低 9–30×,相比 RL 计算效率提升 50–100×
- 仅约 150 步即可将 AIME’24 从 60% 提升至 70%;持续学习中几乎完全恢复 IF-eval 表现
- 阶段交替:微调新数据 → 蒸馏恢复行为,适合个性化助手场景
3. DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence [arXiv 待发布]
- 1.6T 参数 Pro(49B 激活)+ 284B Flash(13B 激活),均支持 1M 上下文
- 混合注意力架构:Compressed Sparse Attention (CSA) + Heavily Compressed Attention (HCA) 提升长上下文效率
- 采用 mHC 连接和 Muon 优化器,预训练 >32T tokens
- Pro-Max 推理模式在开放模型中达 SOTA(SimpleQA 90.3%, HLE 85.9%, Codeforces 3168)
- 1M 上下文下仅需 27% 单 token FLOPs 和 10% KV 缓存 vs DeepSeek-V3.2
4. Conditional Memory via Scalable Lookup (Engram) [arXiv: 2601.07372]
- 提出与 MoE 互补的稀疏机制:条件记忆(Engram 模块),实现 O(1) 常数时间 N-gram 查找,扩展经典 N-gram 嵌入方法
- 发现 U 形 Scaling Law 指导 MoE 与 Engram 容量分配(两端最优,中间次优)
- 27B 参数下 MMLU +3.4、BBH +5.0、HumanEval +3.0,优于等参/等 FLOPs MoE 基线
- 长上下文检索 Multi-Query NIAH: 84.2 → 97.0;确定性寻址支持运行时从主机内存预取,开销 <3%
5. mHC: Manifold-Constrained Hyper-Connections [arXiv: 2512.24880]
- 解决 Hyper-Connections 因扩展残差流宽度丧失恒等映射导致的训练不稳定和可扩展性受限
- 将残差连接空间投影到特定流形恢复恒等映射,同时通过核融合、重计算和 DualPipe 通信重叠优化基础设施
- 在大规模训练实验中改善性能和扩展性
6. DeepSeek-V3.2: Pushing the Frontier of Open LLMs [arXiv: 2512.02556]
- 提出 DeepSeek Sparse Attention (DSA):闪电索引器 + 细粒度 token 选择,长上下文大幅降低计算
- 可扩展 RL 框架:后训练计算预算超预训练成本 10%
- Speciale 变体超越 GPT-5,IMO 2025 和 IOI 2025 获金牌
- 大规模 Agent 任务合成流水线:1800+ 环境、85K+ 复杂提示
7. FlashMoE: Fast Distributed MoE in a Single Kernel [arXiv: 2506.04667]
- GPU 驻留单内核 MoE:专家计算和跨 GPU 通信融合到单个持久内核,消除 CPU 调度
- 细粒度通信-计算流水线化:单边、设备发起跨 GPU (R)DMA 替代批量同步集合通信
- 8×H100 上:6× 延迟降低、5.7× 吞吐量提升、9× GPU 利用率提升、4× 重叠效率提升
8. gpt-oss-120b & gpt-oss-20b Model Card [arXiv: 2508.10925]
- OpenAI 开放权重推理模型(120B 和 20B),Apache 2.0 许可证,纯文本
- 支持 Harmony 聊天格式、可变努力推理训练、Agentic 工具使用(网页搜索等)
- 后训练结合推理与工具使用,兼容 Responses API
9. Hyper-Connections [arXiv: 2409.19606 / ICLR 2025]
- 替代残差连接的 Hyper-Connections:解决梯度消失与表示坍缩的跷跷板效应
- 允许网络动态调整不同深度特征间连接强度并重排层序
- 在稠密与稀疏 LLM 预训练及视觉任务中均有提升,是 mHC 的前置工作
10. Comet: Fine-grained Computation-communication Overlapping for MoE [arXiv: 2502.19811]
- MoE 细粒度通信-计算重叠系统:数据依赖分析 + 任务重调度实现精确重叠
- 自适应 GPU 线程块分配,动态平衡通信与计算
- 单 MoE 层加速 1.96×,端到端 1.71×,字节跳动万卡集群生产部署
11. Muon is Scalable for LLM Training [arXiv: 2502.16982]
- 识别 Muon 大规模扩展的两个关键:添加 Weight Decay + 逐参数更新尺度调整
- Scaling law:Muon 比 AdamW 约 2× 计算效率
- 发布 Moonlight 3B/16B MoE,ZeRO-1 风格分布式实现
12. DeepSeekMoE: Towards Ultimate Expert Specialization [arXiv: 2401.06066]
- 两大策略实现专家特化:细粒度专家分割(专家拆更细,激活更多)+ 共享专家隔离(捕获共性知识减冗余)
- 145B 版本仅用约 28.5% 计算量即与 DeepSeek 67B 稠密模型性能相当
- 16B 版本可在单张 40GB GPU 上无需量化部署
13. Hash Layers For Large Sparse Models [arXiv: 2106.04426]
- 基于哈希的稀疏路由:不同 token 哈希到不同 FFN 权重集,零路由参数、无需负载均衡损失
- 平衡随机哈希专注最局部特征效果最优,优于 Switch Transformers 和 BASE Layers
- 简单、鲁棒、易于实现,大语言建模和下游微调均表现良好
按主题阅读
| 主题 | 相关论文 |
|---|---|
| DeepSeek-V4 主论文 | #3 DeepSeek-V4 |
| 注意力 / 长上下文 | #3 (CSA+HCA), #6 (DSA), #5/#9 (mHC/Hyper-Connections), #4 (Engram) |
| MoE 架构 | #12 (DeepSeekMoE), #7 (FlashMoE), #10 (Comet), #8 (gpt-oss), #13 (Hash Layers) |
| 训练优化 | #11 (Muon), #2 (On-Policy Distillation), #1 (TileLang), #7/#10 (通信重叠) |
DeepSeek-V4 Must-Reads 论文合集
https://blog.lpkt.cn/posts/papers/deepseek-v4-must-reads/