DeepSeek 发布了 V3.2-Exp,API 价格直接砍掉了 75%。翻完论文,核心功臣是一个叫 DSA(DeepSeek Sparse Attention,稀疏注意力)的机制。

这篇记录一下它的底层设计和工程取舍。


一、老架构的物理墙

Transformer 的标准 Attention 机制有个物理死穴:$O(L^2)$ 的复杂度,计算量随着序列长度呈平方级爆炸。

在 128K 上下文下,每个 token 都要跟其他所有位置算一遍相关性,单层就需要 $128K \times 128K \approx 170$ 亿次点积计算。仅存储这个中间注意力矩阵,单层就需要 32GB 显存(BF16 精度)。

叠上大模型的几十层深度,长文本推理时的显存占用和算力开销极为夸张。


二、核心直觉:别给废话发工资

DSA 的直觉非常朴素:人类读长文本时,绝大多数 token 都是背景噪音,为什么要全量算一遍注意力?

看这个例子:

“小明 2020 年去北京开会。会上讨论了很多技术话题。他见到了一些老朋友,大家一起吃了顿饭。第二天有个技术分享,讲的是分布式系统。第三天参观了故宫。五年后,他……”

读到末尾的“他”时,人的大脑会瞬间回溯锁定“小明”,确认中间没有其他主体,直接跳过“吃了顿饭”、“逛故宫”这些无关细节。

DSA 做的就是让大模型学会这种“按需聚焦”。


三、两步跑通稀疏路由

具体工程落地分两步走:

1. 粗筛(Lightning Indexer)

用一个极轻量的小网络快速给所有 token 打分,评估它们的相关性潜力。这个 Indexer 只有极少数 Attention Head,且采用 FP8 低精度计算,全量扫描一遍的开销极低。

它就像图书馆的借阅索引目录,不翻正文,先扫书名。

2. 精算(Top-k 聚焦)

根据粗筛分数,挑出 Top-2048 个最关键的 token。主模型只对这 2048 个候选计算全精度的 Attention。

原始 $128K \times 128K$ 的全量矩阵,直接被压缩成了 $128K \times 2048$,削掉了 98% 以上的冗余计算。


四、训练的两步走冷启动

Lightning Indexer 怎么学会判断谁是关键信息?DeepSeek 采用了两阶段训练策略:

第一阶段:Warm-up(学生模仿老师)
先跑一遍完整的全量 Dense Attention,记录下每个 token 实际获得的权重分布作为标准答案。主模型冻结权重,只用 KL 散度训练 Lightning Indexer 去拟合这个分布。这一步喂了约 2B tokens 的数据。

第二阶段:联合稀疏微调
解冻主模型,整个系统切到 Sparse Attention 模式全速跑。Indexer 和主模型联合训练,但梯度与语言建模 Loss 相互隔离。这个阶段消耗了近 1T tokens。

之所以分两阶段,是因为如果从随机初始化直接开练,Indexer 根本摸不着头脑,冷启动收敛周期会拖得极其漫长。Warm-up 给它递了一根稳妥的拐杖。


五、代码检索现场还原

假设把一个大型项目喂给模型,提问:“calculate_roi 这个函数具体怎么算收益的?”

传统 Attention 会把全库所有代码挨个算一遍,包括开头几十个 import、无关工具函数与配置。

在 DSA 架构下:

  • Lightning Indexer 快速扫过,import 和杂项函数得分极低
  • 扫到 def calculate_roi 时分数飙升,函数体核心逻辑与 docstring 拿到高分
  • 最终只有集中在核心计算逻辑附近的几十行代码进入精算池

计算速度飙升数十倍,答案精度毫不打折。


六、实测表现与取舍

论文中的 Benchmark 呈现出明显的结构特征:

  • 通用问答任务(MMLU-Pro):得分稳定在 85.0,信息抽取没有受到稀疏化影响。
  • 代码任务(Codeforces):Rating 从 2046 提升到了 2121。代码本身的强结构性让稀疏注意力更容易过滤语法噪声,反而提升了信噪比。
  • 多步长链推理(GPQA):出现微弱下滑(80.7 降至 79.9)。长链数学推理对远端中间变量的依赖极其苛刻,Indexer 一旦漏选关键前置步骤,推理链条就容易出现断层。

七、降价的物理底气

DeepSeek 将 Output API 降到了每百万 token 3 元人民币。

价格腰斩的底气在于物理算力和显存占用的断崖式下降。GPU 显存压力释放后,单卡并发承载量翻倍,吞吐成本自然被击穿。


八、适用边界

DSA 有明确的适用边界:

  • 高收益场景:文档问答、代码排查、长对话、要点提取(信息密度分散、局部关键)。
  • 慎用场景:高精多步数学推导、全量引用统计、超高信息密度的形式化证明。

DeepSeek 依然保留了 V3.1 的全量接口,遇到极端长推理任务随时可以无缝切回。

FIN