2026 年 7 月 17 日,月之暗面(Moonshot AI)发布了 Kimi K3——全球首个公布的 3T 级开源模型。2.8 万亿参数,原生多模态视觉能力,100 万 token 上下文窗口,896 个专家中激活 16 个。这些数字本身已经足够吸引眼球。
但如果你关注大模型的工程实现,真正值得深挖的不是跑分,而是一个更本质的问题:把参数堆到万亿级并不难,难的是训练过程中不崩、专家负载不偏、推理成本不失控。
Kimi K3 在架构层面拿出了 6 项核心技术来回答这个问题:
- Kimi Delta Attention (KDA) — 新型注意力基座
- Attention Residuals (AttnRes) — 跨深度选择性表征检索
- Stable LatentMoE — 896 选 16 的极致稀疏 MoE
- Quantile Balancing — 基于分位数的专家均衡
- Per-Head Muon — 逐头独立优化器
- SiTU + Gated MLA — 激活控制与注意力选择性
本文逐一拆解这 6 项技术,看它们如何共同支撑起一个稳定的 3T 级训练流程。
一、注意力机制重构:KDA 与 AttnRes
1.1 Kimi Delta Attention (KDA)
KDA 是 K3 架构的注意力基座,官方将其定位为「高效 scaling 注意力的基础」。传统 Transformer 的注意力机制在超长上下文(100 万 token)下面临双重挑战:计算量随序列长度平方增长,KV cache 内存开销线性膨胀。
KDA 的设计目标是提供一种计算和内存都更高效的注意力变体,作为万亿参数规模下的基础组件。值得注意的是,KDA 在设计之初就考虑了与前缀缓存(prefix caching)的兼容性——这一点在后面的推理部署部分会再次涉及,因为 K3 团队已经将 KDA 的前缀缓存实现贡献给了 vLLM 社区。
关于 KDA 的精确数学形式(如是否采用线性注意力近似、delta 规则的具体定义),官方博客未展开,需要等待技术报告。
1.2 Attention Residuals (AttnRes)
如果说 KDA 解决的是序列长度方向(“宽度”)的效率问题,那么 Attention Residuals 解决的是模型深度方向(层间)的效率问题。
标准 Transformer 中,每一层的输出通过残差连接与输入相加:x_{l+1} = x_l + f_l(x_l)。这种全量累加意味着信息在所有层之间无差别地传递——无论浅层学到的基础特征是否在深层仍然需要,深层都得"背着"这些信息继续往前走。
AttnRes 的核心思想是选择性检索:不是无差别地把所有历史信息累加进来,而是让深层根据当前需要,选择性地从浅层表征中检索有用的部分。这类似于一个注意力机制,但作用域不是 token 之间,而是层与层之间。
打个比方:标准残差连接像是"每层都把所有行李背在身上",越深的层负担越重;AttnRes 则是"需要的时候去对应的柜子里取",深层只携带当前任务真正需要的信息。
这种设计在深层网络中尤为重要。当模型层数随参数量增长时,信息在层间的冗余传递会带来梯度消散和表征退化问题,AttnRes 通过选择性机制缓解了这一痛点。
下图是 Kimi K3 官方发布的架构总览图,展示了这六项技术如何组合在一起:

图源:Kimi K3 官方博客(kimi.com/blog/kimi-k3)。图中左侧两个面板分别展开了 Stable LatentMoE 和 KDA 的内部结构;右侧主干展示了 Block Attention Residuals 骨干——每一层由 KDA / Gated MLA / Stable LatentMoE 组成,层间通过 α 节点(AttnRes 操作)选择性传递信息,而非全量残差累加。
小结
KDA 和 AttnRes 构成了一组正交互补的设计:
| 维度 | 技术 | 解决的问题 |
|---|---|---|
| 序列长度(宽度) | KDA | 长上下文的计算/内存效率 |
| 模型深度(深度) | AttnRes | 层间信息冗余传递 |
二、极致稀疏的 MoE:Stable LatentMoE
Kimi K3 的 MoE 配置是 896 个专家,每次激活 16 个,稀疏比达到 56:1。
这个数字有多极端?对比一下:
| 模型 | 专家总数 | 激活专家数 | 稀疏比 |
|---|---|---|---|
| DeepSeek-V3 | 256 | 8 | 32:1 |
| Kimi K2 | 384 | 8 | 48:1 |
| Kimi K3 | 896 | 16 | 56:1 |
注:DeepSeek-V3 与 Kimi K2 数据来自各自官方技术报告/模型卡,供横向参考。K3 数据来自 K3 官方博客。
更高的稀疏比意味着在相同激活参数量下,模型拥有更大的知识容量(总参数更多),但每次推理只动用一小部分——这就是 MoE 的核心优势。然而,稀疏比越高,两个工程难题就越尖锐:
- 路由稳定性:896 个专家中选 16 个,路由器需要在海量选项中做出一致的决策,训练初期很容易震荡。
- 负载均衡:如果某些专家总是被选中而其他专家闲置,就造成算力浪费;更严重的是,在专家并行(Expert Parallelism)部署时,负载不均直接导致 GPU 空转。
“Stable LatentMoE” 这个名字中的两个修饰词暗示了对应的解法:
- Latent:路由决策可能不是直接在 token embedding 空间进行,而是在隐空间(latent space)中完成,从而获得更平滑的路由信号。
- Stable:在 56:1 的稀疏度下保持训练稳定,依赖于后续几项配套技术——Quantile Balancing 和 Per-Head Muon。
K3 官方称,配合训练和数据配方的改进,这些结构变化相比 K2 带来了约 2.5 倍的整体 scaling 效率提升。需要说明的是,官方原文的表述是"convert compute into intelligence more effectively",即每单位算力能转化为更多的智能——换言之,达到同等能力水平所需的算力显著降低(粗略理解为"同等能力下算力约 ÷ 2.5",或"同等算力下能力约 × 2.5")。注意这是官方自报的宏观口径,精确的测量定义有待技术报告披露。
三、专家均衡的新解法:Quantile Balancing
背景痛点
专家负载不均衡是 MoE 训练的经典难题。主流的解决方案是引入辅助损失(auxiliary loss):给"热门"专家施加惩罚,鼓励路由器更均匀地分配 token。这个方法有效,但有一个臭名昭著的副作用——balancing 超参数极度敏感。
不同的模型规模、不同的训练阶段,最优的 loss 权重各不相同。调大了,好的专家被压制,模型能力下降;调小了均衡无效,部分专家饿死。在实践中,这个超参往往是 MoE 训练中最难调的旋钮之一。
K3 的做法
K3 的 Quantile Balancing 采取了完全不同的思路:
直接从 router score 的分位数(quantile)推导专家分配,消除启发式更新和敏感的 balancing 超参数。
传统方法看的是 router 给每个专家打的绝对分数,然后通过 loss 去调整这些分数的分布。Quantile Balancing 不看绝对分数,而是看相对排名。
直觉上可以这样理解:假设 router 对 896 个专家各打了一个分数,Quantile Balancing 会把这些分数排序,然后根据分位数(如前 1.8% 的分位阈值,对应 16/896)来确定哪些专家被激活。因为分位数天然适应不同专家之间分数尺度的差异——不管某个专家的绝对分数是 0.9 还是 0.09,只要它排在前面就会被选中。
这种做法的好处:
- 无需调超参:不再需要一个手工设定的 balancing loss 权重
- 自适应:分位数天然随训练过程变化,不需要退火策略
- 大规模友好:在 896 个专家的大规模 EP(Expert Parallelism)下依然有效
四、优化器进化:Per-Head Muon
先说 Muon 是什么
Muon 是 2024 年由 Keller Jordan 等人推动走红的优化器,核心创新是对权重矩阵的梯度做 Newton-Schulz 迭代正交化。不过,对梯度/权重矩阵做正交化以改善优化的思想并非 Muon 首创——更早的 RightMatrix 等工作就探索过类似思路,Muon 的贡献在于将其工程化为一个通用、可大规模训练的优化器。简单来说,标准优化器(Adam、AdamW)直接用梯度更新权重,而 Muon 先把梯度投影到一个更"正交"的方向上再更新。
效果是在小至中规模模型上显著加速收敛。Moonshot 自己在 K2 时期就已经采用了 Muon 优化器。
Per-Head 的改进
标准 Muon 对一个权重矩阵做统一的正交化处理。但注意力层的权重矩阵实际上是由多个 head 拼接而成的,而不同 head 学到的模式差异很大:
- 有的 head 关注局部依赖(邻近 token 的句法关系)
- 有的 head 关注长程依赖(段落级的语义关联)
- 有的 head 负责位置信息编码
如果对这些 head 统一施加相同的正交化处理,可能对某些 head 过于激进,对另一些又不够。Per-Head Muon 的改进是对每个 attention head 独立执行优化,让每个 head 获得最适合自己的更新策略。
在 3T 规模下,这个改进的意义不仅是收敛速度。大模型训练一次的成本极高(以百万美元计),优化器效率的每一点提升,都意味着用更少的算力和时间达到同样的效果。K3 官方将 Per-Head Muon 列为前述 2.5 倍 scaling 效率提升的关键因素之一。
五、激活与注意力控制:SiTU 与 Gated MLA
5.1 SiTU (Sigmoid Tanh Unit)
SiTU 是 K3 采用的新型激活函数,结合了 sigmoid 和 tanh 的特性。它的定位是替代 GELU、SwiGLU 等主流激活函数,改善激活值的分布控制。
在万亿参数规模下,激活函数的选择看似微小,实则影响巨大。不良的激活值分布会导致梯度传播不稳定,尤其在深层网络中。SiTU 的具体数学形式有待技术报告披露,但其设计目标是明确的:在极端规模下提供更受控的激活行为。
5.2 Gated MLA
MLA(Multi-head Latent Attention)是 DeepSeek 提出的注意力变体,核心是将 KV cache 压缩到隐空间中——用一个低秩的隐向量来表示原本需要大量内存的 Key 和 Value,在推理时再解压还原。
Gated MLA 在此基础上引入了门控(gate)机制。门控的作用是让模型学会"什么时候该注意、什么时候该忽略",提升注意力的选择性。这在 100 万 token 的上下文中尤为重要:面对海量输入,模型需要高效地忽略无关信息,而非对所有内容分配等量的注意力资源。
MLA 的 KV 压缩 + 门控的选择性 = 推理时显著更省显存,这对于部署成本至关重要。
六、训练与部署工程
6.1 量化感知训练(QAT)
K3 从 SFT 阶段起就引入了量化感知训练:MXFP4 权重 + MXFP8 激活。
这里需要区分两种量化策略:
- 训练后量化(PTQ):模型训练完成后,再把权重/激活压到低精度。简单但可能掉精度。
- 量化感知训练(QAT):在训练过程中就让模型"感受"到量化带来的噪声,模型参数在训练时就适应了低精度表示。
K3 选择 QAT 的好处是推理时直接使用 MXFP4/MXFP8,无需额外转换步骤,同时保持了模型质量。MXFP4(Microscaling FP4)是 OCP 制定的新兴低精度格式,相比传统 INT4 有更好的数值动态范围,硬件兼容性也在快速扩展。
6.2 全平衡专家并行
在大规模 EP(Expert Parallelism)部署下,896 个专家分布在多张 GPU 上。如果某些 GPU 上的专家总是被频繁调用而另一些空闲,就会造成整体吞吐瓶颈。
K3 的方案是全平衡的专家并行训练,两个关键设计:
- 静态 shape:所有计算图的形状在编译时就确定,避免运行时动态分配带来的开销
- 关键路径无 host 同步:传统方案中,负载均衡调度通常需要在 CPU(host)端进行决策,然后同步给 GPU,这个 host↔GPU 同步是性能杀手。K3 把均衡逻辑完全做到 GPU 侧,消除了同步等待
6.3 推理部署:supernode + Mooncake + vLLM
K3 的推理部署方案是一个完整的系统工程:
硬件层面——推荐 supernode 配置,即 64 张以上加速器组成的高带宽通信域。大规模 MoE 推理对 all-to-all 通信带宽极度敏感,supernode 架构通过 NVLink/高速互联将通信延迟降到最低。
缓存层面——KDA 的前缀缓存实现已贡献给 vLLM 社区。前缀缓存是降低推理成本的利器:对于编码场景,大量请求共享相同的系统提示和代码上下文,缓存这些前缀可以避免重复计算。
架构层面——基于 Mooncake 的分离式推理架构(disaggregated inference),将 prefill(首 token 计算)和 decode(续写)分配到不同的计算资源上,各自独立扩缩容。
实战效果:在编码工作负载中,官方 API 的缓存命中率超过 90%。这直接反映在定价上:
| 计费类型 | 价格 |
|---|---|
| 缓存命中输入 | $0.30 / MTok |
| 缓存未命中输入 | $3.00 / MTok |
| 输出 | $15.00 / MTok |
缓存命中的输入价格仅为未命中的十分之一。对于高频编码场景(如 IDE 插件、代码 agent),绝大部分输入都会命中缓存,实际使用成本可以压到非常低。
结语:K3 架构给行业带来了什么信号
回顾 Kimi K3 的 6 项架构创新,可以提炼出三个值得行业关注的趋势:
信号一:万亿级 MoE 的训练稳定性问题,正在被系统性地解决。
过去,把 MoE 推到万亿规模最大的障碍不是算力,而是训练过程中各种不稳定——路由震荡、专家失衡、梯度异常。K3 的做法是针对每个环节给出专门的解法:KDA/AttnRes 稳住信息流,Quantile Balancing 稳住路由,Per-Head Muon 稳住优化,QAT 稳住精度。这不是某一项技术的一招鲜,而是一套系统工程。
信号二:优化器和路由均衡这两个方向正在快速成熟。
Muon 系列优化器从 2024 年提出到 2026 年被用于 3T 级模型,只用了不到两年。Quantile Balancing 则直接替代了 MoE 训练中最让人头疼的 balancing 超参。这两个方向的成熟速度意味着,它们很可能成为下一代大模型训练的标配。
信号三:开源模型正在以「架构效率」缩小与闭源的差距。
K3 的总参数是 2.8T,但激活参数量远小于此。真正的竞争力不来自参数总量,而来自每一单位算力能转化为多少智能——K3 称相比 K2 提升了约 2.5 倍(前文已说明口径)。当开源模型在架构效率上逼近甚至局部超越闭源模型时,开源与闭源的差距将以新的方式被重新定义。
最后提醒:本文的分析基于官方博客的公开信息。K3 的完整技术报告将随模型权重一同发布,届时我们会对架构细节做更精确的验证和补充。
本文基于 Kimi K3 官方技术博客(https://www.kimi.com/blog/kimi-k3)撰写。
