<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>MoE on Bevisy's Blogs</title><link>https://bevisy.github.io/tags/moe/</link><description>Recent content in MoE on Bevisy's Blogs</description><generator>Hugo -- gohugo.io</generator><language>en-us</language><lastBuildDate>Mon, 27 Jul 2026 10:15:00 +0800</lastBuildDate><atom:link href="https://bevisy.github.io/tags/moe/index.xml" rel="self" type="application/rss+xml"/><item><title>LLM 术语全景图（六）：并行策略——多维并行的组合</title><link>https://bevisy.github.io/p/llm-terminology-06-parallelism/</link><pubDate>Mon, 27 Jul 2026 10:15:00 +0800</pubDate><guid>https://bevisy.github.io/p/llm-terminology-06-parallelism/</guid><description>&lt;img src="https://bevisy.github.io/p/llm-terminology-06-parallelism/06.png" alt="Featured image of post LLM 术语全景图（六）：并行策略——多维并行的组合" /&gt;
 &lt;blockquote&gt;
 &lt;p&gt;这是「大模型训练与推理术语全景图」系列的第 6 篇，覆盖并行策略的 8 个概念：Data Parallelism、Tensor Parallelism、Pipeline Parallelism、Expert Parallelism、Context Parallelism、Sequence Parallelism、FSDP、ZeRO。
主要参考模型：DeepSeek V3、GLM-5、Llama 3、Megatron-LM、vLLM&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="开篇并行策略是组合问题"&gt;开篇：并行策略是组合问题
&lt;/h2&gt;&lt;p&gt;大模型的多卡并行不是单一策略的选择题，而是多维度的组合题。各策略切分的对象不同：Data Parallelism（DP）切 batch，Tensor Parallelism（TP）在层内切权重矩阵，Pipeline Parallelism（PP）在层间切模型，Expert Parallelism（EP）切专家，Context/Sequence Parallelism（CP/SP）切序列。训练大 MoE 模型常同时叠加 TP+EP+PP+DP（或 FSDP/ZeRO 替代纯 DP），DeepSeek V3 即是 TP=8 + EP=32 + PP + DP 的组合；推理侧则以 TP+EP 为主，PP 较少使用（vLLM V1 才补上 PP 推理）。组合时关键约束是通信带宽层级——TP 每层都要 AllReduce，对带宽极敏感，必须放在 NVLink 域内（单节点，TP=2/4/8）；PP 的 stage 间只传隐状态、EP 的 All-to-All 通信量较小，可跨节点；DP 的 AllReduce 介于二者之间。一句话：高带宽通信配高频切分（TP 在节点内），低带宽链路配低频切分（PP/EP 跨节点）。本篇按切分对象逐条梳理这 8 个术语。&lt;/p&gt;
&lt;h2 id="并行策略parallelism-strategies"&gt;并行策略（Parallelism Strategies）
&lt;/h2&gt;
 &lt;blockquote&gt;
 &lt;p&gt;LLM 训练和推理都需要多 GPU 协作。并行策略决定模型参数、梯度、优化器状态、激活值如何在多卡间分割与通信。&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;h3 id="data-parallelism"&gt;Data Parallelism
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：DP&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：数据并行&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：每张 GPU 持有完整模型副本，将不同 batch 分配给不同 GPU 并行计算，反向传播后通过 AllReduce 同步梯度。最简单的并行方式，但要求单卡能放下完整模型。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：DP 的工作流程：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;将 batch 均分到 N 张 GPU，每卡持有相同模型权重&lt;/li&gt;
&lt;li&gt;各卡独立前向 + 反向计算，得到本地梯度&lt;/li&gt;
&lt;li&gt;AllReduce 通信：所有 GPU 梯度求和取平均&lt;/li&gt;
&lt;li&gt;各卡用同步后的梯度更新本地权重&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;通信模式：每步训练需 1 次 AllReduce（梯度同步），通信量 = 2 × model_size（ring-allreduce 发送+接收各一次）。&lt;/p&gt;
&lt;p&gt;纯 DP 的限制：单卡必须能放下完整模型 + 优化器状态 + 激活值。对 7B 模型，bf16 权重 14GB + AdamW 优化器状态 (fp32 m/v) 56GB + 激活值 → 需 80GB+ 显存。超过单卡容量就必须用 FSDP/ZeRO 或 TP/PP。&lt;/p&gt;
&lt;p&gt;与 FSDP/ZeRO 的关系：FSDP/ZeRO 是 DP 的改进版，将模型参数也分片到各卡，解决单卡放不下的问题。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：PyTorch DDP (DistributedDataParallel)；所有多卡训练的基础&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://docs.pytorch.org/docs/stable/generated/torch.nn.parallel.DistributedDataParallel.html" target="_blank" rel="noopener"
 &gt;https://docs.pytorch.org/docs/stable/generated/torch.nn.parallel.DistributedDataParallel.html&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://docs.vllm.ai/en/latest/serving/parallelism_scaling.html" target="_blank" rel="noopener"
 &gt;https://docs.vllm.ai/en/latest/serving/parallelism_scaling.html&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="tensor-parallelism"&gt;Tensor Parallelism
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：TP&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：张量并行&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：将单个层的权重矩阵按行或列切分到多张 GPU 上，各卡并行计算矩阵乘法的不同部分，再通过 AllReduce/AllGather 拼接结果。实现层内并行，是 MoE 大模型推理的标配。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：TP 的两种切分方式：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Column Parallelism（列并行）：W 按 output 维度切分
&lt;ul&gt;
&lt;li&gt;各卡计算 Y_i = X · W_i（输入相同，权重不同）&lt;/li&gt;
&lt;li&gt;输出拼接需 AllGather&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Row Parallelism（行并行）：W 按 input 维度切分
&lt;ul&gt;
&lt;li&gt;各卡计算 Y_i = X_i · W（输入不同，权重相同）&lt;/li&gt;
&lt;li&gt;输出求和需 AllReduce&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Transformer 层的 TP 策略（Megatron 方案）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Attention：Q/K/V 投影用列并行（按 head 切分，天然并行），输出投影用行并行&lt;/li&gt;
&lt;li&gt;FFN：第一个 Linear 列并行，第二个 Linear 行并行&lt;/li&gt;
&lt;li&gt;一层内只需 2 次 AllReduce（attention 后 + FFN 后）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;TP 的通信开销：每层 2 次 AllReduce，通信量 = 2 × hidden_size × seq_len × batch × 2 (send+recv)。&lt;/p&gt;
&lt;p&gt;TP 度数选择：通常 TP=2/4/8（受 NVLink 带宽限制，跨节点 TP 性能差）。推理时 TP=N 意味着 N 张卡共同服务一个请求。&lt;/p&gt;
&lt;p&gt;vLLM 推理：&amp;ndash;tensor-parallel-size N&lt;/p&gt;
&lt;p&gt;与 EP 的关系：MoE 模型通常 TP + EP 组合——注意力用 TP，专家用 EP。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：&amp;ldquo;Megatron-LM&amp;rdquo; (Shoeybi et al., 2019, arXiv:1909.08053)；DeepSeek V3 (TP=8)；GLM-5 (TP=8)；vLLM 推理标配&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://docs.vllm.ai/en/latest/serving/parallelism_scaling.html" target="_blank" rel="noopener"
 &gt;https://docs.vllm.ai/en/latest/serving/parallelism_scaling.html&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://arxiv.org/abs/1909.08053" target="_blank" rel="noopener"
 &gt;https://arxiv.org/abs/1909.08053&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="pipeline-parallelism"&gt;Pipeline Parallelism
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：PP&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：流水线并行&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：将模型的不同层分配到不同 GPU 上，数据像流水线一样依次通过各卡。解决单卡放不下深层模型的问题，但有流水线气泡（bubble）开销。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：PP 的工作方式：&lt;/p&gt;
&lt;p&gt;将 L 层模型分到 N 个 stage（GPU），每个 stage 处理 L/N 层。
GPU 0 (layer 0-15) → GPU 1 (layer 16-31) → &amp;hellip; → GPU N-1 (layer L-N*16 ~ L-1)&lt;/p&gt;
&lt;p&gt;问题：朴素 PP 下，GPU 0 计算 forward 时 GPU 1~N-1 空闲 → 气泡占比 1-1/N。&lt;/p&gt;
&lt;p&gt;GPipe 方案（微批次填充）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;将一个 batch 分成 M 个 micro-batch&lt;/li&gt;
&lt;li&gt;M 个 micro-batch 流水通过各 stage&lt;/li&gt;
&lt;li&gt;气泡占比 = (N-1) / (M+N-1)，M 越大气泡越小&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;1F1B 调度（Megatron）：交替执行 1 个 forward + 1 个 backward，减少激活值内存峰值。&lt;/p&gt;
&lt;p&gt;PP 的通信：stage 间传递隐状态，通信量 = hidden_size × batch × seq_len，比 TP 小得多（适合跨节点）。&lt;/p&gt;
&lt;p&gt;PP 在推理中的应用：较少用于推理（推理无反向传播，气泡问题不同），主要用于训练。vLLM V1 已支持 PP 推理。&lt;/p&gt;
&lt;p&gt;注意：推测解码（Speculative Decoding）长期与 PP 不兼容，vLLM V1 近期才解决。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：&amp;ldquo;GPipe&amp;rdquo; (Huang et al., 2019, arXiv:1811.06965)；Megatron-LM (1F1B 调度)；DeepSpeed&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://docs.vllm.ai/en/latest/serving/parallelism_scaling.html" target="_blank" rel="noopener"
 &gt;https://docs.vllm.ai/en/latest/serving/parallelism_scaling.html&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://arxiv.org/abs/1811.06965" target="_blank" rel="noopener"
 &gt;https://arxiv.org/abs/1811.06965&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="expert-parallelism"&gt;Expert Parallelism
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：EP&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：专家并行&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：MoE 模型专用并行策略，将不同的专家（expert）分配到不同 GPU 上，每个 token 通过 All-to-All 通信路由到对应专家所在的卡上计算。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：EP 的核心流程：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Router 在每卡本地计算路由（哪些 token 去哪些专家）&lt;/li&gt;
&lt;li&gt;All-to-All 通信：将 token 发送到目标专家所在 GPU&lt;/li&gt;
&lt;li&gt;各卡上的专家计算 FFN&lt;/li&gt;
&lt;li&gt;All-to-All 通信：将结果送回原始卡&lt;/li&gt;
&lt;li&gt;Router 加权合并结果&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;EP 的通信模式：2 次 All-to-All（dispatch + combine），通信量取决于 token 数和激活专家数。&lt;/p&gt;
&lt;p&gt;EP 度数：通常等于专家数或其因子。如 DeepSeek V3 有 256 个专家，EP=256 意味着每卡 1 个专家。实际中 EP=8/16/32 更常见（每卡多个专家）。&lt;/p&gt;
&lt;p&gt;TP + EP 组合（大 MoE 模型标配）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Attention 层：TP 切分（按 head 分卡）&lt;/li&gt;
&lt;li&gt;MoE 层：EP 切分（按 expert 分卡）&lt;/li&gt;
&lt;li&gt;示例：DeepSeek V3 训练用 TP=8 + EP=32 + DP=&amp;hellip; + PP=&amp;hellip;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;EP 的挑战：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;负载不均衡：某些专家被选中的 token 多，导致某些 GPU 过载&lt;/li&gt;
&lt;li&gt;All-to-All 通信：跨节点延迟高，需要高效通信库（如 NCCL）&lt;/li&gt;
&lt;li&gt;DeepSeek V3 的无辅助损失路由策略帮助均衡&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：&amp;ldquo;GShard&amp;rdquo; (Lepikhin et al., 2020, arXiv:2006.16668)；&amp;ldquo;Switch Transformer&amp;rdquo; (Fedus et al., 2021, arXiv:2101.03961)；DeepSeek V3 (技术报告)；GLM-5 (技术报告)&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://docs.vllm.ai/en/latest/serving/parallelism_scaling.html" target="_blank" rel="noopener"
 &gt;https://docs.vllm.ai/en/latest/serving/parallelism_scaling.html&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://arxiv.org/abs/2101.03961" target="_blank" rel="noopener"
 &gt;https://arxiv.org/abs/2101.03961&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="context-parallelism"&gt;Context Parallelism
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：CP&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：上下文并行&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：将输入序列按长度维度切分到多张 GPU 上，各卡并行处理序列的不同段落，通过环式通信交换 KV 实现完整注意力。用于超长上下文训练和推理。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：CP 解决的问题：&lt;/p&gt;
&lt;p&gt;长序列（128K~1M token）的注意力计算 O(n^2) 和 KV Cache 内存超出单卡容量。CP 将序列分段，多卡协作完成注意力。&lt;/p&gt;
&lt;p&gt;工作方式（Ring Attention / Ulysses 两种方案）：&lt;/p&gt;
&lt;p&gt;Ring Attention：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;序列分成 N 段，每卡持有 1 段的 Q/K/V&lt;/li&gt;
&lt;li&gt;KV 在卡间环形传递，每卡依次与其他段的 K/V 做注意力&lt;/li&gt;
&lt;li&gt;N 步后完成完整注意力计算&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Ulysses（DeepSpeed Ulysses）：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;序列按 head 维度分卡（不是按序列位置）&lt;/li&gt;
&lt;li&gt;通过 All-to-All 将 Q/K/V 重排为每卡持有所有位置的部分 head&lt;/li&gt;
&lt;li&gt;各卡独立计算部分 head 的完整注意力&lt;/li&gt;
&lt;li&gt;再 All-to-All 重排回去&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;使用 CP 的模型：DeepSeek V3（训练用 CP）、GLM-5（1M 上下文训练）、Kimi Linear（1M 上下文）。&lt;/p&gt;
&lt;p&gt;vLLM 推理中：CP 用于超长上下文推理（如 1M token），&amp;ndash;context-parallel-size N。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：&amp;ldquo;Ring Attention&amp;rdquo; (Liu et al., 2023, arXiv:2310.01889)；&amp;ldquo;DeepSpeed Ulysses&amp;rdquo; (Microsoft, 2023)；DeepSeek V3 训练&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://docs.vllm.ai/en/latest/serving/parallelism_scaling.html" target="_blank" rel="noopener"
 &gt;https://docs.vllm.ai/en/latest/serving/parallelism_scaling.html&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://arxiv.org/abs/2310.01889" target="_blank" rel="noopener"
 &gt;https://arxiv.org/abs/2310.01889&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="sequence-parallelism"&gt;Sequence Parallelism
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：SP&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：序列并行&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：将序列的激活值沿序列维度切分到多卡，主要用于减少 TP 中 LayerNorm 和 Dropout 的冗余计算和内存。与 CP 类似但侧重点不同——SP 是 TP 的辅助，CP 是独立的注意力并行。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：SP 的两种含义：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;Megatron SP（TP 辅助）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;TP 只切分 Q/K/V/FFN 矩阵，LayerNorm 和 Dropout 在所有 TP 卡上冗余计算&lt;/li&gt;
&lt;li&gt;SP 将 LayerNorm/Dropout 的激活沿序列维度切分，各卡只处理部分 token&lt;/li&gt;
&lt;li&gt;在进入 TP 层前用 AllGather 恢复完整序列&lt;/li&gt;
&lt;li&gt;减少激活内存，但增加通信&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;DeepSpeed Ulysses SP（= CP 的一种实现）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;与上述 Megatron SP 不同，是独立的序列维度并行&lt;/li&gt;
&lt;li&gt;通过 All-to-All 重排 head 和 sequence 维度&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Megatron SP 与 CP 的区别：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;SP：只切分非 TP 部分（LayerNorm/Dropout），注意力仍在单卡完整计算&lt;/li&gt;
&lt;li&gt;CP：注意力本身也并行化，多卡协作完成完整注意力&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;实践中 SP 通常与 TP 配合使用（TP+SP），而 CP 可独立使用。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：&amp;ldquo;Megatron-LM&amp;rdquo; (arXiv:2104.04473, SP 部分)；DeepSpeed Ulysses&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://github.com/NVIDIA/Megatron-LM" target="_blank" rel="noopener"
 &gt;https://github.com/NVIDIA/Megatron-LM&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="fully-sharded-data-parallelism"&gt;Fully Sharded Data Parallelism
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：FSDP&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：全分片数据并行&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：DP 的进化版，将模型参数、梯度、优化器状态全部分片到各 GPU，计算时按需 AllGather 恢复完整参数，反向后 ReduceScatter 分片梯度。PyTorch 原生支持的大模型训练方案。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：FSDP 的工作流程：&lt;/p&gt;
&lt;p&gt;前向传播：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;进入某层前，AllGather 从各卡收集该层完整参数&lt;/li&gt;
&lt;li&gt;用完整参数计算前向&lt;/li&gt;
&lt;li&gt;计算完后立即丢弃完整参数，只保留本卡分片（节省显存）&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;反向传播：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;再次 AllGather 恢复该层参数&lt;/li&gt;
&lt;li&gt;计算梯度&lt;/li&gt;
&lt;li&gt;ReduceScatter 将梯度按分片同步到各卡&lt;/li&gt;
&lt;li&gt;各卡用本地分片梯度更新本地分片的优化器状态&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;显存节省：模型参数+梯度+优化器从全量 (16+16+32 = 64 bytes/param, fp32 AdamW) 降至 1/N。7B 模型在 N=8 卡上每卡仅需 ~8GB 而非 ~56GB。&lt;/p&gt;
&lt;p&gt;FSDP vs ZeRO-3：两者原理几乎相同，FSDP 是 PyTorch 原生实现，ZeRO-3 是 DeepSpeed 实现。FSDP 更易用，ZeRO 配置更灵活。&lt;/p&gt;
&lt;p&gt;FSDP 的分层分片（nested FSDP / per-layer sharding）：可按层粒度分片，进一步减少峰值显存（只需单层完整参数在内存中）。&lt;/p&gt;
&lt;p&gt;混合并行：FSDP + TP + PP 可组合使用。如 FSDP(dp=4) + TP(tp=8) + PP(pp=2) 用于超大模型。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：&amp;ldquo;PyTorch FSDP&amp;rdquo; (Zhao et al., 2023, arXiv:2304.11277)；PyTorch 2.x 原生支持；Llama 3 训练&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://docs.pytorch.org/docs/stable/fsdp.html" target="_blank" rel="noopener"
 &gt;https://docs.pytorch.org/docs/stable/fsdp.html&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://arxiv.org/abs/2304.11277" target="_blank" rel="noopener"
 &gt;https://arxiv.org/abs/2304.11277&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="zero-redundancy-optimizer"&gt;Zero Redundancy Optimizer
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：ZeRO&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：零冗余优化器&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：DeepSpeed 提出的训练内存优化方案，逐步消除 DP 中的冗余：ZeRO-1 分片优化器状态，ZeRO-2 额外分片梯度，ZeRO-3 额外分片参数。FSDP 的理论基础。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：ZeRO 的三个阶段：&lt;/p&gt;
&lt;p&gt;基线（纯 DP）：每卡存储完整参数(P) + 梯度(G) + 优化器状态(O)&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;以 7B 模型 fp32 AdamW 为例：P=28GB, G=28GB, O=56GB → 共 112GB/卡&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;ZeRO-1：分片优化器状态 O → 每卡 1/N 的 O&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;节省：56GB → 56/N GB。总显存 28+28+56/N&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;ZeRO-2：额外分片梯度 G → 每卡 1/N 的 G 和 O&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;节省：(28+56)/N。总显存 28+84/N&lt;/li&gt;
&lt;li&gt;反向后只同步本卡负责的参数的梯度&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;ZeRO-3：额外分片参数 P → 每卡 1/N 的 P、G、O&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;节省：全部 112/N。7B 模型 8 卡只需 14GB/卡&lt;/li&gt;
&lt;li&gt;前向/反向需 AllGather 恢复完整参数（= FSDP）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;通信代价：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;ZeRO-1/2：与纯 DP 相同（1 次 AllReduce 梯度），无额外通信&lt;/li&gt;
&lt;li&gt;ZeRO-3：每层 1 次 AllGather(前向) + 1 次 ReduceScatter(反向)，通信量增加&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;ZeRO-Infinity：进一步将分片卸载到 CPU 内存和 NVMe SSD，突破 GPU 显存限制。&lt;/p&gt;
&lt;p&gt;实践选择：ZeRO-2 是性能和内存的最佳平衡点（无额外通信开销）。ZeRO-3 用于单卡放不下的超大模型。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：&amp;ldquo;ZeRO: Memory Optimizations Toward Training Trillion Parameter Models&amp;rdquo; (Rajbhandari et al., 2020, arXiv:1910.02054)；DeepSpeed；FSDP 基于此设计&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://www.deepspeed.ai/tutorials/zero/" target="_blank" rel="noopener"
 &gt;https://www.deepspeed.ai/tutorials/zero/&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://arxiv.org/abs/1910.02054" target="_blank" rel="noopener"
 &gt;https://arxiv.org/abs/1910.02054&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="本篇小结"&gt;本篇小结
&lt;/h2&gt;&lt;p&gt;本篇 8 个并行策略术语沿&amp;quot;切什么维度 + 内存如何分片&amp;quot;两条线归位：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;DP&lt;/strong&gt; 每卡完整模型分不同数据，最简单但要求单卡放下完整模型；反向后 AllReduce 同步梯度。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;TP&lt;/strong&gt; 层内切权重矩阵，各卡算矩阵乘法的不同部分再 AllReduce/AllGather 拼接；NVLink 域内有效，是 MoE 大模型推理标配。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;PP&lt;/strong&gt; 层间切分，数据像流水线依次通过各卡，解决深模型单卡放不下的问题，但有流水线气泡开销；GPipe 和 1F1B 两种调度。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;EP&lt;/strong&gt; MoE 专用，把不同专家分到不同 GPU，token 通过 All-to-All 通信路由到专家所在卡。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;CP&lt;/strong&gt; 把输入序列按长度切分到多卡，各卡处理不同段落并通过环式通信交换 KV 实现完整注意力；用于超长上下文训练和推理。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;SP&lt;/strong&gt; 切序列的激活值，主要用于减少 TP 中 LayerNorm/Dropout 的冗余计算；是 TP 的辅助，与 CP 的区别是 SP 依附于 TP、CP 是独立的注意力并行。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;FSDP&lt;/strong&gt; DP 的进化版，参数/梯度/优化器状态全部分片，计算时按需 AllGather 恢复完整参数；PyTorch 原生支持的大模型训练方案。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;ZeRO&lt;/strong&gt; DeepSpeed 的内存优化三阶段：ZeRO-1 分片优化器状态、ZeRO-2 加分片梯度、ZeRO-3 加分片参数（= FSDP）；ZeRO-2 是性能与内存的最佳平衡点（无额外通信），ZeRO-3 用于单卡放不下的超大模型。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;组合关系：大模型训练标配 TP+EP+PP+DP/ZeRO 多维并行（TP 在 NVLink 域内、PP 跨节点、DP/ZeRO 切数据、EP 切专家），推理标配 TP+EP。FSDP 是 ZeRO-3 的工程实现，两者理论基础一致。&lt;/p&gt;
&lt;p&gt;本系列共 11 篇，本文是第 6 篇。&lt;/p&gt;</description></item><item><title>LLM 术语全景图（三）：模型架构——MoE 与残差连接的演进</title><link>https://bevisy.github.io/p/llm-terminology-03-moe-residual/</link><pubDate>Mon, 27 Jul 2026 09:30:00 +0800</pubDate><guid>https://bevisy.github.io/p/llm-terminology-03-moe-residual/</guid><description>&lt;img src="https://bevisy.github.io/p/llm-terminology-03-moe-residual/03.png" alt="Featured image of post LLM 术语全景图（三）：模型架构——MoE 与残差连接的演进" /&gt;
 &lt;blockquote&gt;
 &lt;p&gt;这是「大模型训练与推理术语全景图」系列的第 3 篇，覆盖模型架构的 8 个概念：MoE、MTP、mHC、RoPE、YaRN、RMSNorm、SwiGLU、KV Cache。
主要参考模型：DeepSeek V3/V4、GLM-5、Kimi K2、Llama 3、Mixtral&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="开篇模型架构的三条演进线"&gt;开篇：模型架构的三条演进线
&lt;/h2&gt;&lt;p&gt;把 2023 年到 2026 年的主流 LLM 架构按时间铺开，能清晰看到三条并行的演进线，本篇的 8 个概念分别落在其中。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;第一条线是 FFN 的 MoE 化。&lt;/strong&gt; 稠密 FFN 被替换为多个并行专家，路由器为每个 token 只激活少量专家。结果是模型总参数量大幅膨胀（DeepSeek V3 达 671B、Kimi K2 达 1T），但单次前向的激活参数仍保持在 30B-40B 量级，激活比压到 5% 上下。MoE 让&amp;quot;大参数量&amp;quot;与&amp;quot;低激活成本&amp;quot;第一次解耦。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;第二条线是残差连接从单流到多流。&lt;/strong&gt; 标准 ResNet 残差是 &lt;code&gt;y = x + F(x)&lt;/code&gt; 的单残差通路；Hyper-Connections 把它扩展为 n 个并行残差流，并用 Pre/Res/Post 三类映射在层间混合；mHC 进一步把 Res Mapping 约束到双随机矩阵流形，避免深层堆叠时信号不可预测地放大或缩小。残差通路变宽，但 FLOPs 几乎不增。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;第三条线是基础组件趋于稳定。&lt;/strong&gt; 位置编码收敛到 RoPE（长上下文用 YaRN 扩展），归一化收敛到 RMSNorm 的 Pre-Norm 用法，FFN 激活收敛到 SwiGLU，KV Cache 则成为所有自回归推理绕不开的物理瓶颈。这三类组件已没有太多设计争议，新一代模型主要在 MoE 和残差结构上做差异化。&lt;/p&gt;
&lt;p&gt;下面逐一展开。&lt;/p&gt;
&lt;h2 id="模型架构architecture-components"&gt;模型架构（Architecture Components）
&lt;/h2&gt;&lt;h3 id="mixture-of-experts"&gt;Mixture of Experts
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：MoE&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：混合专家模型&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：将 FFN 层替换为多个并行的&amp;quot;专家&amp;quot;网络，通过路由器（router/gate）为每个 token 选择少量专家激活，实现大参数量但低激活成本的模型。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：MoE 的核心计算：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Router 计算：g(x) = softmax(W_gate · x)，为每个专家打分&lt;/li&gt;
&lt;li&gt;Top-k 选择：选出得分最高的 k 个专家&lt;/li&gt;
&lt;li&gt;加权输出：y = Σ g_i(x) · Expert_i(x)，仅对选中的 k 个专家计算&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;关键设计选择：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;专家数量：DeepSeek V3 有 256 个路由专家 + 1 个共享专家；Qwen3-235B 有 128 个专家&lt;/li&gt;
&lt;li&gt;Top-k：通常 k=1~8，DeepSeek V3 激活 8 个路由专家 + 1 个共享专家&lt;/li&gt;
&lt;li&gt;共享专家（Shared Expert）：所有 token 都经过的专家，提供通用知识，DeepSeek MoE 首创&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;代表模型的 MoE 配置：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;总参数&lt;/th&gt;
					&lt;th&gt;激活参数&lt;/th&gt;
					&lt;th&gt;激活比&lt;/th&gt;
					&lt;th&gt;专家数&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSeek V3&lt;/td&gt;
					&lt;td&gt;671B&lt;/td&gt;
					&lt;td&gt;37B&lt;/td&gt;
					&lt;td&gt;5.5%&lt;/td&gt;
					&lt;td&gt;256+1&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSeek V4-Pro&lt;/td&gt;
					&lt;td&gt;~700B+&lt;/td&gt;
					&lt;td&gt;~30B&lt;/td&gt;
					&lt;td&gt;~4%&lt;/td&gt;
					&lt;td&gt;256+1&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Kimi K2&lt;/td&gt;
					&lt;td&gt;1T&lt;/td&gt;
					&lt;td&gt;32B&lt;/td&gt;
					&lt;td&gt;3.2%&lt;/td&gt;
					&lt;td&gt;384+1&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-235B&lt;/td&gt;
					&lt;td&gt;235B&lt;/td&gt;
					&lt;td&gt;22B&lt;/td&gt;
					&lt;td&gt;9.4%&lt;/td&gt;
					&lt;td&gt;128&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;MiniMax-01&lt;/td&gt;
					&lt;td&gt;456B&lt;/td&gt;
					&lt;td&gt;46B&lt;/td&gt;
					&lt;td&gt;10%&lt;/td&gt;
					&lt;td&gt;32&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-5&lt;/td&gt;
					&lt;td&gt;744B&lt;/td&gt;
					&lt;td&gt;40B&lt;/td&gt;
					&lt;td&gt;5.4%&lt;/td&gt;
					&lt;td&gt;256+1&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;注：GLM-5 的 744B 总参/40B 激活来自 GLM-5 技术报告（arXiv:2602.15763），激活比 40/744 ≈ 5.4%。DeepSeek V3 的 671B/37B/5.5%/256+1 来自 DeepSeek V3 技术报告（arXiv:2412.19437）。&lt;/p&gt;
&lt;p&gt;负载均衡：DeepSeek V3 首创无辅助损失（auxiliary-loss-free）策略，避免传统负载均衡损失损害模型质量。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：DeepSeekMoE (arXiv:2401.06066)；DeepSeek V3 (技术报告 arXiv:2412.19437)；Qwen3 (技术报告)；Kimi K2 技术报告；GLM-5 (技术报告 arXiv:2602.15763)；Mixtral&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://sebastianraschka.com/llm-architecture-gallery/moe/" target="_blank" rel="noopener"
 &gt;https://sebastianraschka.com/llm-architecture-gallery/moe/&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://magazine.sebastianraschka.com/p/the-big-llm-architecture-comparison" target="_blank" rel="noopener"
 &gt;https://magazine.sebastianraschka.com/p/the-big-llm-architecture-comparison&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="multi-token-prediction"&gt;Multi-Token Prediction
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：MTP&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：多 Token 预测&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：训练时不仅预测下一个 token，还同时预测未来第 2、3&amp;hellip;个 token，通过额外的预测头增加训练信号密度。推理时可复用 MTP 模块做推测解码。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：MTP 的训练目标：&lt;/p&gt;
&lt;p&gt;标准 next-token：L = -log P(x_{t+1} | x_{&amp;lt;=t})
MTP-k：L = -Σ_{i=1}^{k+1} log P(x_{t+i} | x_{&amp;lt;=t}, x_{t+1}, &amp;hellip;, x_{t+i-1})&lt;/p&gt;
&lt;p&gt;DeepSeek V3 使用 MTP-1（预测 1 个额外 token）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;主解码器预测 x_{t+1}&lt;/li&gt;
&lt;li&gt;MTP 模块以主解码器的隐状态 + x_{t+1} 为输入，预测 x_{t+2}&lt;/li&gt;
&lt;li&gt;MTP 损失权重通常为 0.1（主损失 + 0.1 × MTP 损失）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;推理时的两种用法：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;标准：忽略 MTP 头，逐 token 生成（不影响推理）&lt;/li&gt;
&lt;li&gt;推测解码：MTP 头作为内置的 draft model，一次预测多个 token，经验证后批量接受&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;在 vLLM 中启用：&lt;code&gt;--speculative-config='{&amp;quot;method&amp;quot;: &amp;quot;deepseek_mtp&amp;quot;, &amp;quot;num_speculative_tokens&amp;quot;: 1}'&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;采用 MTP 的模型：DeepSeek V3/R1、DeepSeek V4、GLM-5 系列、Inkling&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：DeepSeek V3 (arXiv:2412.19437, Section 4.4)；DeepSeek R1 (技术报告)&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://sebastianraschka.com/llm-architecture-gallery/mtp/" target="_blank" rel="noopener"
 &gt;https://sebastianraschka.com/llm-architecture-gallery/mtp/&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://docs.nvidia.com/nemo/megatron-bridge/nightly/training/multi-token-prediction.html" target="_blank" rel="noopener"
 &gt;https://docs.nvidia.com/nemo/megatron-bridge/nightly/training/multi-token-prediction.html&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://medium.com/data-science-collective/deepseek-explained-4-multi-token-prediction-33f11fe2b868" target="_blank" rel="noopener"
 &gt;https://medium.com/data-science-collective/deepseek-explained-4-multi-token-prediction-33f11fe2b868&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="manifold-constrained-hyper-connections"&gt;Manifold-Constrained Hyper-Connections
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：mHC&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：流形约束超连接&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：DeepSeek V4 引入的残差连接改进，将 Transformer 块中的单残差流扩展为多个并行残差流，并通过双随机矩阵约束确保混合稳定。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：mHC 的演进路径：&lt;/p&gt;
&lt;p&gt;标准残差连接 → Hyper-Connections (HC) → mHC&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;标准 ResNet 残差：y = x + F(x)，单残差流&lt;/li&gt;
&lt;li&gt;Hyper-Connections：将单残差流扩展为 n 个并行残差流
&lt;ul&gt;
&lt;li&gt;Pre Mapping：将 n 个流合并为 1 个隐向量供 Attention/MoE 处理&lt;/li&gt;
&lt;li&gt;Res Mapping：层间残差流混合（学习矩阵）&lt;/li&gt;
&lt;li&gt;Post Mapping：将层输出分发回 n 个流&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;mHC 关键约束：
&lt;ul&gt;
&lt;li&gt;Res Mapping 投影到双随机矩阵流形（行和=1、列和=1、非负）&lt;/li&gt;
&lt;li&gt;Pre/Post Mapping 也约束为非负有界&lt;/li&gt;
&lt;li&gt;避免深层堆叠时信号放大/缩小的不可预测行为&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;DeepSeek V4 使用 n=4 个并行残差流。实测仅增加 6.7% 训练时间开销，但指标可比基线少用一半训练 token 达到同等性能。&lt;/p&gt;
&lt;p&gt;核心价值：在几乎不增加 FLOPs 的情况下，使残差通路更宽更表达，且约束保证深层模型稳定性。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：&amp;ldquo;mHC: Manifold-Constrained Hyper-Connections&amp;rdquo; (arXiv:2512.24880, DeepSeek, 2025-12-31)；Hyper-Connections 原始论文 (arXiv:2409.19606, Zhu et al., 2024)；DeepSeek V4 (技术报告)&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://magazine.sebastianraschka.com/p/recent-developments-in-llm-architectures" target="_blank" rel="noopener"
 &gt;https://magazine.sebastianraschka.com/p/recent-developments-in-llm-architectures&lt;/a&gt; (Section 5.1)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="rotary-position-embedding"&gt;Rotary Position Embedding
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：RoPE&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：旋转位置编码&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：通过旋转矩阵编码 token 间的相对位置关系，将位置信息融入 Q 和 K 的旋转中，使注意力分数自然反映相对距离。当前绝大多数 LLM 的默认位置编码方案。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：RoPE 的数学形式：&lt;/p&gt;
&lt;p&gt;对位置 m 的向量 x，将其每两个维度分为一组，旋转角度 θ_i = m · base^(-2i/d)：&lt;/p&gt;
&lt;p&gt;R(x, m) = x · R_m，其中 R_m 是分块旋转矩阵&lt;/p&gt;
&lt;p&gt;关键性质：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&amp;lt;R(Q, m), R(K, n)&amp;gt; = &amp;lt;Q, K&amp;gt; 旋转后内积仅依赖相对位置 (m-n)&lt;/li&gt;
&lt;li&gt;base 通常为 10000（LLaMA、DeepSeek V3 等多数模型）；部分长上下文模型（如 Qwen2、GLM-4-1M）调高到 500000~1000000 以利于长上下文外推&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;外推问题：训练时最大位置 m_max 有限（如 4K），推理时超出范围的角度超出训练分布，质量退化。&lt;/p&gt;
&lt;p&gt;采用 RoPE 的模型：LLaMA 全系列、Qwen 全系列、DeepSeek V2/V3、GLM-4、Mistral、Kimi K2 等。&lt;/p&gt;
&lt;p&gt;注意：MLA 需要将 RoPE 部分独立处理（RoPE 不兼容低秩压缩），这是 MLA 实现复杂度的来源之一。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：&amp;ldquo;RoFormer: Enhanced Transformer with Rotary Position Embedding&amp;rdquo; (Su et al., 2021, arXiv:2104.09864)；LLaMA、Qwen、DeepSeek、Mistral 等&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://magazine.sebastianraschka.com/p/from-gpt-2-to-gpt-oss-analyzing-the" target="_blank" rel="noopener"
 &gt;https://magazine.sebastianraschka.com/p/from-gpt-2-to-gpt-oss-analyzing-the&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.turingpost.com/p/attention-types" target="_blank" rel="noopener"
 &gt;https://www.turingpost.com/p/attention-types&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="yet-another-rope-extension"&gt;Yet Another RoPE Extension
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：YaRN&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：YaRN 上下文扩展&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：目前最主流的 RoPE 上下文扩展方法，通过分段插值 + 温度缩放，在少量微调（约 400 步）下将上下文从 4K 扩展到 128K+。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：YaRN 的核心方法：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;分段策略：将 RoPE 的频率维度分为三段
&lt;ul&gt;
&lt;li&gt;高频段：保持原样（局部信息不需要外推）&lt;/li&gt;
&lt;li&gt;中频段：插值 + 温度缩放（平滑过渡）&lt;/li&gt;
&lt;li&gt;低频段：纯插值（长距离信息需要外推）&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;温度缩放：调整 softmax 温度补偿插值带来的注意力分布变化&lt;/li&gt;
&lt;li&gt;微调：仅需约 400 步微调即可适应新长度&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;采用 YaRN 的模型：Qwen 系列（4K→128K）、DeepSeek（4K→128K）、LLaMA 系列、GLM 等。&lt;/p&gt;
&lt;p&gt;其他上下文扩展方法对比：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;PI (Position Interpolation)：线性插值所有频率，简单但效果一般&lt;/li&gt;
&lt;li&gt;NTK-aware：调整 base，不微调直接外推&lt;/li&gt;
&lt;li&gt;YaRN：分段 + 温度，当前最优&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：&amp;ldquo;YaRN: Efficient Context Window Extension&amp;rdquo; (Peng et al., 2023, arXiv:2309.00071)；Qwen、DeepSeek、LLaMA 系列&lt;/p&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="rmsnorm"&gt;RMSNorm
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：RMSNorm&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：均方根归一化&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：LayerNorm 的简化版本，去除均值计算仅用均方根归一化，计算更快且在大规模训练中表现稳定。几乎所有现代 LLM 的默认归一化方案。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：RMSNorm vs LayerNorm：&lt;/p&gt;
&lt;p&gt;LayerNorm: y = (x - μ) / sqrt(σ^2 + ε) · γ + β
RMSNorm: y = x / RMS(x) · γ, 其中 RMS(x) = sqrt(mean(x^2) + ε)&lt;/p&gt;
&lt;p&gt;RMSNorm 去掉了均值减法和偏置 β，计算量更小，且在大规模训练中更稳定。&lt;/p&gt;
&lt;p&gt;使用方式：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Pre-Norm（主流）：在 attention/FFN 之前做归一化，梯度更稳定&lt;/li&gt;
&lt;li&gt;Post-Norm（GPT-2 风格）：在之后做，训练不稳定，已少用&lt;/li&gt;
&lt;li&gt;Inside-Residual Post-Norm（OLMo 2）：在残差路径内部做 post-norm&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;采用 RMSNorm 的模型：LLaMA 全系列、Qwen3、DeepSeek V3/V4、GLM-5、Mistral、Gemma 3、Kimi K2 等几乎所有现代模型。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：&amp;ldquo;Root Mean Square Layer Normalization&amp;rdquo; (Zhang &amp;amp; Sennrich, 2019, arXiv:1910.07467)；几乎所有现代 LLM&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://sebastianraschka.com/llm-architecture-gallery/" target="_blank" rel="noopener"
 &gt;https://sebastianraschka.com/llm-architecture-gallery/&lt;/a&gt; (各模型卡片的 Related Concepts)&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://github.com/rasbt/LLMs-from-scratch/blob/main/ch04/01_main-chapter-code/ch04.ipynb" target="_blank" rel="noopener"
 &gt;https://github.com/rasbt/LLMs-from-scratch/blob/main/ch04/01_main-chapter-code/ch04.ipynb&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="swiglu"&gt;SwiGLU
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：SwiGLU&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：SwiGLU 激活函数&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：GLU（Gated Linear Unit）的变体，使用 SiLU（Swish）作为门控激活函数，替代传统 ReLU/GELU。几乎所有现代 LLM FFN 层的标准配置。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：SwiGLU 的公式：&lt;/p&gt;
&lt;p&gt;SwiGLU(x) = SiLU(W·x) ⊙ (V·x)
其中 SiLU(x) = x · sigmoid(x)（也称 Swish）&lt;/p&gt;
&lt;p&gt;对比传统 FFN：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;传统：FFN(x) = W2 · activation(W1 · x)，单一激活&lt;/li&gt;
&lt;li&gt;SwiGLU：FFN(x) = W2 · [SiLU(W_gate · x) ⊙ (W_up · x)]，门控机制&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;门控机制使网络能动态选择信息通过与否，比固定激活函数更有表达力。&lt;/p&gt;
&lt;p&gt;实现细节：SwiGLU FFN 有 3 个权重矩阵（W_gate, W_up, W_down），比传统 2 个多一个，因此隐藏维度通常调整为 2/3 × 4d 以保持参数量。&lt;/p&gt;
&lt;p&gt;采用 SwiGLU 的模型：LLaMA 全系列、Qwen3、DeepSeek V3/V4、GLM-5、Mistral、Kimi K2、PaLM 等。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：&amp;ldquo;GLU Variants Improve Transformer&amp;rdquo; (Shazeer, 2020, arXiv:2002.05202)；LLaMA、Qwen、DeepSeek 等&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://magazine.sebastianraschka.com/p/from-gpt-2-to-gpt-oss-analyzing-the" target="_blank" rel="noopener"
 &gt;https://magazine.sebastianraschka.com/p/from-gpt-2-to-gpt-oss-analyzing-the&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="kv-cache"&gt;KV Cache
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：KV Cache&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：键值缓存&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：自回归生成时，缓存之前 token 在每层注意力的 K/V 矩阵，避免重复计算。KV Cache 大小是长上下文推理最硬的物理瓶颈。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：KV Cache 的大小计算：&lt;/p&gt;
&lt;p&gt;KV Cache = 2(K+V) × n_layers × n_kv_heads × d_head × seq_len × batch × bytes_per_param&lt;/p&gt;
&lt;p&gt;示例（DeepSeek V3, 128K 上下文, bf16, batch=1）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;MLA 压缩后：约 68.6 KiB/token × 128K = ~8.6 GB&lt;/li&gt;
&lt;li&gt;对比 Llama 3 8B（GQA）：128 KiB/token × 128K = ~16 GB&lt;/li&gt;
&lt;li&gt;对比 OLMo 2 7B（MHA）：512 KiB/token × 128K = ~64 GB&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;注：以上 MHA/GQA 数字为示意量级，便于横向对比 MLA 的压缩收益。&lt;/p&gt;
&lt;p&gt;KV Cache 是长上下文推理的核心瓶颈，催生了大量优化：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;压缩 KV 表示：MLA（低维压缩）、CCA（压缩空间计算）&lt;/li&gt;
&lt;li&gt;减少序列条目：CSA/HCA（序列压缩）、SWA（局部窗口）&lt;/li&gt;
&lt;li&gt;跨层共享：Gemma 4 的 Cross-Layer Attention&lt;/li&gt;
&lt;li&gt;线性注意力：Lightning Attention、KDA（O(1) 状态替代 O(n) 缓存）&lt;/li&gt;
&lt;li&gt;分页管理：vLLM PagedAttention&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;趋势：随着推理模型（o1/R1）和 Agent 工作流需要更长的上下文，KV Cache 优化成为 2025-2026 年架构设计的最大驱动力。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：所有 Transformer 模型；MLA (DeepSeek V2)、PagedAttention (vLLM)&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://magazine.sebastianraschka.com/p/coding-the-kv-cache-in-llms" target="_blank" rel="noopener"
 &gt;https://magazine.sebastianraschka.com/p/coding-the-kv-cache-in-llms&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://sebastianraschka.com/llm-architecture-gallery/kv-cache-calculations/" target="_blank" rel="noopener"
 &gt;https://sebastianraschka.com/llm-architecture-gallery/kv-cache-calculations/&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="本篇小结"&gt;本篇小结
&lt;/h2&gt;&lt;p&gt;本篇 8 个模型架构术语沿&amp;quot;稀疏激活 + 残差连接进化 + 位置编码/归一化/FFN 标准件 + KV Cache 瓶颈&amp;quot;四条线归位：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;MoE&lt;/strong&gt; 把 FFN 替换为多个并行专家网络，路由器为每个 token 选少量专家，实现大参数量但低激活成本；2025-2026 年大模型几乎全部 MoE 化，激活比持续下降（DeepSeek V4 ~4%）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;MTP&lt;/strong&gt; 训练时同时预测未来多个 token 增加训练信号密度，推理时可复用 MTP 模块做推测解码；DeepSeek V3 用 MTP，是训练与推理的连接点。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;mHC&lt;/strong&gt; 把 Transformer 块的单残差流扩展为多个并行残差流，用双随机矩阵约束保证混合稳定；DeepSeek V4 引入，信息通路更宽。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;RoPE&lt;/strong&gt; 通过旋转矩阵把相对位置编入 Q/K 的旋转中，使注意力分数自然反映相对距离；当前绝大多数 LLM 的默认位置编码。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;YaRN&lt;/strong&gt; 通过分段插值 + 温度缩放做 RoPE 上下文扩展，约 400 步微调即可从 4K 扩到 128K+；目前最主流的上下文扩展方法。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;RMSNorm&lt;/strong&gt; 去掉 LayerNorm 的均值计算仅用均方根归一化，计算更快且大规模训练稳定；几乎所有现代 LLM 的默认归一化。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;SwiGLU&lt;/strong&gt; 用 SiLU 作为 GLU 门控激活替代 ReLU/GELU；几乎所有现代 LLM FFN 层的标准配置。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;KV Cache&lt;/strong&gt; 缓存历史 token 的 K/V 避免重复计算，但其体积随上下文线性增长，是长上下文推理最硬的物理瓶颈——催生篇 1 的 MLA/CSA/HCA 压缩、篇 5 的 PagedAttention 分页管理、篇 10 的 Prefix Caching 复用。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;KV Cache 是本篇与篇 1（注意力压缩）、篇 5（推理优化）、篇 10（推理服务）的交叉点：架构设计层面的每一次创新，最终都要回到这个物理瓶颈上检验。&lt;/p&gt;
&lt;p&gt;本系列共 11 篇，本文是第 3 篇。系列导航见：LLM 术语全景图系列导读。&lt;/p&gt;</description></item><item><title>拆解 Kimi K3：2.8 万亿参数背后，6 项架构创新如何让 MoE 训练稳得住</title><link>https://bevisy.github.io/p/kimi-k3-architecture-innovation/</link><pubDate>Tue, 21 Jul 2026 22:30:00 +0800</pubDate><guid>https://bevisy.github.io/p/kimi-k3-architecture-innovation/</guid><description>&lt;img src="https://bevisy.github.io/p/kimi-k3-architecture-innovation/663cb3c8-3efa-4bc4-a23a-c5185a1671c7.png" alt="Featured image of post 拆解 Kimi K3：2.8 万亿参数背后，6 项架构创新如何让 MoE 训练稳得住" /&gt;&lt;p&gt;2026 年 7 月 17 日，月之暗面（Moonshot AI）发布了 Kimi K3——全球首个公布的 3T 级开源模型。2.8 万亿参数，原生多模态视觉能力，100 万 token 上下文窗口，896 个专家中激活 16 个。这些数字本身已经足够吸引眼球。&lt;/p&gt;
&lt;p&gt;但如果你关注大模型的工程实现，真正值得深挖的不是跑分，而是一个更本质的问题：&lt;strong&gt;把参数堆到万亿级并不难，难的是训练过程中不崩、专家负载不偏、推理成本不失控。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Kimi K3 在架构层面拿出了 6 项核心技术来回答这个问题：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Kimi Delta Attention (KDA)&lt;/strong&gt; — 新型注意力基座&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Attention Residuals (AttnRes)&lt;/strong&gt; — 跨深度选择性表征检索&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Stable LatentMoE&lt;/strong&gt; — 896 选 16 的极致稀疏 MoE&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Quantile Balancing&lt;/strong&gt; — 基于分位数的专家均衡&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Per-Head Muon&lt;/strong&gt; — 逐头独立优化器&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;SiTU + Gated MLA&lt;/strong&gt; — 激活控制与注意力选择性&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;本文逐一拆解这 6 项技术，看它们如何共同支撑起一个稳定的 3T 级训练流程。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="一注意力机制重构kda-与-attnres"&gt;一、注意力机制重构：KDA 与 AttnRes
&lt;/h2&gt;&lt;h3 id="11-kimi-delta-attention-kda"&gt;1.1 Kimi Delta Attention (KDA)
&lt;/h3&gt;&lt;p&gt;KDA 是 K3 架构的注意力基座，官方将其定位为「高效 scaling 注意力的基础」。传统 Transformer 的注意力机制在超长上下文（100 万 token）下面临双重挑战：计算量随序列长度平方增长，KV cache 内存开销线性膨胀。&lt;/p&gt;
&lt;p&gt;KDA 的设计目标是提供一种计算和内存都更高效的注意力变体，作为万亿参数规模下的基础组件。值得注意的是，KDA 在设计之初就考虑了与前缀缓存（prefix caching）的兼容性——这一点在后面的推理部署部分会再次涉及，因为 K3 团队已经将 KDA 的前缀缓存实现贡献给了 vLLM 社区。&lt;/p&gt;
&lt;p&gt;关于 KDA 的精确数学形式（如是否采用线性注意力近似、delta 规则的具体定义），官方博客未展开，需要等待技术报告。&lt;/p&gt;
&lt;h3 id="12-attention-residuals-attnres"&gt;1.2 Attention Residuals (AttnRes)
&lt;/h3&gt;&lt;p&gt;如果说 KDA 解决的是序列长度方向（&amp;ldquo;宽度&amp;rdquo;）的效率问题，那么 Attention Residuals 解决的是模型深度方向（层间）的效率问题。&lt;/p&gt;
&lt;p&gt;标准 Transformer 中，每一层的输出通过残差连接与输入相加：&lt;code&gt;x_{l+1} = x_l + f_l(x_l)&lt;/code&gt;。这种全量累加意味着信息在所有层之间无差别地传递——无论浅层学到的基础特征是否在深层仍然需要，深层都得&amp;quot;背着&amp;quot;这些信息继续往前走。&lt;/p&gt;
&lt;p&gt;AttnRes 的核心思想是&lt;strong&gt;选择性检索&lt;/strong&gt;：不是无差别地把所有历史信息累加进来，而是让深层根据当前需要，选择性地从浅层表征中检索有用的部分。这类似于一个注意力机制，但作用域不是 token 之间，而是层与层之间。&lt;/p&gt;
&lt;p&gt;打个比方：标准残差连接像是&amp;quot;每层都把所有行李背在身上&amp;quot;，越深的层负担越重；AttnRes 则是&amp;quot;需要的时候去对应的柜子里取&amp;quot;，深层只携带当前任务真正需要的信息。&lt;/p&gt;
&lt;p&gt;这种设计在深层网络中尤为重要。当模型层数随参数量增长时，信息在层间的冗余传递会带来梯度消散和表征退化问题，AttnRes 通过选择性机制缓解了这一痛点。&lt;/p&gt;
&lt;p&gt;下图是 Kimi K3 官方发布的架构总览图，展示了这六项技术如何组合在一起：&lt;/p&gt;
&lt;p&gt;&lt;img alt="Kimi K3 架构图：左侧为 Stable LatentMoE 和 KDA 模块内部结构，右上方为 AttnRes 操作 α，右侧为 Block Attention Residuals 骨干网络" class="gallery-image" data-flex-basis="263px" data-flex-grow="109" height="1823" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://bevisy.github.io/p/kimi-k3-architecture-innovation/kimi-k3-architecture-diagram.png" srcset="https://bevisy.github.io/p/kimi-k3-architecture-innovation/kimi-k3-architecture-diagram_hu_2f1331a814f2b4af.png 800w, https://bevisy.github.io/p/kimi-k3-architecture-innovation/kimi-k3-architecture-diagram_hu_506efd7c51f79734.png 1600w, https://bevisy.github.io/p/kimi-k3-architecture-innovation/kimi-k3-architecture-diagram.png 2000w" width="2000"&gt;&lt;/p&gt;

 &lt;blockquote&gt;
 &lt;p&gt;图源：Kimi K3 官方博客（kimi.com/blog/kimi-k3）。图中左侧两个面板分别展开了 Stable LatentMoE 和 KDA 的内部结构；右侧主干展示了 Block Attention Residuals 骨干——每一层由 KDA / Gated MLA / Stable LatentMoE 组成，层间通过 α 节点（AttnRes 操作）选择性传递信息，而非全量残差累加。&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;h3 id="小结"&gt;小结
&lt;/h3&gt;&lt;p&gt;KDA 和 AttnRes 构成了一组正交互补的设计：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;维度&lt;/th&gt;
					&lt;th&gt;技术&lt;/th&gt;
					&lt;th&gt;解决的问题&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;序列长度（宽度）&lt;/td&gt;
					&lt;td&gt;KDA&lt;/td&gt;
					&lt;td&gt;长上下文的计算/内存效率&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;模型深度（深度）&lt;/td&gt;
					&lt;td&gt;AttnRes&lt;/td&gt;
					&lt;td&gt;层间信息冗余传递&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;hr&gt;
&lt;h2 id="二极致稀疏的-moestable-latentmoe"&gt;二、极致稀疏的 MoE：Stable LatentMoE
&lt;/h2&gt;&lt;p&gt;Kimi K3 的 MoE 配置是 896 个专家，每次激活 16 个，稀疏比达到 &lt;strong&gt;56:1&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;这个数字有多极端？对比一下：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;专家总数&lt;/th&gt;
					&lt;th&gt;激活专家数&lt;/th&gt;
					&lt;th&gt;稀疏比&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSeek-V3&lt;/td&gt;
					&lt;td&gt;256&lt;/td&gt;
					&lt;td&gt;8&lt;/td&gt;
					&lt;td&gt;32:1&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Kimi K2&lt;/td&gt;
					&lt;td&gt;384&lt;/td&gt;
					&lt;td&gt;8&lt;/td&gt;
					&lt;td&gt;48:1&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;896&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;16&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;56:1&lt;/strong&gt;&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;

 &lt;blockquote&gt;
 &lt;p&gt;注：DeepSeek-V3 与 Kimi K2 数据来自各自官方技术报告/模型卡，供横向参考。K3 数据来自 K3 官方博客。&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;p&gt;更高的稀疏比意味着在相同激活参数量下，模型拥有更大的知识容量（总参数更多），但每次推理只动用一小部分——这就是 MoE 的核心优势。然而，稀疏比越高，两个工程难题就越尖锐：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;路由稳定性&lt;/strong&gt;：896 个专家中选 16 个，路由器需要在海量选项中做出一致的决策，训练初期很容易震荡。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;负载均衡&lt;/strong&gt;：如果某些专家总是被选中而其他专家闲置，就造成算力浪费；更严重的是，在专家并行（Expert Parallelism）部署时，负载不均直接导致 GPU 空转。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&amp;ldquo;Stable LatentMoE&amp;rdquo; 这个名字中的两个修饰词暗示了对应的解法：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Latent&lt;/strong&gt;：路由决策可能不是直接在 token embedding 空间进行，而是在隐空间（latent space）中完成，从而获得更平滑的路由信号。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Stable&lt;/strong&gt;：在 56:1 的稀疏度下保持训练稳定，依赖于后续几项配套技术——Quantile Balancing 和 Per-Head Muon。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;K3 官方称，配合训练和数据配方的改进，这些结构变化相比 K2 带来了约 &lt;strong&gt;2.5 倍的整体 scaling 效率提升&lt;/strong&gt;。需要说明的是，官方原文的表述是&amp;quot;convert compute into intelligence more effectively&amp;quot;，即每单位算力能转化为更多的智能——换言之，达到同等能力水平所需的算力显著降低（粗略理解为&amp;quot;同等能力下算力约 ÷ 2.5&amp;quot;，或&amp;quot;同等算力下能力约 × 2.5&amp;quot;）。注意这是官方自报的宏观口径，精确的测量定义有待技术报告披露。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="三专家均衡的新解法quantile-balancing"&gt;三、专家均衡的新解法：Quantile Balancing
&lt;/h2&gt;&lt;h3 id="背景痛点"&gt;背景痛点
&lt;/h3&gt;&lt;p&gt;专家负载不均衡是 MoE 训练的经典难题。主流的解决方案是引入辅助损失（auxiliary loss）：给&amp;quot;热门&amp;quot;专家施加惩罚，鼓励路由器更均匀地分配 token。这个方法有效，但有一个臭名昭著的副作用——&lt;strong&gt;balancing 超参数极度敏感&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;不同的模型规模、不同的训练阶段，最优的 loss 权重各不相同。调大了，好的专家被压制，模型能力下降；调小了均衡无效，部分专家饿死。在实践中，这个超参往往是 MoE 训练中最难调的旋钮之一。&lt;/p&gt;
&lt;h3 id="k3-的做法"&gt;K3 的做法
&lt;/h3&gt;&lt;p&gt;K3 的 Quantile Balancing 采取了完全不同的思路：&lt;/p&gt;

 &lt;blockquote&gt;
 &lt;p&gt;&lt;strong&gt;直接从 router score 的分位数（quantile）推导专家分配，消除启发式更新和敏感的 balancing 超参数。&lt;/strong&gt;&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;p&gt;传统方法看的是 router 给每个专家打的绝对分数，然后通过 loss 去调整这些分数的分布。Quantile Balancing 不看绝对分数，而是看&lt;strong&gt;相对排名&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;直觉上可以这样理解：假设 router 对 896 个专家各打了一个分数，Quantile Balancing 会把这些分数排序，然后根据分位数（如前 1.8% 的分位阈值，对应 16/896）来确定哪些专家被激活。因为分位数天然适应不同专家之间分数尺度的差异——不管某个专家的绝对分数是 0.9 还是 0.09，只要它排在前面就会被选中。&lt;/p&gt;
&lt;p&gt;这种做法的好处：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;无需调超参&lt;/strong&gt;：不再需要一个手工设定的 balancing loss 权重&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;自适应&lt;/strong&gt;：分位数天然随训练过程变化，不需要退火策略&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;大规模友好&lt;/strong&gt;：在 896 个专家的大规模 EP（Expert Parallelism）下依然有效&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="四优化器进化per-head-muon"&gt;四、优化器进化：Per-Head Muon
&lt;/h2&gt;&lt;h3 id="先说-muon-是什么"&gt;先说 Muon 是什么
&lt;/h3&gt;&lt;p&gt;Muon 是 2024 年由 Keller Jordan 等人推动走红的优化器，核心创新是对权重矩阵的梯度做 &lt;strong&gt;Newton-Schulz 迭代正交化&lt;/strong&gt;。不过，对梯度/权重矩阵做正交化以改善优化的思想并非 Muon 首创——更早的 RightMatrix 等工作就探索过类似思路，Muon 的贡献在于将其工程化为一个通用、可大规模训练的优化器。简单来说，标准优化器（Adam、AdamW）直接用梯度更新权重，而 Muon 先把梯度投影到一个更&amp;quot;正交&amp;quot;的方向上再更新。&lt;/p&gt;
&lt;p&gt;效果是在小至中规模模型上显著加速收敛。Moonshot 自己在 K2 时期就已经采用了 Muon 优化器。&lt;/p&gt;
&lt;h3 id="per-head-的改进"&gt;Per-Head 的改进
&lt;/h3&gt;&lt;p&gt;标准 Muon 对一个权重矩阵做统一的正交化处理。但注意力层的权重矩阵实际上是由多个 head 拼接而成的，而不同 head 学到的模式差异很大：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;有的 head 关注局部依赖（邻近 token 的句法关系）&lt;/li&gt;
&lt;li&gt;有的 head 关注长程依赖（段落级的语义关联）&lt;/li&gt;
&lt;li&gt;有的 head 负责位置信息编码&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;如果对这些 head 统一施加相同的正交化处理，可能对某些 head 过于激进，对另一些又不够。&lt;strong&gt;Per-Head Muon 的改进是对每个 attention head 独立执行优化&lt;/strong&gt;，让每个 head 获得最适合自己的更新策略。&lt;/p&gt;
&lt;p&gt;在 3T 规模下，这个改进的意义不仅是收敛速度。大模型训练一次的成本极高（以百万美元计），优化器效率的每一点提升，都意味着用更少的算力和时间达到同样的效果。K3 官方将 Per-Head Muon 列为前述 2.5 倍 scaling 效率提升的关键因素之一。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="五激活与注意力控制situ-与-gated-mla"&gt;五、激活与注意力控制：SiTU 与 Gated MLA
&lt;/h2&gt;&lt;h3 id="51-situ-sigmoid-tanh-unit"&gt;5.1 SiTU (Sigmoid Tanh Unit)
&lt;/h3&gt;&lt;p&gt;SiTU 是 K3 采用的新型激活函数，结合了 sigmoid 和 tanh 的特性。它的定位是替代 GELU、SwiGLU 等主流激活函数，改善激活值的分布控制。&lt;/p&gt;
&lt;p&gt;在万亿参数规模下，激活函数的选择看似微小，实则影响巨大。不良的激活值分布会导致梯度传播不稳定，尤其在深层网络中。SiTU 的具体数学形式有待技术报告披露，但其设计目标是明确的：在极端规模下提供更受控的激活行为。&lt;/p&gt;
&lt;h3 id="52-gated-mla"&gt;5.2 Gated MLA
&lt;/h3&gt;&lt;p&gt;MLA（Multi-head Latent Attention）是 DeepSeek 提出的注意力变体，核心是将 KV cache 压缩到隐空间中——用一个低秩的隐向量来表示原本需要大量内存的 Key 和 Value，在推理时再解压还原。&lt;/p&gt;
&lt;p&gt;Gated MLA 在此基础上引入了门控（gate）机制。门控的作用是让模型学会&amp;quot;什么时候该注意、什么时候该忽略&amp;quot;，提升注意力的选择性。这在 100 万 token 的上下文中尤为重要：面对海量输入，模型需要高效地忽略无关信息，而非对所有内容分配等量的注意力资源。&lt;/p&gt;
&lt;p&gt;MLA 的 KV 压缩 + 门控的选择性 = 推理时显著更省显存，这对于部署成本至关重要。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="六训练与部署工程"&gt;六、训练与部署工程
&lt;/h2&gt;&lt;h3 id="61-量化感知训练qat"&gt;6.1 量化感知训练（QAT）
&lt;/h3&gt;&lt;p&gt;K3 从 SFT 阶段起就引入了量化感知训练：&lt;strong&gt;MXFP4 权重 + MXFP8 激活&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;这里需要区分两种量化策略：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;训练后量化（PTQ）&lt;/strong&gt;：模型训练完成后，再把权重/激活压到低精度。简单但可能掉精度。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;量化感知训练（QAT）&lt;/strong&gt;：在训练过程中就让模型&amp;quot;感受&amp;quot;到量化带来的噪声，模型参数在训练时就适应了低精度表示。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;K3 选择 QAT 的好处是推理时直接使用 MXFP4/MXFP8，无需额外转换步骤，同时保持了模型质量。MXFP4（Microscaling FP4）是 OCP 制定的新兴低精度格式，相比传统 INT4 有更好的数值动态范围，硬件兼容性也在快速扩展。&lt;/p&gt;
&lt;h3 id="62-全平衡专家并行"&gt;6.2 全平衡专家并行
&lt;/h3&gt;&lt;p&gt;在大规模 EP（Expert Parallelism）部署下，896 个专家分布在多张 GPU 上。如果某些 GPU 上的专家总是被频繁调用而另一些空闲，就会造成整体吞吐瓶颈。&lt;/p&gt;
&lt;p&gt;K3 的方案是&lt;strong&gt;全平衡的专家并行训练&lt;/strong&gt;，两个关键设计：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;静态 shape&lt;/strong&gt;：所有计算图的形状在编译时就确定，避免运行时动态分配带来的开销&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;关键路径无 host 同步&lt;/strong&gt;：传统方案中，负载均衡调度通常需要在 CPU（host）端进行决策，然后同步给 GPU，这个 host↔GPU 同步是性能杀手。K3 把均衡逻辑完全做到 GPU 侧，消除了同步等待&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="63-推理部署supernode--mooncake--vllm"&gt;6.3 推理部署：supernode + Mooncake + vLLM
&lt;/h3&gt;&lt;p&gt;K3 的推理部署方案是一个完整的系统工程：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;硬件层面&lt;/strong&gt;——推荐 supernode 配置，即 64 张以上加速器组成的高带宽通信域。大规模 MoE 推理对 all-to-all 通信带宽极度敏感，supernode 架构通过 NVLink/高速互联将通信延迟降到最低。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;缓存层面&lt;/strong&gt;——KDA 的前缀缓存实现已贡献给 vLLM 社区。前缀缓存是降低推理成本的利器：对于编码场景，大量请求共享相同的系统提示和代码上下文，缓存这些前缀可以避免重复计算。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;架构层面&lt;/strong&gt;——基于 Mooncake 的分离式推理架构（disaggregated inference），将 prefill（首 token 计算）和 decode（续写）分配到不同的计算资源上，各自独立扩缩容。&lt;/p&gt;
&lt;p&gt;实战效果：在编码工作负载中，官方 API 的缓存命中率超过 &lt;strong&gt;90%&lt;/strong&gt;。这直接反映在定价上：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;计费类型&lt;/th&gt;
					&lt;th&gt;价格&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;缓存命中输入&lt;/td&gt;
					&lt;td&gt;$0.30 / MTok&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;缓存未命中输入&lt;/td&gt;
					&lt;td&gt;$3.00 / MTok&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;输出&lt;/td&gt;
					&lt;td&gt;$15.00 / MTok&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;缓存命中的输入价格仅为未命中的十分之一。对于高频编码场景（如 IDE 插件、代码 agent），绝大部分输入都会命中缓存，实际使用成本可以压到非常低。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="结语k3-架构给行业带来了什么信号"&gt;结语：K3 架构给行业带来了什么信号
&lt;/h2&gt;&lt;p&gt;回顾 Kimi K3 的 6 项架构创新，可以提炼出三个值得行业关注的趋势：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;信号一：万亿级 MoE 的训练稳定性问题，正在被系统性地解决。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;过去，把 MoE 推到万亿规模最大的障碍不是算力，而是训练过程中各种不稳定——路由震荡、专家失衡、梯度异常。K3 的做法是针对每个环节给出专门的解法：KDA/AttnRes 稳住信息流，Quantile Balancing 稳住路由，Per-Head Muon 稳住优化，QAT 稳住精度。这不是某一项技术的一招鲜，而是一套系统工程。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;信号二：优化器和路由均衡这两个方向正在快速成熟。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Muon 系列优化器从 2024 年提出到 2026 年被用于 3T 级模型，只用了不到两年。Quantile Balancing 则直接替代了 MoE 训练中最让人头疼的 balancing 超参。这两个方向的成熟速度意味着，它们很可能成为下一代大模型训练的标配。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;信号三：开源模型正在以「架构效率」缩小与闭源的差距。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;K3 的总参数是 2.8T，但激活参数量远小于此。真正的竞争力不来自参数总量，而来自每一单位算力能转化为多少智能——K3 称相比 K2 提升了约 2.5 倍（前文已说明口径）。当开源模型在架构效率上逼近甚至局部超越闭源模型时，开源与闭源的差距将以新的方式被重新定义。&lt;/p&gt;
&lt;p&gt;最后提醒：本文的分析基于官方博客的公开信息。K3 的完整技术报告将随模型权重一同发布，届时我们会对架构细节做更精确的验证和补充。&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;&lt;em&gt;本文基于 Kimi K3 官方技术博客（https://www.kimi.com/blog/kimi-k3）撰写。&lt;/em&gt;&lt;/p&gt;</description></item></channel></rss>