<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>FP8 on Bevisy's Blogs</title><link>https://bevisy.github.io/tags/fp8/</link><description>Recent content in FP8 on Bevisy's Blogs</description><generator>Hugo -- gohugo.io</generator><language>en-us</language><lastBuildDate>Mon, 27 Jul 2026 10:45:00 +0800</lastBuildDate><atom:link href="https://bevisy.github.io/tags/fp8/index.xml" rel="self" type="application/rss+xml"/><item><title>LLM 术语全景图（八）：量化方法——从 GPTQ 到 FP8</title><link>https://bevisy.github.io/p/llm-terminology-08-quantization/</link><pubDate>Mon, 27 Jul 2026 10:45:00 +0800</pubDate><guid>https://bevisy.github.io/p/llm-terminology-08-quantization/</guid><description>&lt;img src="https://bevisy.github.io/p/llm-terminology-08-quantization/08.png" alt="Featured image of post LLM 术语全景图（八）：量化方法——从 GPTQ 到 FP8" /&gt;
 &lt;blockquote&gt;
 &lt;p&gt;这是「大模型训练与推理术语全景图」系列的第 8 篇，覆盖量化方法的 6 个概念：GPTQ、AWQ、SmoothQuant、GGUF/llama.cpp、FP8 Quantization、QAT。
主要参考模型/框架：AutoGPTQ、AutoAWQ、vLLM、llama.cpp、Hopper GPU&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="开篇量化的两条路线分野"&gt;开篇：量化的两条路线分野
&lt;/h2&gt;&lt;p&gt;量化在 LLM 时代分出两条路线。数据中心路线——GPTQ、AWQ、SmoothQuant、FP8——面向 GPU 高吞吐服务，在精度与算力间求平衡：权重压到 INT4 省显存，激活保高精度，或用 W8A8 享受 Tensor Core 算力翻倍。消费级路线——GGUF——面向 CPU 与 Apple Metal 本地部署，把权重、tokenizer、架构参数打包进单文件，让 MacBook 也能跑 70B 模型。两条路线工具链不重叠，场景互补。路线内部一个明确趋势：FP8 正在取代 INT8 成为数据中心推理首选。LLM 激活值有大量异常值，定点 INT8 难以同时覆盖，需 SmoothQuant 辅助；而 FP8 浮点格式的指数位天然适配异常值动态范围，几乎无损即可拿到 Hopper GPU 上 BF16 两倍的 Tensor Core 算力。本篇按此脉络梳理 6 个量化术语。&lt;/p&gt;
&lt;h2 id="量化方法quantization-methods"&gt;量化方法（Quantization Methods）
&lt;/h2&gt;
 &lt;blockquote&gt;
 &lt;p&gt;量化是将高精度模型参数降至低精度以减少显存和加速推理的技术。本篇展开具体方法。&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;h3 id="gptq"&gt;GPTQ
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：GPTQ&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：GPTQ 量化&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：基于二阶 Hessian 信息的训练后量化方法，逐层将权重量化到 INT4/INT8，利用校准数据补偿量化误差。生成式任务中几乎无损，是 INT4 权重量化的主流方案。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：GPTQ 的核心思想：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;逐层量化：对每一层的权重矩阵 W 逐列量化&lt;/li&gt;
&lt;li&gt;Hessian 信息：用校准数据计算 H = X^T · X（输入的二阶统计量）&lt;/li&gt;
&lt;li&gt;顺序量化：量化第 j 列时，用 Hessian 信息预测量化误差，并补偿到未量化的列&lt;/li&gt;
&lt;li&gt;公式：quant 后的误差被投影到剩余权重上，最小化输出误差&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;量化流程：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;准备 ~128 条校准数据（如 C4/WikiText 片段）&lt;/li&gt;
&lt;li&gt;逐层运行校准数据，收集输入激活&lt;/li&gt;
&lt;li&gt;对每层权重做 GPTQ 量化（~几分钟）&lt;/li&gt;
&lt;li&gt;保存量化后的权重 + scale/zp&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;典型精度：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;W4A16（权重 INT4，激活 FP16）：显存 ~25% BF16，精度损失 &amp;lt; 1%&lt;/li&gt;
&lt;li&gt;W8A16：显存 ~50%，几乎无损&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;支持框架：AutoGPTQ、vLLM（原生支持 GPTQ 推理）、HuggingFace transformers&lt;/p&gt;
&lt;p&gt;局限：主要量化权重，激活仍需 FP16（W4A16 模式）；对极小模型（&amp;lt; 1B）精度损失更大。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：&amp;ldquo;GPTQ: Accurate Post-Training Quantization for GPT&amp;rdquo; (Frantar et al., 2022, arXiv:2210.17323)；AutoGPTQ；vLLM&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://arxiv.org/abs/2210.17323" target="_blank" rel="noopener"
 &gt;https://arxiv.org/abs/2210.17323&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://docs.vllm.ai/en/latest/features/quantization/gptqmodel/" target="_blank" rel="noopener"
 &gt;https://docs.vllm.ai/en/latest/features/quantization/gptqmodel/&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="activation-aware-weight-quantization"&gt;Activation-aware Weight Quantization
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：AWQ&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：激活感知权重量化&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：通过分析激活值的分布识别&amp;quot;重要权重&amp;quot;（对应大激活的权重），对重要权重保持高精度、对非重要权重量化压缩。比 GPTQ 更快（无需反向传播补偿），精度相当。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：AWQ 的核心发现：&lt;/p&gt;
&lt;p&gt;不是所有权重同等重要——与大激活值对应的权重对量化误差更敏感。
保持这些&amp;quot;重要权重&amp;quot;的高精度（或用 per-channel scale 缩放），其余权重可激进量化。&lt;/p&gt;
&lt;p&gt;AWQ 方法：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;用校准数据统计每通道激活的幅度分布&lt;/li&gt;
&lt;li&gt;对大激活通道的权重乘以 scale s（放大），量化后精度更高&lt;/li&gt;
&lt;li&gt;对应的激活除以 s（反缩放），保持等价性&lt;/li&gt;
&lt;li&gt;量化：W&amp;rsquo; = quant(W × s), X&amp;rsquo; = X / s → W&amp;rsquo; × X&amp;rsquo; ≈ W × X&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;与 GPTQ 对比：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;特性&lt;/th&gt;
					&lt;th&gt;GPTQ&lt;/th&gt;
					&lt;th&gt;AWQ&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;方法&lt;/td&gt;
					&lt;td&gt;Hessian 补偿&lt;/td&gt;
					&lt;td&gt;激活感知缩放&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;校准&lt;/td&gt;
					&lt;td&gt;需要（二阶计算）&lt;/td&gt;
					&lt;td&gt;需要（统计激活）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;速度&lt;/td&gt;
					&lt;td&gt;较慢（逐列补偿）&lt;/td&gt;
					&lt;td&gt;较快（仅需统计）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;精度&lt;/td&gt;
					&lt;td&gt;略优（复杂模型）&lt;/td&gt;
					&lt;td&gt;相当&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;通用性&lt;/td&gt;
					&lt;td&gt;广&lt;/td&gt;
					&lt;td&gt;广&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;支持：AutoAWQ、vLLM（原生支持）、HuggingFace&lt;/p&gt;
&lt;p&gt;W4A16 模式下 AWQ 和 GPTQ 是最常用的两种 INT4 量化方案。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：&amp;ldquo;AWQ: Activation-aware Weight Quantization for LLM Compression&amp;rdquo; (Lin et al., 2023, arXiv:2306.00978)；AutoAWQ；vLLM&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://arxiv.org/abs/2306.00978" target="_blank" rel="noopener"
 &gt;https://arxiv.org/abs/2306.00978&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://docs.vllm.ai/en/latest/features/quantization/auto_awq/" target="_blank" rel="noopener"
 &gt;https://docs.vllm.ai/en/latest/features/quantization/auto_awq/&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="smoothquant"&gt;SmoothQuant
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：—&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：平滑量化&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：将量化难度从激活值转移到权重的训练后量化方法。通过 per-channel 缩放因子&amp;quot;平滑&amp;quot;激活的异常值，使权重和激活都能用 INT8 量化（W8A8），无需 FP16 激活。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：SmoothQuant 解决的问题：&lt;/p&gt;
&lt;p&gt;LLM 激活值有大量异常值（outlier），使 INT8 量化激活困难。GPTQ/AWQ 量化权重但保持激活 FP16（W4A16），仍需 FP16 计算。SmoothQuant 使 W8A8 成为可能——权重和激活都是 INT8，享受 Tensor Core INT8 算力加速。&lt;/p&gt;
&lt;p&gt;核心方法：将量化难度从激活值转移到权重，具体步骤如下：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;统计每通道激活的最大值 s_j = max(|X_j|)^α / max(|W_j|)^(1-α)&lt;/li&gt;
&lt;li&gt;平滑：W&amp;rsquo;_j = W_j / s_j, X&amp;rsquo;_j = X_j × s_j&lt;/li&gt;
&lt;li&gt;平滑后：W&amp;rsquo; 的通道更均匀（便于量化），X&amp;rsquo; 的异常值被抑制&lt;/li&gt;
&lt;li&gt;量化：W&amp;rsquo;_int8 = quant(W&amp;rsquo;), X&amp;rsquo;_int8 = quant(X')&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;α 参数（迁移强度）：α=0.5 是平衡点，典型值 0.5~0.8。&lt;/p&gt;
&lt;p&gt;优势：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;W8A8：权重和激活都 INT8，推理用 INT8 GEMM（Tensor Core INT8 算力是 BF16 的 2x）&lt;/li&gt;
&lt;li&gt;无需 FP16 激活 → 减少内存带宽 → decode 加速&lt;/li&gt;
&lt;li&gt;精度损失小（&amp;lt; 1%）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;局限：INT8 精度不如 FP8（定点格式对异常值不友好），Hopper GPU 上 FP8 更优。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：&amp;ldquo;SmoothQuant: Accurate and Efficient Post-Training Quantization for LLMs&amp;rdquo; (Xiao et al., 2022, arXiv:2211.10438)；MIT-Han-Lab&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://arxiv.org/abs/2211.10438" target="_blank" rel="noopener"
 &gt;https://arxiv.org/abs/2211.10438&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://github.com/mit-han-lab/smoothquant" target="_blank" rel="noopener"
 &gt;https://github.com/mit-han-lab/smoothquant&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="gguf--llamacpp-quantization"&gt;GGUF / llama.cpp Quantization
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：GGUF&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：GGUF 量化格式&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：llama.cpp 项目定义的模型文件格式，支持 2~8 bit 多种量化方案，专为 CPU/消费级 GPU 推理优化。可在普通笔记本上运行大模型，是本地部署最流行的格式。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：GGUF（GPT-Generated Unified Format）替代了旧的 GGML 格式：&lt;/p&gt;
&lt;p&gt;支持的量化方案（按精度从高到低）：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;量化名&lt;/th&gt;
					&lt;th&gt;bit/权重&lt;/th&gt;
					&lt;th&gt;说明&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Q8_0&lt;/td&gt;
					&lt;td&gt;8&lt;/td&gt;
					&lt;td&gt;INT8 + FP16 scale，几乎无损&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Q6_K&lt;/td&gt;
					&lt;td&gt;6&lt;/td&gt;
					&lt;td&gt;6-bit 混合，精度好&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Q5_K_M&lt;/td&gt;
					&lt;td&gt;5.5&lt;/td&gt;
					&lt;td&gt;5-bit 混合，精度较好&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Q4_K_M&lt;/td&gt;
					&lt;td&gt;4.5&lt;/td&gt;
					&lt;td&gt;4-bit 混合，主流选择&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Q4_0&lt;/td&gt;
					&lt;td&gt;4&lt;/td&gt;
					&lt;td&gt;基础 4-bit，速度快&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Q3_K_M&lt;/td&gt;
					&lt;td&gt;3.5&lt;/td&gt;
					&lt;td&gt;3-bit 混合，精度有损&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Q2_K&lt;/td&gt;
					&lt;td&gt;2&lt;/td&gt;
					&lt;td&gt;极限压缩，明显有损&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;特点：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;单文件存储权重 + 元数据（tokenizer、架构参数）&lt;/li&gt;
&lt;li&gt;支持 CPU (AVX2/NEON) + GPU (CUDA/Metal) 混合推理&lt;/li&gt;
&lt;li&gt;部分层可在 GPU 计算，其余在 CPU（offload 层数可控）&lt;/li&gt;
&lt;li&gt;内存映射加载，启动快&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;使用场景：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;MacBook (Metal) 上跑 70B 模型（Q4 需 ~35GB 内存）&lt;/li&gt;
&lt;li&gt;没有数据中心 GPU 的本地开发和测试&lt;/li&gt;
&lt;li&gt;边缘设备部署&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;与 vLLM/FP8 的关系：GGUF 面向消费级硬件和 CPU 推理，vLLM/FP8 面向数据中心 GPU 高吞吐服务。两者互补，不竞争。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：llama.cpp (Georgi Gerganov)；GGUF 规范&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://github.com/ggerganov/llama.cpp" target="_blank" rel="noopener"
 &gt;https://github.com/ggerganov/llama.cpp&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://docs.vllm.ai/en/latest/features/quantization/gguf/" target="_blank" rel="noopener"
 &gt;https://docs.vllm.ai/en/latest/features/quantization/gguf/&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://github.com/ggml-org/llama.cpp/tree/master/gguf-py" target="_blank" rel="noopener"
 &gt;https://github.com/ggml-org/llama.cpp/tree/master/gguf-py&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="fp8-quantization"&gt;FP8 Quantization
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：FP8&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：FP8 量化&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：利用 Hopper GPU 原生 FP8 Tensor Core 的量化方案。相比 INT4/INT8 定点量化，FP8 浮点格式天然适配 LLM 激活的异常值分布，几乎无损且算力翻倍。正在取代 INT8 成为推理量化的首选。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：FP8 量化的两种模式：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;W8A8（权重+激活 FP8）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;权重和激活都用 FP8（E4M3）&lt;/li&gt;
&lt;li&gt;GEMM 用 FP8 Tensor Core（H100 算力 1979 TFLOPS，BF16 的 2x）&lt;/li&gt;
&lt;li&gt;需要校准确定 scale factor（per-tensor 或 per-channel）&lt;/li&gt;
&lt;li&gt;精度损失通常 &amp;lt; 0.5%&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;仅权重量化（W8A16）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;权重 FP8，激活 BF16&lt;/li&gt;
&lt;li&gt;用于不支持 FP8 计算的 GPU（如 A100）&lt;/li&gt;
&lt;li&gt;显存减半，但计算无加速&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;两种 FP8 编码格式（由 &amp;ldquo;FP8 Formats for Deep Learning&amp;rdquo; 定义）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;E4M3（4 位指数 + 3 位尾数）：更多尾数位，精度更高，用于权重/激活与前向推理&lt;/li&gt;
&lt;li&gt;E5M2（5 位指数 + 2 位尾数）：更多指数位，动态范围更大，用于梯度/反向传播
推理场景主要使用 E4M3；E5M2 因动态范围大，在训练的反向梯度中更常见。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;FP8 vs INT8：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;特性&lt;/th&gt;
					&lt;th&gt;FP8 (E4M3)&lt;/th&gt;
					&lt;th&gt;INT8&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;格式&lt;/td&gt;
					&lt;td&gt;浮点（指数+尾数）&lt;/td&gt;
					&lt;td&gt;定点&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;异常值&lt;/td&gt;
					&lt;td&gt;天然适配（浮点有指数）&lt;/td&gt;
					&lt;td&gt;需要缩放/校准&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;精度&lt;/td&gt;
					&lt;td&gt;更好（LLM 激活）&lt;/td&gt;
					&lt;td&gt;需 SmoothQuant 等辅助&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;算力&lt;/td&gt;
					&lt;td&gt;H100 原生 1979T&lt;/td&gt;
					&lt;td&gt;H100 原生 1979T&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;门槛&lt;/td&gt;
					&lt;td&gt;需 Hopper+&lt;/td&gt;
					&lt;td&gt;A100 即可&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;实践用法（vLLM）：&lt;/p&gt;
&lt;h1 id="fp8-权重量化无需校准"&gt;FP8 权重量化（无需校准）
&lt;/h1&gt;&lt;p&gt;&amp;ndash;quantization fp8&lt;/p&gt;
&lt;h1 id="fp8-kv-cache长上下文减半-kv-内存"&gt;FP8 KV Cache（长上下文减半 KV 内存）
&lt;/h1&gt;&lt;p&gt;&amp;ndash;kv-cache-dtype fp8&lt;/p&gt;
&lt;p&gt;局限：需 Hopper (H100/H200) 或 Ada (RTX 4090/6000) 架构。A100 不支持 FP8 Tensor Core。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：&amp;ldquo;FP8 Formats for Deep Learning&amp;rdquo; (2022)；vLLM FP8；TensorRT-LLM FP8；FlashAttention-3 FP8&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://docs.vllm.ai/en/latest/features/quantization/fp8/" target="_blank" rel="noopener"
 &gt;https://docs.vllm.ai/en/latest/features/quantization/fp8/&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://nvidia.github.io/TensorRT-LLM/reference/precision.html" target="_blank" rel="noopener"
 &gt;https://nvidia.github.io/TensorRT-LLM/reference/precision.html&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="quantization-aware-training"&gt;Quantization-Aware Training
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：QAT&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：量化感知训练&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：在训练过程中模拟量化效应（假量化），让模型在训练时就适应低精度表示。精度高于训练后量化（PTQ），但需要训练成本。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：QAT vs PTQ：&lt;/p&gt;
&lt;p&gt;PTQ（训练后量化）：训练完的 FP16/BF16 模型直接量化，无需再训练&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;优点：快速，无需训练数据和资源&lt;/li&gt;
&lt;li&gt;缺点：低 bit（INT4 以下）精度损失明显&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;QAT（量化感知训练）：在微调阶段插入假量化节点&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;前向传播时模拟量化：x_fake = dequant(quant(x))，让模型&amp;quot;看到&amp;quot;量化误差&lt;/li&gt;
&lt;li&gt;反向传播用 STE（Straight-Through Estimator）绕过量化不可导问题&lt;/li&gt;
&lt;li&gt;模型学会调整权重以适应量化噪声&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;QAT 流程：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;从预训练 FP16 模型出发&lt;/li&gt;
&lt;li&gt;插入假量化节点（目标精度如 INT4/INT8）&lt;/li&gt;
&lt;li&gt;用训练数据继续训练几个 epoch&lt;/li&gt;
&lt;li&gt;导出真正的量化模型&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;适用场景：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;需要 INT4 以下极端量化且 PTQ 精度不够时&lt;/li&gt;
&lt;li&gt;部署在边缘设备（手机、嵌入式）有严格精度约束&lt;/li&gt;
&lt;li&gt;对精度要求极高的生成任务&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;实践中：LLM 很少用 QAT（训练成本高），大多用 PTQ（GPTQ/AWQ/FP8）已足够。QAT 更多用于 CV 模型和移动端部署。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：&amp;ldquo;Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference&amp;rdquo; (Jacob et al., 2018, arXiv:1712.05877)；LLM-QAT (arXiv:2207.04265)&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://arxiv.org/abs/1712.05877" target="_blank" rel="noopener"
 &gt;https://arxiv.org/abs/1712.05877&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="本篇小结"&gt;本篇小结
&lt;/h2&gt;&lt;p&gt;本篇 6 个量化术语沿&amp;quot;两条路线 + 一个趋势&amp;quot;归位：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;GPTQ&lt;/strong&gt; 基于 Hessian 信息的逐列补偿，W4A16 模式下显存 ~25% BF16、精度损失 &amp;lt; 1%，局限是仅量化权重、激活仍需 FP16。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;AWQ&lt;/strong&gt; 以&amp;quot;与大激活值对应的权重更敏感&amp;quot;为出发点，用 per-channel scale 缩放而非二阶补偿，比 GPTQ 更快、精度相当；W4A16 下与 GPTQ 并列最常用 INT4 方案。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;SmoothQuant&lt;/strong&gt; 把量化难度从激活值转移到权重，使 W8A8 成为可能，享受 Tensor Core INT8 算力（BF16 的 2x）；但 INT8 定点格式对异常值不友好，Hopper GPU 上 FP8 更优。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GGUF&lt;/strong&gt; 是消费级路线的代表，Q2_K~Q8_0 单文件便携，MacBook Metal 上 Q4 跑 70B 约 35GB 内存；与 vLLM/FP8 数据中心路线互补而非竞争。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;FP8 Quantization&lt;/strong&gt; 是数据中心推理的新首选：E4M3（前向/推理，更多尾数）与 E5M2（反向/梯度，更多指数）两种编码，浮点格式天然适配 LLM 激活异常值，H100 上算力 1979 TFLOPS（BF16 的 2x）；硬件门槛是 Hopper/Ada，A100 不支持 FP8 Tensor Core。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;QAT&lt;/strong&gt; 精度高于 PTQ 但需训练成本，LLM 实践中很少用 QAT，PTQ（GPTQ/AWQ/FP8）已足够；QAT 主要用于 CV 模型与移动端部署。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;两条路线的边界清晰：数据中心 GPU 上 FP8/INT8 量化服务高吞吐推理，消费级 CPU/Metal 上 GGUF 单文件服务本地部署；FP8 取代 INT8 的趋势由 LLM 激活异常值分布驱动，定点格式需 SmoothQuant 辅助，浮点格式原生适配。&lt;/p&gt;
&lt;p&gt;本系列共 11 篇，本文是第 8 篇。&lt;/p&gt;</description></item><item><title>LLM 术语全景图（七）：GPU 硬件与计算——从 Tensor Core 到 HBM</title><link>https://bevisy.github.io/p/llm-terminology-07-gpu-hardware/</link><pubDate>Mon, 27 Jul 2026 10:30:00 +0800</pubDate><guid>https://bevisy.github.io/p/llm-terminology-07-gpu-hardware/</guid><description>&lt;img src="https://bevisy.github.io/p/llm-terminology-07-gpu-hardware/07.png" alt="Featured image of post LLM 术语全景图（七）：GPU 硬件与计算——从 Tensor Core 到 HBM" /&gt;
 &lt;blockquote&gt;
 &lt;p&gt;这是「大模型训练与推理术语全景图」系列的第 7 篇，覆盖 GPU 硬件与计算的 8 个概念：Tensor Core、MMA/WGMMA、TMA、HBM、BF16、FP8、AllReduce/AllGather/ReduceScatter、NVLink/NVSwitch。
主要参考架构：NVIDIA Volta/Ampere/Hopper/Blackwell、CUTLASS、FlashAttention-3、NCCL&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="开篇理解-gpu-硬件是优化-llm-的前提"&gt;开篇：理解 GPU 硬件是优化 LLM 的前提
&lt;/h2&gt;&lt;p&gt;LLM 推理的两个阶段受限于完全不同的资源。prefill 一次性处理整段 prompt，矩阵乘法的 FLOPs 大、每个权重被反复使用，瓶颈落在 Tensor Core 算力上，属于 compute-bound；decode 逐 token 自回归生成，每生成 1 个 token 都要把全部模型权重和当前 KV Cache 从 HBM 读进 SM，FLOPs 很小但读取量极大，瓶颈落在 HBM 带宽上，属于 memory-bound。这两种瓶颈分别决定了优化方向：compute-bound 看算力（更低精度、更稠密的 Tensor Core 利用率），memory-bound 看带宽（更小的权重、更少的读取）。量化把权重从 BF16 压到 FP8/INT4，本质是减少单位计算的 HBM 读取量；MoE 每次只激活少数专家，本质是减少单次 decode 实际需要读取的权重。所有主流 LLM 优化都能归到&amp;quot;降读取&amp;quot;或&amp;quot;降计算&amp;quot;这两条路径上，而判断走哪条路径的前提，是先看清 GPU 的算力墙和带宽墙分别在哪。本篇按硬件层次梳理 8 个术语：从计算单元（Tensor Core、MMA/WGMMA、TMA）、到内存与数据格式（HBM、BF16、FP8）、再到多卡互连（AllReduce 系原语、NVLink/NVSwitch）。&lt;/p&gt;
&lt;h2 id="gpu-硬件与计算gpu-hardware--compute"&gt;GPU 硬件与计算（GPU Hardware &amp;amp; Compute）
&lt;/h2&gt;&lt;h3 id="tensor-core"&gt;Tensor Core
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：—&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：张量核心&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：NVIDIA GPU 上专门用于矩阵乘法（GEMM）的硬件单元，单个时钟周期可完成一个矩阵乘加操作。相比 CUDA Core 做标量乘法，Tensor Core 吞吐量高出一个数量级，是 LLM 计算的核心引擎。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：Tensor Core 的计算能力：&lt;/p&gt;
&lt;p&gt;CUDA Core：每周期 1 个 FP32 FMA（fused multiply-add）
Tensor Core：每周期一个矩阵乘加，如 D = A × B + C（A/B/C/D 是小矩阵块）&lt;/p&gt;
&lt;p&gt;各代 Tensor Core 支持的精度：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;GPU 架构&lt;/th&gt;
					&lt;th&gt;Tensor Core 代&lt;/th&gt;
					&lt;th&gt;支持精度&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Volta (V100)&lt;/td&gt;
					&lt;td&gt;第 1 代&lt;/td&gt;
					&lt;td&gt;FP16&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Ampere (A100)&lt;/td&gt;
					&lt;td&gt;第 3 代&lt;/td&gt;
					&lt;td&gt;FP16, BF16, TF32, INT8, INT4&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Hopper (H100)&lt;/td&gt;
					&lt;td&gt;第 4 代&lt;/td&gt;
					&lt;td&gt;FP16, BF16, TF32, FP8(E4M3/E5M2), INT8&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Blackwell (B200)&lt;/td&gt;
					&lt;td&gt;第 5 代&lt;/td&gt;
					&lt;td&gt;FP4, FP6, FP8, BF16, FP16&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;对 LLM 的影响：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;训练：BF16 是主力精度（Tensor Core 原生加速，动态范围大）&lt;/li&gt;
&lt;li&gt;推理：FP8（Hopper）和 FP4（Blackwell）大幅提升吞吐&lt;/li&gt;
&lt;li&gt;A100-SXM4-40GB：第 3 代 Tensor Core，BF16 算力 312 TFLOPS&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;MMA 指令：Tensor Core 通过 MMA (Matrix Multiply-Accumulate) 指令编程。CUTLASS 和 Triton 库在底层调用 MMA 指令实现高效 GEMM。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：NVIDIA Volta 架构白皮书 (2017)；CUTLASS 库；Triton 编译器&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://docs.nvidia.com/cutlass/latest/media/docs/cpp/cute/00_quickstart.html" target="_blank" rel="noopener"
 &gt;https://docs.nvidia.com/cutlass/latest/media/docs/cpp/cute/00_quickstart.html&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://developer.nvidia.com/blog/cutlass-linear-algebra-cuda/" target="_blank" rel="noopener"
 &gt;https://developer.nvidia.com/blog/cutlass-linear-algebra-cuda/&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="matrix-multiply-accumulate"&gt;Matrix Multiply-Accumulate
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：MMA / WGMMA&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：矩阵乘加指令&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：驱动 Tensor Core 的底层指令。MMA 是 Ampere 及之前架构的同步指令，WGMMA (Warp Group MMA) 是 Hopper 架构引入的异步指令，支持 TMA 加载数据，吞吐量大幅提升。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：MMA vs WGMMA：&lt;/p&gt;
&lt;p&gt;MMA（Ampere 及之前）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;同步执行，线程束(warp)级&lt;/li&gt;
&lt;li&gt;数据需先加载到寄存器，再调用 MMA&lt;/li&gt;
&lt;li&gt;矩阵块较小（如 16×8×16 for FP16）&lt;/li&gt;
&lt;li&gt;数据加载和计算串行，有等待空闲&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;WGMMA（Hopper）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;异步执行，线程束组(warp group, 4 warps)级&lt;/li&gt;
&lt;li&gt;可直接从共享内存(shared memory)异步执行矩阵乘加&lt;/li&gt;
&lt;li&gt;矩阵块更大（如 64×128×16 for BF16, 128×256×32 for FP8）&lt;/li&gt;
&lt;li&gt;与 TMA 配合：TMA 异步加载数据到共享内存，WGMMA 异步从共享内存计算&lt;/li&gt;
&lt;li&gt;计算和数据加载可重叠（double buffer），接近峰值算力&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;编程接口：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;PTX 汇编：mma.sync / wgmma.mma_async 指令&lt;/li&gt;
&lt;li&gt;CUTLASS 3.x：Cute 库封装 WGMMA&lt;/li&gt;
&lt;li&gt;Triton：编译器自动选择 MMA/WGMMA&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;对 LLM 的影响：WGMMA 使 H100 的 FP8 算力达到近 2000 TFLOPS（理论峰值），是 A100 BF16 的 ~6x。Flash Attention-3 专门利用 WGMMA + TMA 实现 FP8 注意力。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：NVIDIA Hopper 架构白皮书 (2022)；CUTLASS 3.x；FlashAttention-3&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://docs.nvidia.com/cuda/parallel-thread-execution/" target="_blank" rel="noopener"
 &gt;https://docs.nvidia.com/cuda/parallel-thread-execution/&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://github.com/NVIDIA/cutlass" target="_blank" rel="noopener"
 &gt;https://github.com/NVIDIA/cutlass&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="tensor-memory-accelerator"&gt;Tensor Memory Accelerator
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：TMA&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：张量内存加速器&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：Hopper 架构引入的专用硬件单元，用于在 HBM 和共享内存之间高效异步搬运多维张量。替代手动内存管理，与 WGMMA 配合实现计算-通信重叠。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：TMA 解决的问题：&lt;/p&gt;
&lt;p&gt;传统方式：程序员用 global memory load 指令逐元素/逐块加载数据到寄存器，再存储到共享内存。线程开销大，带宽利用率低。&lt;/p&gt;
&lt;p&gt;TMA 方式：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;预设张量描述符（descriptor）：定义 HBM 中的张量形状、跨度、维度&lt;/li&gt;
&lt;li&gt;单条指令发起异步拷贝：整个多维切片从 HBM → 共享内存&lt;/li&gt;
&lt;li&gt;不占用线程，由专用 DMA 引擎执行&lt;/li&gt;
&lt;li&gt;通过 mbarrier（内存屏障）同步完成&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;TMA 优势：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;异步：不占用计算线程，与 WGMMA 计算重叠&lt;/li&gt;
&lt;li&gt;多维：原生支持 1D~5D 张量拷贝，无需手动算地址&lt;/li&gt;
&lt;li&gt;高带宽：接近 HBM 峰值带宽（H100: 3.35 TB/s）&lt;/li&gt;
&lt;li&gt;跨节点：直接支持多卡共享内存间拷贝（配合 NVSwitch）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;与 Flash Attention-3 的关系：FA3 的核心优化之一就是用 TMA 替代 FA2 中的手动数据加载，实现 prefetch + 计算重叠，FP8 注意力吞吐提升 ~75%。&lt;/p&gt;
&lt;p&gt;Blackwell (B200) 进一步增强 TMA，支持 FP4 精度张量搬运。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：NVIDIA Hopper 架构白皮书 (2022)；FlashAttention-3 (arXiv:2407.08608)；CUTLASS 3.x&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://docs.nvidia.com/cuda/parallel-thread-execution/#tensor-memory-accelerator" target="_blank" rel="noopener"
 &gt;https://docs.nvidia.com/cuda/parallel-thread-execution/#tensor-memory-accelerator&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://github.com/Dao-AILab/flash-attention" target="_blank" rel="noopener"
 &gt;https://github.com/Dao-AILab/flash-attention&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="high-bandwidth-memory"&gt;High Bandwidth Memory
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：HBM&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：高带宽内存&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：GPU 上的高带宽显存，通过 3D 堆叠 DRAM 实现远超普通 DDR 的带宽。LLM 推理的主要瓶颈往往不是算力而是 HBM 带宽（memory-bound）。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：各代 HBM 参数：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;HBM 代&lt;/th&gt;
					&lt;th&gt;GPU&lt;/th&gt;
					&lt;th&gt;带宽&lt;/th&gt;
					&lt;th&gt;容量&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;HBM2&lt;/td&gt;
					&lt;td&gt;V100&lt;/td&gt;
					&lt;td&gt;0.9 TB/s&lt;/td&gt;
					&lt;td&gt;32GB&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;HBM2e&lt;/td&gt;
					&lt;td&gt;A100 80GB&lt;/td&gt;
					&lt;td&gt;2.0 TB/s&lt;/td&gt;
					&lt;td&gt;80GB&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;HBM3&lt;/td&gt;
					&lt;td&gt;H100 SXM5&lt;/td&gt;
					&lt;td&gt;3.35 TB/s&lt;/td&gt;
					&lt;td&gt;80GB&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;HBM3e&lt;/td&gt;
					&lt;td&gt;B200&lt;/td&gt;
					&lt;td&gt;8 TB/s&lt;/td&gt;
					&lt;td&gt;192GB&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Memory-bound vs Compute-bound：&lt;/p&gt;
&lt;p&gt;LLM 推理的 decode 阶段是典型的 memory-bound：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;每生成 1 个 token，需从 HBM 读取全部模型权重 + KV Cache&lt;/li&gt;
&lt;li&gt;计算量小（1 个 token × 全部权重），但读取量大&lt;/li&gt;
&lt;li&gt;瓶颈 = 权重 / HBM 带宽，而非算力&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;LLM 推理的 prefill 阶段是 compute-bound：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;处理整段 prompt，矩阵乘法计算量大&lt;/li&gt;
&lt;li&gt;瓶颈 = FLOPs / Tensor Core 算力&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;量化算例：decode 每生成 1 token 需读取全部模型权重（70B = 140GB BF16），H100 3.35 TB/s → ~42ms → ~24 token/s。这就是 decode 阶段的天花板——单卡 H100 跑 70B BF16 的理论极限约 24 token/s，实际还要扣 KV Cache 读取和算力开销。&lt;/p&gt;
&lt;p&gt;优化启示：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;量化（INT4/FP8）减少权重大小 → 减少读取量 → 加速 decode&lt;/li&gt;
&lt;li&gt;Flash Attention 减少 HBM 读写 → 加速注意力&lt;/li&gt;
&lt;li&gt;MoE 只激活部分专家 → 减少实际读取的权重&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;带宽利用率：高效实现（如 Flash Attention）可达 HBM 峰值带宽的 70-85%。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：NVIDIA 各架构白皮书；HBM 标准 (JEDEC)&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://www.nvidia.com/en-us/data-center/h100/" target="_blank" rel="noopener"
 &gt;https://www.nvidia.com/en-us/data-center/h100/&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://arxiv.org/abs/2205.14135" target="_blank" rel="noopener"
 &gt;https://arxiv.org/abs/2205.14135&lt;/a&gt; (Flash Attention IO 复杂度分析)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="bfloat16"&gt;Bfloat16
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：BF16&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：Brain 浮点 16 位&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：Google Brain 团队设计的 16 位浮点格式，与 FP16 相同的总位数但指数位更多（8 位指数 + 7 位尾数），动态范围与 FP32 相同，训练稳定性远优于 FP16。现代 LLM 训练和推理的默认精度。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：BF16 vs FP16 vs FP32：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;格式&lt;/th&gt;
					&lt;th&gt;总位数&lt;/th&gt;
					&lt;th&gt;指数&lt;/th&gt;
					&lt;th&gt;尾数&lt;/th&gt;
					&lt;th&gt;动态范围&lt;/th&gt;
					&lt;th&gt;精度&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;FP32&lt;/td&gt;
					&lt;td&gt;32&lt;/td&gt;
					&lt;td&gt;8&lt;/td&gt;
					&lt;td&gt;23&lt;/td&gt;
					&lt;td&gt;±3.4e38&lt;/td&gt;
					&lt;td&gt;高&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;FP16&lt;/td&gt;
					&lt;td&gt;16&lt;/td&gt;
					&lt;td&gt;5&lt;/td&gt;
					&lt;td&gt;10&lt;/td&gt;
					&lt;td&gt;±65504&lt;/td&gt;
					&lt;td&gt;中&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;BF16&lt;/td&gt;
					&lt;td&gt;16&lt;/td&gt;
					&lt;td&gt;8&lt;/td&gt;
					&lt;td&gt;7&lt;/td&gt;
					&lt;td&gt;±3.4e38&lt;/td&gt;
					&lt;td&gt;低（同 FP32 范围）&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;BF16 的优势：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;与 FP32 相同的指数位（8 位），动态范围完全一致&lt;/li&gt;
&lt;li&gt;训练时无需 loss scaling（FP16 需要，否则梯度下溢）&lt;/li&gt;
&lt;li&gt;与 FP32 互转简单：BF16 → FP32 只需右侧补零&lt;/li&gt;
&lt;li&gt;Ampere+ Tensor Core 原生支持 BF16&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;实践用法：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;训练：权重和激活用 BF16，主权重和优化器状态用 FP32（混合精度训练）&lt;/li&gt;
&lt;li&gt;推理：BF16 是无损推理的默认精度，权重占 FP32 的一半&lt;/li&gt;
&lt;li&gt;KV Cache：通常用 BF16 存储&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;注意：BF16 尾数只有 7 位（FP16 有 10 位），精度略低。但 LLM 训练对动态范围更敏感，BF16 是更好的选择。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：Google Brain (2018)；Ampere/Hopper/Blackwell Tensor Core 原生支持&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://en.wikipedia.org/wiki/Bfloat16_floating-point_format" target="_blank" rel="noopener"
 &gt;https://en.wikipedia.org/wiki/Bfloat16_floating-point_format&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="fp8"&gt;FP8
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：FP8&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：8 位浮点&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：Hopper 架构原生支持的 8 位浮点格式，有两种变体 E4M3（4 位指数 + 3 位尾数）和 E5M2（5 位指数 + 2 位尾数）。相比 BF16 算力翻倍、显存减半，是推理量化和训练加速的新标准。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：FP8 的两种格式：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;格式&lt;/th&gt;
					&lt;th&gt;指数&lt;/th&gt;
					&lt;th&gt;尾数&lt;/th&gt;
					&lt;th&gt;动态范围&lt;/th&gt;
					&lt;th&gt;精度&lt;/th&gt;
					&lt;th&gt;适用场景&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;E4M3&lt;/td&gt;
					&lt;td&gt;4&lt;/td&gt;
					&lt;td&gt;3&lt;/td&gt;
					&lt;td&gt;±448&lt;/td&gt;
					&lt;td&gt;较高&lt;/td&gt;
					&lt;td&gt;前向传播、权重、激活&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;E5M2&lt;/td&gt;
					&lt;td&gt;5&lt;/td&gt;
					&lt;td&gt;2&lt;/td&gt;
					&lt;td&gt;±57344&lt;/td&gt;
					&lt;td&gt;较低&lt;/td&gt;
					&lt;td&gt;反向梯度（需要更大范围）&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;混合精度 FP8 训练：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;前向：权重和激活用 E4M3&lt;/li&gt;
&lt;li&gt;反向：梯度用 E5M2&lt;/li&gt;
&lt;li&gt;主权重和优化器仍用 FP32/BF16&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Hopper 算力对比：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;精度&lt;/th&gt;
					&lt;th&gt;H100 算力 (TFLOPS)&lt;/th&gt;
					&lt;th&gt;相对 BF16&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;BF16&lt;/td&gt;
					&lt;td&gt;989&lt;/td&gt;
					&lt;td&gt;1x&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;FP8&lt;/td&gt;
					&lt;td&gt;1979&lt;/td&gt;
					&lt;td&gt;2x&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;推理中的 FP8：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;权重 FP8：显存减半（相比 BF16），decode 阶段读取量减半 → 吞吐近翻倍&lt;/li&gt;
&lt;li&gt;KV Cache FP8：长上下文场景的 KV Cache 内存减半&lt;/li&gt;
&lt;li&gt;几乎无损：FP8 量化精度损失通常 &amp;lt; 1%（比 INT8 更好，因为浮点格式天然适配异常值）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;与 INT8 的区别：FP8 是浮点格式，有指数和尾数，能更好地表示大动态范围的 LLM 激活值。INT8 是定点格式，需要校准和缩放因子。&lt;/p&gt;
&lt;p&gt;Blackwell (B200) 进一步支持 FP4 和 FP6，算力可达 10 PFLOPS 级别。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：&amp;ldquo;FP8 Formats for Deep Learning&amp;rdquo; (NVIDIA/ARM/Intel, 2022)；Hopper 架构；FlashAttention-3 (FP8 attention)；vLLM FP8 推理&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://docs.nvidia.com/deeplearning/performance/mixed-precision-training/" target="_blank" rel="noopener"
 &gt;https://docs.nvidia.com/deeplearning/performance/mixed-precision-training/&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://docs.vllm.ai/en/latest/features/quantization/fp8/" target="_blank" rel="noopener"
 &gt;https://docs.vllm.ai/en/latest/features/quantization/fp8/&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="allreduce--allgather--reducescatter"&gt;AllReduce / AllGather / ReduceScatter
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：—&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：集合通信原语&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：多 GPU 通信的三个基础原语。AllReduce 求和并广播结果，AllGather 收集各卡数据拼成完整结果，ReduceScatter 求和后按分片分发。是 TP/PP/DP/FSDP 的通信基础。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：三种通信原语：&lt;/p&gt;
&lt;p&gt;AllReduce（TP/DP 用）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;各卡有一个相同大小的张量，求和后所有卡获得相同结果&lt;/li&gt;
&lt;li&gt;Ring AllReduce：通信量 = 2 × (N-1)/N × tensor_size（最优）&lt;/li&gt;
&lt;li&gt;用途：TP 中 attention/FFN 后的梯度同步；DP 中梯度同步&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;AllGather（FSDP/ZeRO-3 前向用）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;各卡有不同的分片，收集拼成完整张量，所有卡获得相同完整结果&lt;/li&gt;
&lt;li&gt;通信量 = (N-1)/N × tensor_size&lt;/li&gt;
&lt;li&gt;用途：FSDP 前向恢复完整参数；CP 中收集各段 KV&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;ReduceScatter（FSDP/ZeRO-3 反向用）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;各卡有完整张量，求和后按分片分发——每卡只得到一个分片&lt;/li&gt;
&lt;li&gt;通信量 = (N-1)/N × tensor_size&lt;/li&gt;
&lt;li&gt;用途：FSDP 反向后分片同步梯度&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;关系：AllReduce = ReduceScatter + AllGather（先求和分片，再收集完整）&lt;/p&gt;
&lt;p&gt;通信库：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;NCCL (NVIDIA Collective Communications Library)：GPU 集合通信标准库&lt;/li&gt;
&lt;li&gt;依赖 NVLink/NVSwitch 拓扑，跨节点走 InfiniBand/RoCE&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;通信优化：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;计算-通信重叠：在前向计算时同时启动下一步的通信&lt;/li&gt;
&lt;li&gt;梯度分桶(bucketing)：将梯度分成多个 bucket 分别通信，重叠更充分&lt;/li&gt;
&lt;li&gt;通信压缩：梯度 BF16/FP8 传输减少带宽&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：NCCL (NVIDIA)；Horovod；Megatron-LM 通信优化&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://docs.nvidia.com/deeplearning/nccl/" target="_blank" rel="noopener"
 &gt;https://docs.nvidia.com/deeplearning/nccl/&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://docs.pytorch.org/docs/stable/distributed.html" target="_blank" rel="noopener"
 &gt;https://docs.pytorch.org/docs/stable/distributed.html&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="nvlink--nvswitch"&gt;NVLink / NVSwitch
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缩写&lt;/strong&gt;：—&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;中文名称&lt;/strong&gt;：NVLink 互连 / NVSwitch 交换&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;简短介绍&lt;/strong&gt;：NVIDIA 的高速 GPU 互连技术。NVLink 是点对点直连（单链路 50-100 GB/s），NVSwitch 是全互连交换芯片（所有 GPU 间全带宽）。是 TP 等高通信量并行的硬件基础。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;详细介绍&lt;/strong&gt;：NVLink 各代带宽：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;NVLink 代&lt;/th&gt;
					&lt;th&gt;GPU&lt;/th&gt;
					&lt;th&gt;单链路带宽&lt;/th&gt;
					&lt;th&gt;总带宽&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;NVLink 2&lt;/td&gt;
					&lt;td&gt;V100&lt;/td&gt;
					&lt;td&gt;25 GB/s&lt;/td&gt;
					&lt;td&gt;300 GB/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;NVLink 3&lt;/td&gt;
					&lt;td&gt;A100&lt;/td&gt;
					&lt;td&gt;50 GB/s&lt;/td&gt;
					&lt;td&gt;600 GB/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;NVLink 4&lt;/td&gt;
					&lt;td&gt;H100&lt;/td&gt;
					&lt;td&gt;50 GB/s&lt;/td&gt;
					&lt;td&gt;900 GB/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;NVLink 5&lt;/td&gt;
					&lt;td&gt;B200&lt;/td&gt;
					&lt;td&gt;100 GB/s&lt;/td&gt;
					&lt;td&gt;1.8 TB/s&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;与 PCIe 对比：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;PCIe 5.0：~64 GB/s（单向），共享带宽&lt;/li&gt;
&lt;li&gt;NVLink 4：900 GB/s（总），点对点专用&lt;/li&gt;
&lt;li&gt;NVLink 比 PCIe 高 10-15 倍&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;NVSwitch：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;专用 ASIC 交换芯片，使节点内所有 GPU 全互连（而非点对点）&lt;/li&gt;
&lt;li&gt;8× H100 + NVSwitch：任何两卡间 900 GB/s 全带宽&lt;/li&gt;
&lt;li&gt;DGX H100/H200 节点标配&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;对并行策略的影响：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;TP：通信量大（每层 2 次 AllReduce），必须在节点内（NVLink 域），跨节点 TP 性能急剧下降&lt;/li&gt;
&lt;li&gt;PP：通信量小（只传隐状态），可跨节点（InfiniBand）&lt;/li&gt;
&lt;li&gt;EP：All-to-All 通信，最好在节点内或高带宽网络&lt;/li&gt;
&lt;li&gt;DP/FSDP：梯度同步通信量中等，可跨节点&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;实践规则：TP ≤ 节点内 GPU 数（如 TP=8 for 8×H100），DP/PP 可跨节点。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;关联论文/模型&lt;/strong&gt;：NVIDIA NVLink 白皮书；DGX H100/H200 架构&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;权威分析链接&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://www.nvidia.com/en-us/data-center/nvlink/" target="_blank" rel="noopener"
 &gt;https://www.nvidia.com/en-us/data-center/nvlink/&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="本篇小结"&gt;本篇小结
&lt;/h2&gt;&lt;p&gt;本篇 8 个 GPU 硬件术语沿&amp;quot;算力墙 vs 带宽墙&amp;quot;两条主线归位：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Tensor Core&lt;/strong&gt; 是 GPU 上专门做矩阵乘加的硬件单元，每周期完成一个小矩阵块 D = A×B + C，相比 CUDA Core 的标量 FMA 高出一个数量级；各代支持的精度逐步扩展（Volta FP16 → Ampere +BF16/TF32/INT8/INT4 → Hopper +FP8 → Blackwell +FP4/FP6），A100-SXM4-40GB 的 BF16 算力为 312 TFLOPS。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;MMA / WGMMA&lt;/strong&gt; 是驱动 Tensor Core 的底层指令。MMA 是 Ampere 及之前的同步 warp 级指令，数据加载与计算串行；WGMMA 是 Hopper 的异步 warp group 级指令，可直接从共享内存异步执行矩阵乘加，并与 TMA 配合实现计算-加载重叠。WGMMA 使 H100 的 FP8 算力达到近 2000 TFLOPS，约为 A100 BF16 的 6x；Flash Attention-3 专门利用 WGMMA + TMA 实现 FP8 注意力。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;TMA&lt;/strong&gt; 是 Hopper 引入的张量内存加速器，单条指令即可发起异步拷贝、把整个多维切片从 HBM 搬到共享内存，不占用计算线程。FA3 用 TMA 替代 FA2 中的手动数据加载，实现 prefetch + 计算重叠，FP8 注意力吞吐提升约 75%。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;HBM&lt;/strong&gt; 是 GPU 上的高带宽显存，带宽从 V100 的 0.9 TB/s 增长到 B200 的 8 TB/s。LLM 推理 decode 阶段是 memory-bound：每生成 1 token 需读取全部模型权重，70B BF16 = 140GB，H100 3.35 TB/s → ~42ms → ~24 token/s 的理论上限。prefill 阶段则是 compute-bound，瓶颈在 Tensor Core 算力。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;BF16&lt;/strong&gt; 是 16 位浮点格式，8 位指数 + 7 位尾数，与 FP32 指数位相同、动态范围完全一致，训练时无需 loss scaling，是现代 LLM 训练和推理的默认精度。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;FP8&lt;/strong&gt; 是 Hopper 原生支持的 8 位浮点格式，有 E4M3（前向/权重/激活）和 E5M2（反向梯度）两种变体；H100 上 BF16 为 989 TFLOPS、FP8 为 1979 TFLOPS，正好 2x。Blackwell B200 进一步支持 FP4 和 FP6，算力可达 10 PFLOPS 级别。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;AllReduce / AllGather / ReduceScatter&lt;/strong&gt; 是多 GPU 集合通信的三个基础原语：AllReduce 求和并广播、AllGather 收集拼完整、ReduceScatter 求和后按分片分发；AllReduce = ReduceScatter + AllGather。它们是 TP/PP/DP/FSDP 的通信基础，由 NCCL 实现，底层依赖 NVLink/NVSwitch 拓扑。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;NVLink / NVSwitch&lt;/strong&gt; 是 NVIDIA 的高速 GPU 互连：NVLink 是点对点直连，NVSwitch 是全互连交换芯片。NVLink 总带宽从 V100 的 300 GB/s 增长到 B200 的 1.8 TB/s，比 PCIe 5.0 高 10-15 倍。TP 通信量大必须在 NVLink 域内，DP/PP 可跨节点。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;一句话收束：LLM 的所有主流优化都能归到&amp;quot;降读取&amp;quot;（量化、MoE、Flash Attention）或&amp;quot;降计算&amp;quot;（更低精度、更稠密的 Tensor Core 利用率）两条路径上；判断走哪条路径，前提是先看清算力墙和带宽墙分别在哪——这正是本篇 8 个术语要回答的问题。&lt;/p&gt;
&lt;p&gt;本系列共 11 篇，本文是第 7 篇。&lt;/p&gt;</description></item></channel></rss>