NVIDIA 显卡架构与 AI 算力:从 Fermi 到 Blackwell
一句话:同样标”AI 算力 1000 TOPS”的两张显卡,实际跑 LLM 时性能可能差 5 倍——因为算力单位、数据精度、Tensor Core 代际、显存带宽、NVLink 这五件事都暗藏老黄刀法。这篇是从 LLM 视角看 NVIDIA 显卡的硬件解剖,理清”为什么我的 4060Ti 16G 跑大模型这么拉”。
目录
- 0. 为什么 LLM 时代要懂显卡
- 1. NVIDIA 架构演进时间线
- 2. 算力单位辨析(TFLOPS / TOPS / TIPS)
- 3. Tensor Core 代际演进:精度倍率全表
- 4. 显存进化:GDDR 到 HBM
- 5. 显存位宽、带宽与”老黄刀法”
- 6. SLI / NVLink 演进与多卡互联
- 7. 显卡选购决策树
- 8. 与本知识库其他章节的关联
- 9. 术语速查
- 10. 来源、评分与可商榷点
0. 为什么 LLM 时代要懂显卡
LLM 时代,买显卡 / 选云算力都绕不开几个问题:
- 同样的 24GB 显存,3090 跑 70B 量化模型可以,4060Ti 跑就拉胯——为什么?
- 同样标”AI 算力 1000+ TOPS”,5090 和 4090 跑 LLM 速度差距没那么大——为什么?
- Ampere 跑得动 FP16,跑 FP8 模型却报错——为什么?
答案都藏在 架构代际 + 数据精度 + 显存带宽 + 互联拓扑 这四件事里。作者(@flymyd)的原话:
🔑 “老黄是真的该死,各种刀法层出不穷,以至于花了大量精力去核对数据。”
这篇就是这些”刀法”的解剖。
1. NVIDIA 架构演进时间线
| 架构 | 中文名 | 游戏卡 | 数据中心/专业卡 | LLM 时代意义 |
|---|---|---|---|---|
| Fermi | 费米 | GTX 400/500(580) | Tesla M2090 / Quadro 6000 | 上古卡,忘掉它 |
| Kepler | 开普勒 | GTX 600/700(780 Ti) | Tesla K10/K40/K80 | 战术核显卡,垃圾佬捡来玩,只能画图 |
| Maxwell | 麦克斯韦 | GTX 750(v1)/900(v2) | Tesla M4/M40/M60 | 极大提升能效比,画图 / vGPU 命 |
| Pascal | 帕斯卡 | GTX 1000(1080 Ti) | Tesla P4/P40/P100 | 全是神:P4 进 NAS,P40 有 24G 版,P100 是首个 HBM Tesla |
| Volta | 伏打 | 无 | Tesla V100,Titan V | 初代 Tensor Core,垃圾佬新宠,V100 16G 转接卡性价比高 |
| Turing | 图灵 | RTX 20 / GTX 16 | Tesla T4/T10,Quadro RTX 8000 | T4 是 Kaggle / Huggingface / Colab 标配推理卡;2080Ti 22G 魔改 + NVLink 是大模型入门首选 |
| Ampere | 安培 | RTX 30(3090) | A100,A10/A40,RTX A6000 | 支持 BF16 + Marlin,3090 可上 NVLink,穷组首选 |
| Hopper | 霍珀 | 无 | H100/H200/H20 | 训练常用卡,大公司组或 AutoDL 算力平台 |
| Ada Lovelace | 阿达 / 雅达 | RTX 40(4090) | L4, L40S, RTX 6000 Ada | 支持 FP8,4090 可魔改 48G;NVLink 被砍,训练效率下降 |
| Blackwell | 布莱克威尔 | RTX 50(5090) | B100, B200, GB200 | 支持 FP4;50 系前期断货严重,目前主力仍是 30/40 系 |
关键代际拐点
Pascal (P100) ─────────→ 首个 HBM,LLM 时代真正起点
↓
Volta (V100) ──────────→ 初代 Tensor Core
↓
Turing (T4) ───────────→ 引入整数加速 (INT8/INT4)
↓
Ampere (A100/3090) ────→ TF32 + 结构化稀疏 + Marlin FP8 模拟
↓
Ada (4090) ────────────→ 原生 FP8(H100 同代),NVLink 砍了
↓
Blackwell (5090) ──────→ 原生 FP4,"AI TOPS" 数字翻翻翻
2. 算力单位辨析(TFLOPS / TOPS / TIPS)
NVIDIA 营销资料里有三个单位经常被混淆:
| 指标 | 全称 | 主要数据类型 | 典型应用 | NVIDIA 语境下的解读 |
|---|---|---|---|---|
| TFLOPS | Tera Floating-point Operations Per Second | FP64 / FP32 / FP16 / BF16 / TF32 | 科学计算 (HPC)、图形渲染、深度学习训练 | GPU 最传统的性能指标。早期主推 FP32(光栅化、着色),Turing 起强调 Tensor Core 的 FP16/BF16/FP8(直接决定 AI 训练速度)。FP64 主要用于气象模拟等高精度科学计算 |
| TOPS | Tera Operations Per Second | INT8 / INT4 / FP8(部分语境) | 深度学习推理、边缘计算、视频分析 | 随着量化技术普及,TOPS 变得极其重要。在 RTX 40 系和 H100/B200 中,AI 算力(AI TOPS)常指利用稀疏性 + Tensor Core 加速后的 INT8 或 FP8 性能——衡量生成 Token 速度的关键 |
| TIPS | Tera Instructions Per Second | 整数指令 | 逻辑判断、地址跳转、控制流 | 很少在 GPU 宣传中出现。GPU 中的 TIPS 通常指 CUDA 核心中的 INT32 管线性能。AI 和图形宣传更多用 TOPS,TIPS 几乎不作为营销指标 |
算力计算的基本公式
FP32 算力 = 核心总数 × 核心运行频率 (GHz) × 单核每周期指令数 (Ops/Cycle) × 2(FMA)
对于 NVIDIA 显卡,每周期指令数 = 1。这个结果是 FP32 基线 1.0 倍率。
实战:T4 算力推算
| 参数 | 值 |
|---|---|
| CUDA 核心数 | 2560 |
| Boost 频率 | 1590 MHz |
| FMA 因子 | × 2 |
2560 × 1.59 × 1 × 2 = 8140.8 GFLOPS ≈ 8.14 TFLOPS
与 TechPowerUp 标称的 FP32 算力 完全一致。
但为什么官网宣传 T4 的 “混合精度 (FP16/FP32):65 TFLOPS”?因为这是 Tensor Core 的 FP16 算力(基线的 8 倍)。
💡 核对算力的方法:FP32 TFLOPS = CUDA 核心数 × 频率 × 2(单位 GHz 时除以 1000,得 TFLOPS)。一切宣称的 “AI TOPS” 都要追问”这是哪种精度?稀疏还是稠密?”。
3. Tensor Core 代际演进:精度倍率全表
📌 关键认知:Tensor Core 的算力倍率是相对于该卡 FP32 基线 1.0 而言的。比如 V100 的 FP16 倍率是 8,意味着 FP16 Tensor Core 算力 = 8 × 该卡 FP32 算力。
3.1 累加精度 / 混合精度的核心机制
Tensor Core 在处理矩阵乘法时,采用 混合精度策略:
输入(低精度) → Tensor Core 矩阵乘 → 累加(高精度) → 输出
FP16 FP32 FP32
BF16 FP32 FP32
FP8 FP32 FP32
INT8 INT32 FP32 或 INT32
为什么这样设计?
- 输入低精度:大幅减少显存占用与带宽消耗(参数量减半到 1/4)
- 累加高精度:数值范围不溢出,保证训练收敛
- 速度按低精度的 Tensor Core 速度算
这就是为什么 T4 标 “FP16/FP32 65 TFLOPS”——输入 FP16,累加 FP32,速度按 FP16 的 Tensor Core 算。
3.2 Volta:初代 Tensor Core
伏打架构引入了初代 Tensor Core,非常适合矩阵乘法的计算。
| 精度 | 倍率(相对 FP32 基线) |
|---|---|
| FP16(Tensor Core) | 8 × |
| FP32 | 1 × |
| FP64 | 1/2(V100) |
💡 从这里开始暂不讨论 FP64,因为对 AI 已无太大意义。
代表卡:V100(16/32GB HBM2),Titan V
3.3 Turing:引入整数加速
图灵架构为适配 AI 推理场景,增加了整数加速。以下倍率均相对于该卡的 FP32 基线。
| 精度 | 倍率(稠密) |
|---|---|
| FP16(Tensor Core) | 8 × |
| INT8 | 16 × |
| INT4 | 32 × |
代表卡:T4 / T10 / Quadro RTX 8000 / 2080Ti
💡 图灵支持许多现代特性,但 BF16 除外——这是 Turing 与 Ampere 的关键差异之一。老 2080Ti 不能跑很多需要 BF16 训练的代码。
3.4 Ampere:TF32 + 结构化稀疏
安培架构变得更加复杂,满满的都是坑。
游戏卡(RTX 30 系)
每个 SM 有 4 个计算分区,每分区 16 个 CUDA 核心专用于 FP32,另外 16 个既能处理 FP32 又能处理 INT32。这导致 30 系卡纸面算力翻倍,但实际游戏中由于仍需处理大量 INT32,提升幅度远没纸面那么大。
TF32 混合精度
TF32 = FP16 的精度(10 位尾数)+ FP32 的范围(8 位指数)
| 精度 | 倍率(稠密 / 稀疏) |
|---|---|
| TF32 | 1 / 2 |
| FP16/BF16(FP32 累加) | 2 / 4 ← 训练常用 |
| FP16 | 4 / 8 ← 推理常用 |
| INT8 | 8 / 16 |
| INT4 | 16 / 32 |
数据中心(A100)的结构化稀疏
如果矩阵里有一半是 0(4 个连续元素中 2 个是 0),硬件会自动跳过 0 值的计算,性能再翻倍。这就是为什么所谓的”AI 算力”数大到离谱——先稀疏再量化,一路套娃一路翻倍。
A100 的倍率(相对其 FP32 基线):
| 精度 | 倍率(稠密 / 稀疏) |
|---|---|
| TF32 | 8 / 16 |
| FP16/BF16 | 16 / 32 |
| INT8 | 32 / 64 |
| INT4 | 64 / 128 |
⚠️ 稀疏算力是营销数字——必须模型权重恰好有 2:4 稀疏结构才能用到。大多数 LLM 不是按这个模式训练的,稀疏算力是吃不到的。
3.5 Ada Lovelace:原生 FP8
新增了 FP8 精度(E4M3 / E5M2)。需要注意:从本代开始,图形卡和计算卡彻底被拆开了(4090 vs L40S vs H100 走向不同分支)。
| 精度 | 倍率(稠密 / 稀疏) |
|---|---|
| TF32 | 1 / 2 |
| FP16/BF16(FP32 累加) | 2 / 4 |
| FP16 | 4 / 8 |
| FP8(FP32 累加) | 4 / 8 |
| FP8 | 8 / 16 |
| INT8 | 8 / 16 |
| INT4 | 16 / 32 |
代表卡:4090(可魔改 48G)/ L40S / RTX 6000 Ada
💡 Hopper(数据中心)同代:用 Hopper 的人想必不再需要看这张表了。
3.6 Blackwell:FP4 与”AI TOPS”营销
| 精度 | 倍率(稠密 / 稀疏) |
|---|---|
| TF32 | 1 / 2 |
| FP16/BF16(FP32 累加) | 2 / 4 |
| FP16 | 4 / 8 |
| FP8(FP32 累加) | 4 / 8 |
| FP8 | 8 / 16 |
| FP4 | 16 / 32 ← 所谓 “FP4 AI TOPS” |
| INT8 | 8 / 16 |
| INT4 | 16 / 32 |
FP4 算力相对 FP32 是 16 倍,叠加稀疏 32 倍。这就是 NVIDIA 在 RTX 50 / B200 上把 “AI TOPS” 数字”做大”的核心。
代表卡:RTX 5090 / B100 / B200 / GB200
⚠️ 2026 年初 FP4 生态尚不成熟:目前只有 GPT-OSS 等少数模型有 FP4 量化版本,大多数模型实际跑不到 FP4 算力。
4. 显存进化:GDDR 到 HBM
显存技术大致经历了 4 个阶段:
| 显存类型 | 技术特点 | 代表显卡 | LLM 时代意义 |
|---|---|---|---|
| GDDR3 - GDDR5 | 高频率,位宽较窄(通常 256/384-bit) | Fermi/Kepler/Maxwell | 上古遗产 |
| GDDR5X / GDDR6 / GDDR6X | 通过 PAM4 信号编码大幅提升频率 | RTX 3090(24GB GDDR6X)、RTX 4090(24GB GDDR6X) | 3090 性能强 + NVLink + 24GB,穷组首选;但训练时带宽远低于 HBM |
| HBM(初代) | 存储芯片垂直堆叠,直接封装在 GPU 核心旁,位宽极大 | Tesla P100(16GB HBM2) | LLM 训练真正起点——高带宽让 GPU 核心不再长时间等数据 |
| HBM2 / HBM2e | A100 用 40/80GB HBM2e | V100、A100 | 大显存允许大 Batch Size 训练;显存带宽决定 LLM 推理 Token/s |
| HBM3 / HBM3e | 更大更快 | Hopper、Blackwell | 当代训练卡标配 |
关键认知:训练 vs 推理对显存的不同需求
训练:
- 参数 + 激活值 + 梯度 + 优化器状态 ──→ 显存需求 ≈ 参数量 × 16~20 字节
- 显存带宽决定迭代速度
- 显存大小决定 Batch Size 上限
推理:
- 参数 + KV Cache ──→ 显存需求 ≈ 参数量 × (1~2) 字节(量化后)
- 显存带宽 ──→ 直接决定生成 Token/s
- 显存大小 ──→ 决定能不能跑得起来
5. 显存位宽、带宽与”老黄刀法”
这一节是 理解 4060Ti 16G 为什么是”AI 智商税” 的核心。
5.1 工厂比喻:算力 / 位宽 / 带宽
如果把显卡比作一个工厂,那么:
| 概念 | 工厂比喻 | 工程含义 |
|---|---|---|
| 算力 | 生产的速度 | 算力越高,处理复杂计算(画图、矩阵乘法)就越快 |
| 显存位宽 | 公路的车道数 | 连接仓库(显存)和车间(核心)的公路有几条车道。老黄非常爱在位宽上动刀子,可以立竿见影地在 AI 计算上把卡分级 |
| 显存带宽 | 公路的总运输能力 | 带宽 = 显存频率 × 位宽 / 8。即使位宽再大,频率上不去也白搭。核心算力再强,带宽不够也得停下来等数据——HBM 之所以重要就是这个原因 |
挖矿时代有一个常见操作:猛拉显存频率以获得更大带宽,这样可以尽量压榨算力。
5.2 打游戏 vs LLM 推理 vs LLM 训练的瓶颈差异
核心差异:数据复用率不同。
打游戏:算力瓶颈
每从显存读一次数据 → 核心反复用这些数据算很多次
所以一般情况下,限制游戏性能的瓶颈在算力上,核心越强打游戏越强。
💡 顺便一提:高分辨率下游戏所需的数据也很大块,位宽被砍在越高的分辨率下越能显出影响,直到碰到核心算力瓶颈为止。
LLM 推理:显存带宽瓶颈
为了生成下一个 token → 必须把模型的所有参数从显存搬到核心里走一遍
每搬运一个参数,往往只进行一次乘法 + 一次加法
到了 LLM 上,瓶颈完全相反了——卡在带宽,不卡在算力。
LLM 训练:显存带宽瓶颈更严重
不仅要读参数 → 还要读中间激活值 → 计算梯度 → 回写梯度 → 更新参数
时间基本都花在显存搬运数据上,核心算一下歇一下。
🔑 这就是为什么老黄只需略动刀法,就能大幅降低 AI 算力而不怎么影响游戏性能。
5.3 经典刀法案例:4060Ti 128bit 的 16GB 神话
到了 Ada 这代,刀法更加精准了。拿 4060Ti 举例:
| 参数 | 4060Ti 16GB |
|---|---|
| 显存 | 16GB GDDR6 |
| 位宽 | 128-bit(被丧心病狂地砍了) |
| 带宽 | 不到 300 GB/s |
对 AI 来说:16G 显存虽看起来美丽,实际用于 AI 时屁用没有——带宽根本顶不住。
对游戏来说:为什么游戏性能没受太大影响? 因为 L2 缓存量大幅提高了,可以尽可能地在内部缓存热数据(类似 AMD X3D CPU 打网游优势)。但 大模型动辄几十 G,L2 瞬间就被塞爆了。
⚠️ 作者结论:光看核心算力和显存大小也不能作为评判这张卡 AI 性能的唯一标准,像 40 系游戏卡这种抽象东西还是尽可能避开为好。
4060Ti 16G vs 3090 24G 实战体感
| 项目 | 4060Ti 16G | 3090 24G |
|---|---|---|
| 显存大小 | 16GB | 24GB |
| 显存带宽 | ~288 GB/s | 936 GB/s(高 3.25 倍) |
| 位宽 | 128-bit | 384-bit |
| 跑 7B 模型 | 慢 | 快 |
| 跑 14B 模型 | 勉强(慢) | 流畅 |
| 跑 70B 量化 | ❌ 跑不动 | ✅ 可以 |
结论:3090 的 LLM 体感 ≈ 4060Ti 16G 的 3~5 倍。别看显存差不多,带宽差距巨大。
6. SLI / NVLink 演进与多卡互联
NVLink 的刀法比核心和显存还要复杂。
⚠️ 作者亲身经验警告:A6000 和 3090 虽然都是 Ampere 卡,但 NVLink 桥不通用,买前一定要看好。
NVLink 代际演进表
| 型号 | 架构 | NVLink 代数 | 桥接器物理形态 | 双向总带宽 | 备注 |
|---|---|---|---|---|---|
| Titan X / XP / 1080 Ti | Pascal | SLI HB,非 NVLink | 双指接口 | 2-4 GB/s | 仅加速游戏,所谓四路泰坦 |
| Tesla P100 | Pascal | 1.0 | PCIE 或板载 | 80-160 GB/s | 4 条通道,一条 20G。SMX 接口的 P100 速度翻倍 |
| Tesla V100 | Volta | 2.0 | PCIE 或 NVSwitch | 100-300 GB/s | PCIE 版本 100 GB/s,SXM 版本带 NVSwitch 速率提升到 300 GB/s |
| Titan V | Volta | 2.0(阉割版) | Titan V 专用桥 | 100 GB/s | 市面上几乎找不到这个桥,而且很贵 |
| Titan RTX / 2080 Ti | Turing | 2.0(阉割版) | Turing 桥(接口较长) | 100 GB/s | 20 系专用;Tesla T10 上虽然有金手指但好像无法开启相关特性 |
| RTX 3090 / 3090 Ti | Ampere | 3.0(阉割版) | Ampere 桥(接口较短) | 112.5 GB/s | 30 系专用,通常需要 4-slot 宽度的桥(散热器巨大) |
| RTX A6000 | Ampere | 3.0(阉割版) | Ampere 桥(专业卡版) | 112.5 GB/s | 核心与 3090 类似,带宽一致,但物理高度不同——桥不通用 |
| RTX 4090 | Ada | 无 | 无 | 无 | 3090 给了 NVLink 疑似影响 Ampere 计算卡市场,40 系全给砍了 |
| A100 SXM | Ampere | 3.0 | 主板集成(NVSwitch) | 600 GB/s | 真·NVLink — 大模型训练黄金标准 |
选 NVLink 的关键决策
| 场景 | 是否需要 NVLink |
|---|---|
| 单卡推理 | ❌ 不需要 |
| 多卡模型并行训练(70B+ 模型) | ✅ 极需要 — PCIe 4.0 x16 双向也只有 64 GB/s,跨卡通信会成为瓶颈 |
| 多卡数据并行训练(⇐ 30B 模型) | ⚠️ 一般 — PCIe 可勉强 |
| 多卡推理(单实例) | ⚠️ 视模型大小 — Tensor Parallelism 需要 |
| 多卡推理(独立实例) | ❌ 不需要 |
💡 作者重要忠告:“A6000 和 3090 虽然都是 Ampere 卡,但 NVLink 桥不通用,买前一定要看好”。
7. 显卡选购决策树
你的预算与目标:
│
├─ 5000 元以下:学习 + 跑 7B 量化模型
│ └─→ Tesla P40 24G(垃圾佬之友)
│ └─→ 2080Ti 22G(魔改,有 NVLink)
│ └─→ V100 16G(转接卡)
│
├─ 1-2 万元:HomeLab + 跑 14-30B
│ └─→ 3090 24G(单卡 + NVLink 桥)
│ └─→ 2x 2080Ti 22G(NVLink 互联)
│ └─→ Apple Mac Studio M4 Ultra(192GB 统一内存) ← 见量化选型笔记
│
├─ 2-5 万元:跑 70B 模型 / 中小企业部署
│ └─→ 2x 3090 NVLink(48GB 显存)
│ └─→ 4090 48G 魔改(支持 FP8,但无 NVLink)
│ └─→ A6000 48G(专业卡,NVLink 桥不同)
│
├─ 10 万元+:训练小型模型 / 高级研究
│ └─→ A100 80G(SXM 优选,真 NVLink)
│ └─→ L40S 48G(无 NVLink 但 FP8 + 训练能力)
│
└─ 50 万元+:训练 30B+ 模型
└─→ H100 / H200 集群
└─→ B100 / B200(2026 新品,但产能不足)
选购避坑清单
| ❌ 避开 | ✅ 推荐替代 | 原因 |
|---|---|---|
| 4060Ti 16G | 3060 12G / 二手 3090 | 128bit 位宽腰斩,AI 跑不动 |
| 4070 12G | 二手 3090 24G | 显存太小,带宽一般 |
| 5060 系列(2026 早期) | 等 1-2 年成熟 | 50 系前期断货 + 软件支持不足 |
| 1080 Ti(只为 AI) | Tesla P40 24G | 显存太小 + 无 Tensor Core |
| 不带桥的 3090 | 配 4-slot NVLink 桥 | 多卡训练 NVLink 比 PCIe 快 8 倍 |
8. 与本知识库其他章节的关联
8.1 与本地部署的关系
- 量化方案如何对应显卡架构 → 本地部署模型量化选型:§ 7 按显卡架构选量化方案(FP8 在 Ampere 上不能跑等坑)
- 数据精度全景表(FP64~FP4 + INT8/INT4)→ 同上 § 5
- 量化方法全景表(GGUF/GPTQ/AWQ/EXL2/HQQ/AQLM/SmoothQuant/LLM.int8/FP8/NF4/MLX)→ 同上 § 6
- 驱动 / CUDA / PyTorch 环境配置 → NVIDIA驱动-CUDA-PyTorch工程基础:五层版本链 + 报错诊断速查表(配套基础)
- 推理引擎选型 → LLM推理引擎选型:硬件配好后选 vLLM / SGLang / Ollama / TensorRT-LLM 等
- 部署架构 → HomeLab到中小企业LLM部署架构:4 层架构 + 监控 + 容灾
8.2 与模型架构的关系
- MoE 模型对显存的需求(总参数 ≠ 激活参数,显存占的是总参数)→ Dense 与 MoE 架构对比
- DeepSeek 的 FP8 混合精度训练 → DeepSeek.md
- Transformer 的矩阵乘法核心 → Transformer.md
8.3 与选型的关系
- 没有自己的显卡? → LLM-API 选型方法论:用 API 替代
- 想选具体模型部署? → 各家 LLM 模型特点速查:各开源家族能力对比
8.4 与训练的关系
- 预训练 / SFT / RLHF 等训练方法 → 模型训练技术速查
9. 术语速查
| 术语 | 全称 | 含义 |
|---|---|---|
| TFLOPS | Tera Floating-point Operations Per Second | 每秒万亿次浮点运算 |
| TOPS | Tera Operations Per Second | 每秒万亿次操作(通常指 INT8/FP8 等低精度) |
| TIPS | Tera Instructions Per Second | 每秒万亿次指令(整数,GPU 营销中很少用) |
| FMA | Fused Multiply-Add | 融合乘加 = 一次 (a × b + c),GPU 算力公式中的 × 2 因子 |
| CUDA Core | — | NVIDIA 的通用计算核心,标量 / 向量计算单元 |
| Tensor Core | — | 矩阵乘累加专用单元,LLM 推理 / 训练核心,Volta 起引入 |
| SM | Streaming Multiprocessor | NVIDIA GPU 的基本计算单元,包含若干 CUDA Core + Tensor Core |
| FP64 | Double Precision | 双精度,科学计算用,AI 几乎不用 |
| FP32 | Single Precision | 单精度,算力基线 |
| TF32 | TensorFloat-32 | NVIDIA 的”混合精度”:FP16 精度 + FP32 范围 |
| FP16 | Half Precision | 半精度,训练/推理常用 |
| BF16 | Brain Float 16 | 与 FP16 同位数但范围更大,Ampere 起支持 |
| FP8 | — | Ada / Hopper 起原生支持(E4M3/E5M2 两种格式) |
| FP4 | — | Blackwell 起原生支持,营销 “AI TOPS” 的主力 |
| INT8 / INT4 | — | 整数低精度,推理量化常用 |
| MXFP4 | Microscaling FP4 | 微缩放 FP4,gpt-oss 等模型使用 |
| 累加精度 | Accumulation Precision | Tensor Core 的输入精度 vs 累加(输出)精度,混合精度的核心 |
| 稀疏算力 / 结构化稀疏 | 2:4 Sparsity | Ampere 起支持的 4 选 2 稀疏模式,算力翻倍但需模型支持 |
| GDDR | Graphics Double Data Rate | 主流游戏 / 工作站显卡显存类型 |
| HBM | High Bandwidth Memory | 垂直堆叠的高带宽显存,位宽极大,LLM 训练必备 |
| HBM3e | — | HBM 第 5 代,B200 等高端卡使用 |
| 显存带宽 | Memory Bandwidth | = 显存频率 × 位宽 / 8,LLM 推理瓶颈 |
| 位宽 | Memory Bus Width | 显存总线宽度,“老黄刀法” 重灾区 |
| PAM4 | Pulse Amplitude Modulation 4-level | GDDR6X 用的信号编码,翻倍频率 |
| L2 Cache | Level 2 Cache | GPU 内部高速缓存,Ada 起加大,游戏受益 LLM 不受益 |
| NVLink | — | NVIDIA 的 GPU 互联技术,带宽远高于 PCIe |
| NVSwitch | — | 高端服务器主板集成的 NVLink 交换器,数据中心专属 |
| SLI | Scalable Link Interface | NVIDIA 老的多卡桥接技术,只加速游戏,已被 NVLink 替代 |
| SXM | — | NVIDIA 数据中心 GPU 的高带宽接口(非 PCIe) |
| DP4A | Dot Product 4 INT8 | Pascal P40 引入的 INT8 加速指令 |
| Marlin | — | NVIDIA 在 Ampere/Ada 上的 INT4/FP8 加速算子,见 量化选型笔记 |
| 垃圾佬 | — | 社区俚语,擅长用古老 Tesla 卡 / 矿卡搭低成本 AI 平台的爱好者 |
| 战术核显卡 | — | 社区俚语,形容 Kepler 时代 Tesla K 系列(老 + 烫 + 还在用) |
10. 来源、评分与可商榷点
10.1 来源
- 原始素材:LINUX DO 社区 @flymyd 的「简单易懂的 LLM 相关知识梳理」系列
- ep.3-2 认识 NVIDIA 显卡(2026 年 1 月 9 日初稿,内含 “老黄是真的该死” 等吐槽)
- 整理日期:2026 年 5 月 24 日
10.2 笔者评分
| 维度 | 评分 |
|---|---|
| 技术准确度 | ★★★★★ |
| 实战经验 | ★★★★★ |
| “刀法”洞察 | ★★★★★ |
| 教学性 | ★★★★☆(工厂比喻 + 倍率表非常清晰) |
| 时效性 | ★★★★★(Blackwell 已经覆盖) |
| 总分 | 9.5 / 10 |
10.3 笔记吸收策略
- ✅ 完整吸收:NVIDIA 架构演进时间线 + 各代倍率表 + 显存进化 + NVLink 表
- ✅ 完整吸收:工厂比喻(算力=生产速度 / 位宽=车道数 / 带宽=运输能力)— 这是核心干货
- ✅ 完整吸收:打游戏 vs LLM 推理 vs LLM 训练的瓶颈差异 — 本文核心认知
- ✅ 完整吸收:4060Ti 128bit 案例 — 经典老黄刀法
- ✅ 扩展:增加了”显卡选购决策树”(原文只讲架构,我加了”按预算选什么”)
- ⚠️ 保留作者梗:“老黄是真的该死” / “垃圾佬” / “战术核显卡” 等用引用块标注
10.4 作者没覆盖到的(可补充方向)
- AMD GPU:RDNA(RX 7900 XTX 等)+ CDNA(MI300X 等)— ROCm 生态、HIP 编程模型,完全没提
- Intel GPU:Arc 系列 + Ponte Vecchio — OneAPI 生态,完全没提
- 国产算力:
- 昇腾(Ascend)910B / 910C / 950:华为系国产 NPU
- 寒武纪(Cambricon)思元 590:国产推理卡
- 海光(Hygon)DCU:基于 AMD GCN 授权
- 天数智芯 / 摩尔线程 / 沐曦 / 燧原:国产 GPU 创业公司
- 这些都和 LLM 落地强相关,作者 toG 场景下提了”昇腾”,但未展开
- Apple Silicon:M1/M2/M3/M4 系列的统一内存架构,跑大模型的特殊优势(在 量化选型笔记 中有覆盖)
- Google TPU:作者只提了 “TPU 让 Gemini 推理很快”,未深讲 TPU vN 架构
- PCIe 代际:PCIe 3.0 / 4.0 / 5.0 对多卡训练的影响,作者未细讲
- 散热与功耗:RTX 4090 / 5090 功耗 450W+,多卡组装的电源 / 机箱要求未涉及
- 二手卡风险:挖矿卡 / 拆机卡的辨别方法,作者未讲
10.5 时效性提醒
📅 截至 2026 年 5 月:
- Blackwell(50 系)产能逐步爬升,但买不到 5090 / B200 仍是常态
- 昇腾 950 上市时间未定,作者提及”下半年上市”
- 国产 GPU 政策:信创要求可能让国产卡在政企市场快速增长
- 量化生态:FP4 量化模型 2026 年下半年才会大规模出现
10.6 主观色彩的提醒
作者写作风格充满 LD 社区的”垃圾佬”幽默:
- “老黄是真的该死”——一种半开玩笑的吐槽,实际作者技术分析非常严谨
- “战术核显卡”——形容 Kepler 老 Tesla 卡(老 + 烫)
- “P100 是首个 Tesla HBM 卡,和其他两位不太一样”——这种”两位”是 LD 老炮黑话(P4 / P40 / P100 三兄弟)
- “Apple Silicon 比喻成统一内存巨人”——形象但需上下文
洞察是真的,梗是 LD 风,看的时候自动区分。