NVIDIA 显卡架构与 AI 算力:从 Fermi 到 Blackwell

一句话:同样标”AI 算力 1000 TOPS”的两张显卡,实际跑 LLM 时性能可能差 5 倍——因为算力单位、数据精度、Tensor Core 代际、显存带宽、NVLink 这五件事都暗藏老黄刀法。这篇是从 LLM 视角看 NVIDIA 显卡的硬件解剖,理清”为什么我的 4060Ti 16G 跑大模型这么拉”。


目录


0. 为什么 LLM 时代要懂显卡

LLM 时代,买显卡 / 选云算力都绕不开几个问题:

  1. 同样的 24GB 显存,3090 跑 70B 量化模型可以,4060Ti 跑就拉胯——为什么?
  2. 同样标”AI 算力 1000+ TOPS”,5090 和 4090 跑 LLM 速度差距没那么大——为什么?
  3. Ampere 跑得动 FP16,跑 FP8 模型却报错——为什么?

答案都藏在 架构代际 + 数据精度 + 显存带宽 + 互联拓扑 这四件事里。作者(@flymyd)的原话:

🔑 “老黄是真的该死,各种刀法层出不穷,以至于花了大量精力去核对数据。

这篇就是这些”刀法”的解剖。


1. NVIDIA 架构演进时间线

架构中文名游戏卡数据中心/专业卡LLM 时代意义
Fermi费米GTX 400/500(580)Tesla M2090 / Quadro 6000上古卡,忘掉它
Kepler开普勒GTX 600/700(780 Ti)Tesla K10/K40/K80战术核显卡,垃圾佬捡来玩,只能画图
Maxwell麦克斯韦GTX 750(v1)/900(v2)Tesla M4/M40/M60极大提升能效比,画图 / vGPU 命
Pascal帕斯卡GTX 1000(1080 Ti)Tesla P4/P40/P100全是神:P4 进 NAS,P40 有 24G 版,P100 是首个 HBM Tesla
Volta伏打Tesla V100,Titan V初代 Tensor Core,垃圾佬新宠,V100 16G 转接卡性价比高
Turing图灵RTX 20 / GTX 16Tesla T4/T10,Quadro RTX 8000T4 是 Kaggle / Huggingface / Colab 标配推理卡;2080Ti 22G 魔改 + NVLink 是大模型入门首选
Ampere安培RTX 30(3090)A100,A10/A40,RTX A6000支持 BF16 + Marlin,3090 可上 NVLink,穷组首选
Hopper霍珀H100/H200/H20训练常用卡,大公司组或 AutoDL 算力平台
Ada Lovelace阿达 / 雅达RTX 40(4090)L4, L40S, RTX 6000 Ada支持 FP8,4090 可魔改 48G;NVLink 被砍,训练效率下降
Blackwell布莱克威尔RTX 50(5090)B100, B200, GB200支持 FP4;50 系前期断货严重,目前主力仍是 30/40 系

关键代际拐点

Pascal (P100) ─────────→ 首个 HBM,LLM 时代真正起点
   ↓
Volta (V100) ──────────→ 初代 Tensor Core
   ↓
Turing (T4) ───────────→ 引入整数加速 (INT8/INT4)
   ↓
Ampere (A100/3090) ────→ TF32 + 结构化稀疏 + Marlin FP8 模拟
   ↓
Ada (4090) ────────────→ 原生 FP8(H100 同代),NVLink 砍了
   ↓
Blackwell (5090) ──────→ 原生 FP4,"AI TOPS" 数字翻翻翻

2. 算力单位辨析(TFLOPS / TOPS / TIPS)

NVIDIA 营销资料里有三个单位经常被混淆:

指标全称主要数据类型典型应用NVIDIA 语境下的解读
TFLOPSTera Floating-point Operations Per SecondFP64 / FP32 / FP16 / BF16 / TF32科学计算 (HPC)、图形渲染、深度学习训练GPU 最传统的性能指标。早期主推 FP32(光栅化、着色),Turing 起强调 Tensor Core 的 FP16/BF16/FP8(直接决定 AI 训练速度)。FP64 主要用于气象模拟等高精度科学计算
TOPSTera Operations Per SecondINT8 / INT4 / FP8(部分语境)深度学习推理、边缘计算、视频分析随着量化技术普及,TOPS 变得极其重要。在 RTX 40 系和 H100/B200 中,AI 算力(AI TOPS)常指利用稀疏性 + Tensor Core 加速后的 INT8 或 FP8 性能——衡量生成 Token 速度的关键
TIPSTera Instructions Per Second整数指令逻辑判断、地址跳转、控制流很少在 GPU 宣传中出现。GPU 中的 TIPS 通常指 CUDA 核心中的 INT32 管线性能。AI 和图形宣传更多用 TOPS,TIPS 几乎不作为营销指标

算力计算的基本公式

FP32 算力 = 核心总数 × 核心运行频率 (GHz) × 单核每周期指令数 (Ops/Cycle) × 2(FMA)

对于 NVIDIA 显卡,每周期指令数 = 1。这个结果是 FP32 基线 1.0 倍率

实战:T4 算力推算

参数
CUDA 核心数2560
Boost 频率1590 MHz
FMA 因子× 2
2560 × 1.59 × 1 × 2 = 8140.8 GFLOPS ≈ 8.14 TFLOPS

与 TechPowerUp 标称的 FP32 算力 完全一致

但为什么官网宣传 T4 的 “混合精度 (FP16/FP32):65 TFLOPS”?因为这是 Tensor Core 的 FP16 算力(基线的 8 倍)。

💡 核对算力的方法:FP32 TFLOPS = CUDA 核心数 × 频率 × 2(单位 GHz 时除以 1000,得 TFLOPS)。一切宣称的 “AI TOPS” 都要追问”这是哪种精度?稀疏还是稠密?”。


3. Tensor Core 代际演进:精度倍率全表

📌 关键认知:Tensor Core 的算力倍率是相对于该卡 FP32 基线 1.0 而言的。比如 V100 的 FP16 倍率是 8,意味着 FP16 Tensor Core 算力 = 8 × 该卡 FP32 算力。

3.1 累加精度 / 混合精度的核心机制

Tensor Core 在处理矩阵乘法时,采用 混合精度策略:

输入(低精度)  →  Tensor Core 矩阵乘  →  累加(高精度)  →  输出
   FP16                                        FP32             FP32
   BF16                                        FP32             FP32
   FP8                                         FP32             FP32
   INT8                                        INT32            FP32 或 INT32

为什么这样设计?

  • 输入低精度:大幅减少显存占用与带宽消耗(参数量减半到 1/4)
  • 累加高精度:数值范围不溢出,保证训练收敛
  • 速度按低精度的 Tensor Core 速度算

这就是为什么 T4 标 “FP16/FP32 65 TFLOPS”——输入 FP16,累加 FP32,速度按 FP16 的 Tensor Core 算

3.2 Volta:初代 Tensor Core

伏打架构引入了初代 Tensor Core,非常适合矩阵乘法的计算。

精度倍率(相对 FP32 基线)
FP16(Tensor Core)8 ×
FP321 ×
FP641/2(V100)

💡 从这里开始暂不讨论 FP64,因为对 AI 已无太大意义。

代表卡:V100(16/32GB HBM2),Titan V

3.3 Turing:引入整数加速

图灵架构为适配 AI 推理场景,增加了整数加速以下倍率均相对于该卡的 FP32 基线

精度倍率(稠密)
FP16(Tensor Core)8 ×
INT816 ×
INT432 ×

代表卡:T4 / T10 / Quadro RTX 8000 / 2080Ti

💡 图灵支持许多现代特性,但 BF16 除外——这是 Turing 与 Ampere 的关键差异之一。老 2080Ti 不能跑很多需要 BF16 训练的代码

3.4 Ampere:TF32 + 结构化稀疏

安培架构变得更加复杂,满满的都是坑

游戏卡(RTX 30 系)

每个 SM 有 4 个计算分区,每分区 16 个 CUDA 核心专用于 FP32,另外 16 个既能处理 FP32 又能处理 INT32。这导致 30 系卡纸面算力翻倍,但实际游戏中由于仍需处理大量 INT32,提升幅度远没纸面那么大

TF32 混合精度

TF32 = FP16 的精度(10 位尾数)+ FP32 的范围(8 位指数)

精度倍率(稠密 / 稀疏)
TF321 / 2
FP16/BF16(FP32 累加)2 / 4 ← 训练常用
FP164 / 8 ← 推理常用
INT88 / 16
INT416 / 32

数据中心(A100)的结构化稀疏

如果矩阵里有一半是 0(4 个连续元素中 2 个是 0),硬件会自动跳过 0 值的计算,性能再翻倍。这就是为什么所谓的”AI 算力”数大到离谱——先稀疏再量化,一路套娃一路翻倍

A100 的倍率(相对其 FP32 基线):

精度倍率(稠密 / 稀疏)
TF328 / 16
FP16/BF1616 / 32
INT832 / 64
INT464 / 128

⚠️ 稀疏算力是营销数字——必须模型权重恰好有 2:4 稀疏结构才能用到。大多数 LLM 不是按这个模式训练的,稀疏算力是吃不到的

3.5 Ada Lovelace:原生 FP8

新增了 FP8 精度(E4M3 / E5M2)。需要注意:从本代开始,图形卡和计算卡彻底被拆开了(4090 vs L40S vs H100 走向不同分支)。

精度倍率(稠密 / 稀疏)
TF321 / 2
FP16/BF16(FP32 累加)2 / 4
FP164 / 8
FP8(FP32 累加)4 / 8
FP88 / 16
INT88 / 16
INT416 / 32

代表卡:4090(可魔改 48G)/ L40S / RTX 6000 Ada

💡 Hopper(数据中心)同代:用 Hopper 的人想必不再需要看这张表了。

3.6 Blackwell:FP4 与”AI TOPS”营销

精度倍率(稠密 / 稀疏)
TF321 / 2
FP16/BF16(FP32 累加)2 / 4
FP164 / 8
FP8(FP32 累加)4 / 8
FP88 / 16
FP416 / 32 ← 所谓 “FP4 AI TOPS”
INT88 / 16
INT416 / 32

FP4 算力相对 FP32 是 16 倍,叠加稀疏 32 倍。这就是 NVIDIA 在 RTX 50 / B200 上把 “AI TOPS” 数字”做大”的核心。

代表卡:RTX 5090 / B100 / B200 / GB200

⚠️ 2026 年初 FP4 生态尚不成熟:目前只有 GPT-OSS 等少数模型有 FP4 量化版本,大多数模型实际跑不到 FP4 算力


4. 显存进化:GDDR 到 HBM

显存技术大致经历了 4 个阶段:

显存类型技术特点代表显卡LLM 时代意义
GDDR3 - GDDR5高频率,位宽较窄(通常 256/384-bit)Fermi/Kepler/Maxwell上古遗产
GDDR5X / GDDR6 / GDDR6X通过 PAM4 信号编码大幅提升频率RTX 3090(24GB GDDR6X)、RTX 4090(24GB GDDR6X)3090 性能强 + NVLink + 24GB,穷组首选;但训练时带宽远低于 HBM
HBM(初代)存储芯片垂直堆叠,直接封装在 GPU 核心旁,位宽极大Tesla P100(16GB HBM2)LLM 训练真正起点——高带宽让 GPU 核心不再长时间等数据
HBM2 / HBM2eA100 用 40/80GB HBM2eV100、A100大显存允许大 Batch Size 训练;显存带宽决定 LLM 推理 Token/s
HBM3 / HBM3e更大更快Hopper、Blackwell当代训练卡标配

关键认知:训练 vs 推理对显存的不同需求

训练:
  - 参数 + 激活值 + 梯度 + 优化器状态 ──→ 显存需求 ≈ 参数量 × 16~20 字节
  - 显存带宽决定迭代速度
  - 显存大小决定 Batch Size 上限

推理:
  - 参数 + KV Cache ──→ 显存需求 ≈ 参数量 × (1~2) 字节(量化后)
  - 显存带宽 ──→ 直接决定生成 Token/s
  - 显存大小 ──→ 决定能不能跑得起来

5. 显存位宽、带宽与”老黄刀法”

这一节是 理解 4060Ti 16G 为什么是”AI 智商税” 的核心。

5.1 工厂比喻:算力 / 位宽 / 带宽

如果把显卡比作一个工厂,那么:

概念工厂比喻工程含义
算力生产的速度算力越高,处理复杂计算(画图、矩阵乘法)就越快
显存位宽公路的车道数连接仓库(显存)和车间(核心)的公路有几条车道。老黄非常爱在位宽上动刀子,可以立竿见影地在 AI 计算上把卡分级
显存带宽公路的总运输能力带宽 = 显存频率 × 位宽 / 8。即使位宽再大,频率上不去也白搭。核心算力再强,带宽不够也得停下来等数据——HBM 之所以重要就是这个原因

挖矿时代有一个常见操作:猛拉显存频率以获得更大带宽,这样可以尽量压榨算力

5.2 打游戏 vs LLM 推理 vs LLM 训练的瓶颈差异

核心差异:数据复用率不同。

打游戏:算力瓶颈

每从显存读一次数据 → 核心反复用这些数据算很多次

所以一般情况下,限制游戏性能的瓶颈在算力上,核心越强打游戏越强

💡 顺便一提:高分辨率下游戏所需的数据也很大块,位宽被砍在越高的分辨率下越能显出影响,直到碰到核心算力瓶颈为止。

LLM 推理:显存带宽瓶颈

为了生成下一个 token → 必须把模型的所有参数从显存搬到核心里走一遍
每搬运一个参数,往往只进行一次乘法 + 一次加法

到了 LLM 上,瓶颈完全相反了——卡在带宽,不卡在算力

LLM 训练:显存带宽瓶颈更严重

不仅要读参数 → 还要读中间激活值 → 计算梯度 → 回写梯度 → 更新参数

时间基本都花在显存搬运数据上,核心算一下歇一下

🔑 这就是为什么老黄只需略动刀法,就能大幅降低 AI 算力而不怎么影响游戏性能

5.3 经典刀法案例:4060Ti 128bit 的 16GB 神话

到了 Ada 这代,刀法更加精准了。拿 4060Ti 举例:

参数4060Ti 16GB
显存16GB GDDR6
位宽128-bit(被丧心病狂地砍了)
带宽不到 300 GB/s

对 AI 来说:16G 显存虽看起来美丽,实际用于 AI 时屁用没有——带宽根本顶不住。

对游戏来说:为什么游戏性能没受太大影响? 因为 L2 缓存量大幅提高了,可以尽可能地在内部缓存热数据(类似 AMD X3D CPU 打网游优势)。但 大模型动辄几十 G,L2 瞬间就被塞爆了

⚠️ 作者结论:光看核心算力和显存大小也不能作为评判这张卡 AI 性能的唯一标准,像 40 系游戏卡这种抽象东西还是尽可能避开为好

4060Ti 16G vs 3090 24G 实战体感

项目4060Ti 16G3090 24G
显存大小16GB24GB
显存带宽~288 GB/s936 GB/s(高 3.25 倍)
位宽128-bit384-bit
跑 7B 模型
跑 14B 模型勉强(慢)流畅
跑 70B 量化❌ 跑不动✅ 可以

结论:3090 的 LLM 体感 ≈ 4060Ti 16G 的 3~5 倍别看显存差不多,带宽差距巨大


NVLink 的刀法比核心和显存还要复杂

⚠️ 作者亲身经验警告:A6000 和 3090 虽然都是 Ampere 卡,但 NVLink 桥不通用,买前一定要看好

型号架构NVLink 代数桥接器物理形态双向总带宽备注
Titan X / XP / 1080 TiPascalSLI HB,非 NVLink双指接口2-4 GB/s仅加速游戏,所谓四路泰坦
Tesla P100Pascal1.0PCIE 或板载80-160 GB/s4 条通道,一条 20G。SMX 接口的 P100 速度翻倍
Tesla V100Volta2.0PCIE 或 NVSwitch100-300 GB/sPCIE 版本 100 GB/s,SXM 版本带 NVSwitch 速率提升到 300 GB/s
Titan VVolta2.0(阉割版)Titan V 专用桥100 GB/s市面上几乎找不到这个桥,而且很贵
Titan RTX / 2080 TiTuring2.0(阉割版)Turing 桥(接口较长)100 GB/s20 系专用;Tesla T10 上虽然有金手指但好像无法开启相关特性
RTX 3090 / 3090 TiAmpere3.0(阉割版)Ampere 桥(接口较短)112.5 GB/s30 系专用,通常需要 4-slot 宽度的桥(散热器巨大)
RTX A6000Ampere3.0(阉割版)Ampere 桥(专业卡版)112.5 GB/s核心与 3090 类似,带宽一致,但物理高度不同——桥不通用
RTX 4090Ada3090 给了 NVLink 疑似影响 Ampere 计算卡市场,40 系全给砍了
A100 SXMAmpere3.0主板集成(NVSwitch)600 GB/s真·NVLink — 大模型训练黄金标准
场景是否需要 NVLink
单卡推理❌ 不需要
多卡模型并行训练(70B+ 模型)极需要 — PCIe 4.0 x16 双向也只有 64 GB/s,跨卡通信会成为瓶颈
多卡数据并行训练( 30B 模型)⚠️ 一般 — PCIe 可勉强
多卡推理(单实例)⚠️ 视模型大小 — Tensor Parallelism 需要
多卡推理(独立实例)❌ 不需要

💡 作者重要忠告:“A6000 和 3090 虽然都是 Ampere 卡,但 NVLink 桥不通用,买前一定要看好”。


7. 显卡选购决策树

你的预算与目标:
  │
  ├─ 5000 元以下:学习 + 跑 7B 量化模型
  │     └─→ Tesla P40 24G(垃圾佬之友)
  │     └─→ 2080Ti 22G(魔改,有 NVLink)
  │     └─→ V100 16G(转接卡)
  │
  ├─ 1-2 万元:HomeLab + 跑 14-30B
  │     └─→ 3090 24G(单卡 + NVLink 桥)
  │     └─→ 2x 2080Ti 22G(NVLink 互联)
  │     └─→ Apple Mac Studio M4 Ultra(192GB 统一内存)  ← 见量化选型笔记
  │
  ├─ 2-5 万元:跑 70B 模型 / 中小企业部署
  │     └─→ 2x 3090 NVLink(48GB 显存)
  │     └─→ 4090 48G 魔改(支持 FP8,但无 NVLink)
  │     └─→ A6000 48G(专业卡,NVLink 桥不同)
  │
  ├─ 10 万元+:训练小型模型 / 高级研究
  │     └─→ A100 80G(SXM 优选,真 NVLink)
  │     └─→ L40S 48G(无 NVLink 但 FP8 + 训练能力)
  │
  └─ 50 万元+:训练 30B+ 模型
        └─→ H100 / H200 集群
        └─→ B100 / B200(2026 新品,但产能不足)

选购避坑清单

❌ 避开✅ 推荐替代原因
4060Ti 16G3060 12G / 二手 3090128bit 位宽腰斩,AI 跑不动
4070 12G二手 3090 24G显存太小,带宽一般
5060 系列(2026 早期)等 1-2 年成熟50 系前期断货 + 软件支持不足
1080 Ti(只为 AI)Tesla P40 24G显存太小 + 无 Tensor Core
不带桥的 3090配 4-slot NVLink 桥多卡训练 NVLink 比 PCIe 快 8 倍

8. 与本知识库其他章节的关联

8.1 与本地部署的关系

  • 量化方案如何对应显卡架构本地部署模型量化选型:§ 7 按显卡架构选量化方案(FP8 在 Ampere 上不能跑等坑)
  • 数据精度全景表(FP64~FP4 + INT8/INT4)→ 同上 § 5
  • 量化方法全景表(GGUF/GPTQ/AWQ/EXL2/HQQ/AQLM/SmoothQuant/LLM.int8/FP8/NF4/MLX)→ 同上 § 6
  • 驱动 / CUDA / PyTorch 环境配置NVIDIA驱动-CUDA-PyTorch工程基础:五层版本链 + 报错诊断速查表(配套基础)
  • 推理引擎选型LLM推理引擎选型:硬件配好后选 vLLM / SGLang / Ollama / TensorRT-LLM 等
  • 部署架构HomeLab到中小企业LLM部署架构:4 层架构 + 监控 + 容灾

8.2 与模型架构的关系

8.3 与选型的关系

8.4 与训练的关系


9. 术语速查

术语全称含义
TFLOPSTera Floating-point Operations Per Second每秒万亿次浮点运算
TOPSTera Operations Per Second每秒万亿次操作(通常指 INT8/FP8 等低精度)
TIPSTera Instructions Per Second每秒万亿次指令(整数,GPU 营销中很少用)
FMAFused Multiply-Add融合乘加 = 一次 (a × b + c),GPU 算力公式中的 × 2 因子
CUDA CoreNVIDIA 的通用计算核心,标量 / 向量计算单元
Tensor Core矩阵乘累加专用单元,LLM 推理 / 训练核心,Volta 起引入
SMStreaming MultiprocessorNVIDIA GPU 的基本计算单元,包含若干 CUDA Core + Tensor Core
FP64Double Precision双精度,科学计算用,AI 几乎不用
FP32Single Precision单精度,算力基线
TF32TensorFloat-32NVIDIA 的”混合精度”:FP16 精度 + FP32 范围
FP16Half Precision半精度,训练/推理常用
BF16Brain Float 16与 FP16 同位数但范围更大,Ampere 起支持
FP8Ada / Hopper 起原生支持(E4M3/E5M2 两种格式)
FP4Blackwell 起原生支持,营销 “AI TOPS” 的主力
INT8 / INT4整数低精度,推理量化常用
MXFP4Microscaling FP4微缩放 FP4,gpt-oss 等模型使用
累加精度Accumulation PrecisionTensor Core 的输入精度 vs 累加(输出)精度,混合精度的核心
稀疏算力 / 结构化稀疏2:4 SparsityAmpere 起支持的 4 选 2 稀疏模式,算力翻倍但需模型支持
GDDRGraphics Double Data Rate主流游戏 / 工作站显卡显存类型
HBMHigh Bandwidth Memory垂直堆叠的高带宽显存,位宽极大,LLM 训练必备
HBM3eHBM 第 5 代,B200 等高端卡使用
显存带宽Memory Bandwidth= 显存频率 × 位宽 / 8,LLM 推理瓶颈
位宽Memory Bus Width显存总线宽度,“老黄刀法” 重灾区
PAM4Pulse Amplitude Modulation 4-levelGDDR6X 用的信号编码,翻倍频率
L2 CacheLevel 2 CacheGPU 内部高速缓存,Ada 起加大,游戏受益 LLM 不受益
NVLinkNVIDIA 的 GPU 互联技术,带宽远高于 PCIe
NVSwitch高端服务器主板集成的 NVLink 交换器,数据中心专属
SLIScalable Link InterfaceNVIDIA 老的多卡桥接技术,只加速游戏,已被 NVLink 替代
SXMNVIDIA 数据中心 GPU 的高带宽接口(非 PCIe)
DP4ADot Product 4 INT8Pascal P40 引入的 INT8 加速指令
MarlinNVIDIA 在 Ampere/Ada 上的 INT4/FP8 加速算子,见 量化选型笔记
垃圾佬社区俚语,擅长用古老 Tesla 卡 / 矿卡搭低成本 AI 平台的爱好者
战术核显卡社区俚语,形容 Kepler 时代 Tesla K 系列(老 + 烫 + 还在用)

10. 来源、评分与可商榷点

10.1 来源

  • 原始素材:LINUX DO 社区 @flymyd 的「简单易懂的 LLM 相关知识梳理」系列
    • ep.3-2 认识 NVIDIA 显卡(2026 年 1 月 9 日初稿,内含 “老黄是真的该死” 等吐槽)
  • 整理日期:2026 年 5 月 24 日

10.2 笔者评分

维度评分
技术准确度★★★★★
实战经验★★★★★
“刀法”洞察★★★★★
教学性★★★★☆(工厂比喻 + 倍率表非常清晰)
时效性★★★★★(Blackwell 已经覆盖)
总分9.5 / 10

10.3 笔记吸收策略

  • 完整吸收:NVIDIA 架构演进时间线 + 各代倍率表 + 显存进化 + NVLink 表
  • 完整吸收:工厂比喻(算力=生产速度 / 位宽=车道数 / 带宽=运输能力)— 这是核心干货
  • 完整吸收:打游戏 vs LLM 推理 vs LLM 训练的瓶颈差异 — 本文核心认知
  • 完整吸收:4060Ti 128bit 案例 — 经典老黄刀法
  • 扩展:增加了”显卡选购决策树”(原文只讲架构,我加了”按预算选什么”)
  • ⚠️ 保留作者梗:“老黄是真的该死” / “垃圾佬” / “战术核显卡” 等用引用块标注

10.4 作者没覆盖到的(可补充方向)

  1. AMD GPU:RDNA(RX 7900 XTX 等)+ CDNA(MI300X 等)— ROCm 生态、HIP 编程模型,完全没提
  2. Intel GPU:Arc 系列 + Ponte Vecchio — OneAPI 生态,完全没提
  3. 国产算力:
    • 昇腾(Ascend)910B / 910C / 950:华为系国产 NPU
    • 寒武纪(Cambricon)思元 590:国产推理卡
    • 海光(Hygon)DCU:基于 AMD GCN 授权
    • 天数智芯 / 摩尔线程 / 沐曦 / 燧原:国产 GPU 创业公司
    • 这些都和 LLM 落地强相关,作者 toG 场景下提了”昇腾”,但未展开
  4. Apple Silicon:M1/M2/M3/M4 系列的统一内存架构,跑大模型的特殊优势(在 量化选型笔记 中有覆盖)
  5. Google TPU:作者只提了 “TPU 让 Gemini 推理很快”,未深讲 TPU vN 架构
  6. PCIe 代际:PCIe 3.0 / 4.0 / 5.0 对多卡训练的影响,作者未细讲
  7. 散热与功耗:RTX 4090 / 5090 功耗 450W+,多卡组装的电源 / 机箱要求未涉及
  8. 二手卡风险:挖矿卡 / 拆机卡的辨别方法,作者未讲

10.5 时效性提醒

📅 截至 2026 年 5 月:

  • Blackwell(50 系)产能逐步爬升,但买不到 5090 / B200 仍是常态
  • 昇腾 950 上市时间未定,作者提及”下半年上市”
  • 国产 GPU 政策:信创要求可能让国产卡在政企市场快速增长
  • 量化生态:FP4 量化模型 2026 年下半年才会大规模出现

10.6 主观色彩的提醒

作者写作风格充满 LD 社区的”垃圾佬”幽默:

  • 老黄是真的该死”——一种半开玩笑的吐槽,实际作者技术分析非常严谨
  • 战术核显卡”——形容 Kepler 老 Tesla 卡(老 + 烫)
  • P100 是首个 Tesla HBM 卡,和其他两位不太一样”——这种”两位”是 LD 老炮黑话(P4 / P40 / P100 三兄弟)
  • Apple Silicon 比喻成统一内存巨人”——形象但需上下文

洞察是真的,梗是 LD 风,看的时候自动区分