核心概念
QPS (Queries Per Second)
- 定义:每秒请求数,衡量系统负载的关键指标
- 计算:
QPS ≈ 在线用户数 ÷ 20 - 示例:2000人在线 → 约100 QPS
常用术语
| 术语 | 含义 | 说明 |
|---|---|---|
| QPS | 每秒请求数 | 系统负载指标 |
| RT | 响应时间 | 单个请求耗时 |
| 吞吐量 | Throughput | 单位时间处理数据量 |
| 并发 | Concurrent | 同时在线用户数 |
模型架构
Dense vs MoE
Dense(密集)模型
- ✅ 优点:同参数量下更聪明,推理质量高
- ❌ 缺点:推理慢,计算量大
- 📌 适用:质量优先场景(研究、复杂推理)
MoE(混合专家)模型
- ✅ 优点:推理快,每次只激活部分专家
- ❌ 缺点:同参数量下不如Dense聪明
- 📌 适用:速度优先场景(客服、对话)
关键参数
| 参数 | 作用 | 经验值 |
|---|---|---|
| 层数 | 决定思考深度 | 小模型30-50层,中模型64层 |
| 隐藏层维度 | 决定理解精度 | 越大越精确,计算开销越大 |
| 注意力头数 | 多角度理解 | 与隐藏层维度成比例 |
| 上下文长度 | 处理文本长度 | 原生长度性能最好 |
GQA(分组查询注意力)
- Q:KV = 64:8 → 每8个查询头共享1个键值头
- 作用:在有限显存内处理更长上下文
- 类型:MHA(1:1) > GQA(N:M) > MQA(N:1)
硬件选择
显卡架构演进
Pascal → Volta → Turing → Ampere → Ada → Hopper → Blackwell (1080Ti) (V100) (2080Ti) (3090) (4090) (H100) (未来) 2016 2017 2018 2020 2022 2022 2024
精度与架构对应
| 精度类型 | 最低架构 | 原生支持架构 | 说明 |
|---|---|---|---|
| FP16 | Pascal | Pascal/Volta | 半精度,老显卡标配 |
| BF16 | Ampere | Ampere | 30系起步,主流精度 |
| FP8 | Ampere(模拟) | Ada/Hopper | 40系最优,速度快精度高 |
| INT4 | Pascal | Ampere | 量化压缩,省显存 |
按显卡选精度
- Ada及更新:
FP8 > BF16 > AWQ > SmoothQuant - Ampere:
BF16 > AWQ > SmoothQuant,避免FP8 - Turing:
FP16 > AWQ > SmoothQuant - Pascal及更老:
GPTQ > GGUF > BNB - Apple Silicon:
MLX > GGUF
量化方法速查
| 方法 | 适用场景 | 优点 | 缺点 |
|---|---|---|---|
| GGUF | CPU/Mac/老显卡 | 兼容性最好 | 速度一般 |
| AWQ | 主流INT4方案 | 泛化好,不易过拟合 | 需Turing+ |
| GPTQ | 老显卡 | 曾经主流 | Pascal上慢 |
| FP8 | 新显卡 | 速度最快,精度高 | 需Ada+ |
| MLX | Apple Silicon | Mac原生优化 | 仅Mac可用 |
模型命名规则
标准格式
Qwen2.5-72B-Instruct-AWQ ↓ ↓ ↓ ↓ ↓ 家族 版本 参数 类型 量化
各部分含义
1. 模型家族
- Qwen = 通义千问(阿里)
- Llama = Meta
- DeepSeek = 深度求索
- GLM = 智谱AI
2. 版本号
- 数字越大越新
- 如:Qwen1.0 → 2.0 → 2.5 → 3.0
3. 参数量
- 0.5B/3B = 超轻量(手机、树莓派)
- 7B/14B = 轻量(个人PC、Mac)
- 32B/72B = 中量(工作站、服务器)
- 235B+ = 重量(集群)
4. 类型后缀
| 后缀 | 含义 | 能否直接对话 | 适用人群 |
|---|---|---|---|
| (无) | Base基座模型 | ❌ | 研究员、要微调的 |
| -Instruct | 指令微调 | ✅ | 普通用户 |
| -Chat | 对话优化 | ✅ | 聊天场景 |
| -Coder | 代码专精 | ✅ | 程序员 |
5. 量化方法
- AWQ/GPTQ/GGUF = 量化方法
- FP8/INT4/INT8 = 精度标识
实例解析
Qwen/Qwen2.5-7B-Instruct-AWQ 解读: ├─ 组织:Qwen(阿里通义千问) ├─ 版本:2.5代 ├─ 参数:7B(70亿) ├─ 类型:Instruct(✅可直接对话) └─ 量化:AWQ INT4(省显存版)
快速选型
| 需求 | 推荐模型 |
|---|---|
| 直接对话/写代码 | Qwen2.5-7B-Instruct |
| 自己微调 | Qwen2.5-7B(Base) |
| 显存不足(8GB) | Qwen2.5-7B-Instruct-AWQ |
| Mac用户 | mlx-community/Qwen2.5-7B-4bit |
| 专注编程 | Qwen2.5-Coder-7B-Instruct |
| 最高质量 | Qwen2.5-72B-Instruct |
企业级部署
需求估算公式
用户转化QPS
注册用户 → 日活(20%) → 在线(5%) → QPS(÷20) 示例:20万注册用户 ├─ 日活:20万 × 20% = 4万 ├─ 在线:4万 × 5% = 2000人 └─ QPS:2000 ÷ 20 ≈ 100
硬件需求
需要GPU数 = 目标QPS ÷ 单GPU支撑QPS 单GPU能力估算: ├─ 每秒生成tokens ÷ 平均回答tokens └─ 例:60 tokens/s ÷ 200 tokens = 0.3 QPS
20万用户客服系统方案
方案一:高端方案
配置:2-4台 × 4×A100 80GB 模型:Qwen2.5-72B-Instruct (FP8) 性能:600+ tokens/秒 投入:150-250万 适合:长期使用,追求质量
方案二:平衡方案(推荐)
配置:4-6台 × 2×L40S 48GB 模型:Qwen2.5-32B-Instruct 性能:400-600 tokens/秒 投入:80-120万 适合:性价比优先
方案三:快速方案
配置:8-10台 × 2×RTX 4090 模型:Qwen2.5-14B-Instruct (AWQ) 性能:800-1200 tokens/秒 投入:40-60万 适合:快速上线,灵活扩展
本地 vs 云服务
云服务成本(以通义千问为例)
价格:¥0.012/1K tokens 日请求:1.2亿tokens 月成本:¥43,200 年成本:¥518,400
ROI分析
方案二投入:¥100万 云服务年费:¥51.8万 回本周期:1.9年 2年后年省:¥51.8万
部署建议
- 初期(0-6月):使用云服务API快速验证,成本:月3-5万
- 中期(6-12月):混合部署(70%本地 + 30%云端),投入:80-120万硬件
- 长期(1年+):全本地部署 + 云端灾备,总投入:150-200万
监控运维
核心工具
Prometheus(数据采集)
- 自动收集GPU、系统、服务指标
- 存储时序数据
- 支持告警规则
Grafana(数据可视化)
- 将数据制作成图表大屏
- 实时监控系统状态
- 直观展示瓶颈
关键监控指标
硬件层面
├─ GPU利用率(建议70-85%) ├─ 显存使用(不超过90%) ├─ GPU温度(低于85°C) └─ 功耗监控
服务层面
├─ QPS(每秒请求数) ├─ RT(响应延迟) ├─ 错误率(<1%) ├─ 队列长度 └─ Token生成速度
数据驱动决策示例
场景1:性能优化 监控发现:GPU利用率只有30% 分析:模型太小,硬件浪费 决策:换更大模型或减少GPU 结果:成本降低30%
场景2:容量规划 监控趋势:QPS每月涨15% 预测:3个月后超负荷 决策:提前采购扩容 结果:避免业务中断
场景3:故障预警 监控报警:GPU温度85°C+ 处理:检查散热,更换风扇 结果:避免硬件损坏
快速部署监控
# Docker一键部署 docker-compose up -d # 访问Grafana http://服务器IP:3000 用户名: admin 密码: admin # 导入大模型监控模板 点击导入 → 选择模板 → 完成
实战速查表
Mac Mini M2 16GB 部署
推荐工具
1️⃣ Ollama(最简单) brew install ollama ollama run qwen2.5:7b 2️⃣ LM Studio(图形界面) 下载安装 → 搜索模型 → 一键运行 3️⃣ MLX(性能最优) pip install mlx-lm mlx_lm.generate --model Qwen2.5-7B-4bit
推荐模型
日常使用:Qwen2.5-7B-Instruct (Q4) ~5GB 高质量:Qwen2.5-14B-Instruct (Q4) ~9GB 极速版:Qwen2.5-3B-Instruct ~3GB
个人工作站部署
RTX 4090 24GB: 推荐:Qwen2.5-32B-Instruct (AWQ) 工具:vLLM / Ollama 速度:50-70 tokens/秒 RTX 3090 24GB: 推荐:Qwen2.5-14B-Instruct (BF16) 工具:vLLM / text-generation-webui 速度:40-60 tokens/秒
常用下载源
- 国内:ModelScope:https://modelscope.cn
- 国外:HuggingFace镜像:https://hf-mirror.com
附录:专业术语表
| 术语 | 英文 | 解释 |
|---|---|---|
| LLM | Large Language Model | 大语言模型 |
| Dense | Dense Model | 密集模型,所有参数参与计算 |
| MoE | Mixture of Experts | 混合专家,部分参数激活 |
| GQA | Grouped Query Attention | 分组查询注意力 |
| QPS | Queries Per Second | 每秒查询数 |
| RT | Response Time | 响应时间 |
| FP16/BF16 | Float Point | 浮点精度 |
| INT4/INT8 | Integer | 整数量化 |
| AWQ | Activation-aware Weight Quantization | 激活感知权重量化 |
| GPTQ | Generalized Post-Training Quantization | 广义训练后量化 |
| GGUF | GPT-Generated Unified Format | 统一格式(llama.cpp) |
| vLLM | - | 高性能推理框架 |
| MLX | - | Apple Silicon专用框架 |
总结:先明确需求,再按显存和场景选模型;监控先行,避免拍脑袋扩容。