各家 LLM 模型特点速查:选 API 前先认人
一句话:领导让你给项目选个 LLM,你打开 OpenAI / Anthropic / Google / 阿里云百炼 / 火山方舟…屏幕前一片家族产品矩阵图,每家都说自己 SOTA。这篇是开发者视角的”识人手册”——闭源六大家族 + 开源十大家族 + 当代主力型号速查表,告诉你每家擅长什么、坑在哪、什么场景该选谁。
目录
- 0. 写在前面:为什么需要”按家族”了解 LLM
- 1. 闭源模型:六大家族
- 2. 开源模型:十大家族
- 3. 选型经验:作者的核心金句
- 4. 与本知识库其他章节的关联
- 5. 术语速查
- 6. 来源、评分与可商榷点
0. 写在前面:为什么需要”按家族”了解 LLM
如果你打开任何 API 聚合平台,会看到几十甚至上百个模型 ID。光看名字根本分不清:
gpt-5.2、gpt-5.2-codex、gpt-5.2-pro、gpt-5.2-chat-latest …
claude-sonnet-4-7、claude-opus-4-7、claude-mythos …
gemini-3-pro、gemini-3-flash、gemini-2.5-flashlite …
qwen-3.6-plus、qwen-3.6-max-preview、qwen-coder-plus …
DeepSeek-V4-Pro、DeepSeek-V4-Flash …
这种命名混乱的根因:每家都搞了”大杯 / 中杯 / 小杯”+ 推理 / 编程 / 视觉 / 极速等多个变体,再叠加版本号,光看 ID 完全分不清能力档位。
正确的姿势是按家族认人:先记住 6 家闭源 + 10 家开源 = 16 个家族,各家族有自己的核心定位(GPT 偏后端 / Claude 工程规划 / Gemini 多模态),再按版本号定位具体型号。
📅 本文的时间锚点:作者原稿写于 2026 年 1 月,2026 年 5 月做了大规模更新。模型版本变化非常快,使用具体型号前请去官网核对当前是否还存在。
1. 闭源模型:六大家族
| 公司/机构 | AI 模型系列 | 核心定位 |
|---|---|---|
| OpenAI | GPT 系列 | 冷静的理性思考(后端理工男) |
| Gemini 系列 | 多模态 + 世界知识之王(文科生) | |
| Anthropic | Claude 系列 | 最均衡的编码代理(全能选手) |
| xAI | Grok 系列 | 力大砖飞 + 低审查(沙雕网友) |
| 阿里巴巴 | 通义千问系列 | 指令遵循强,国内 T0(工业风) |
| 字节跳动 | 豆包系列 | 产品强模型一般(C 端市占率王) |
1.1 OpenAI GPT:冷静的理性思考
性格画像
作者原话:“GPT-5 更像一名理工男。当然,它是一名后端理工男,在审美上未必有多好的品味。”
关键特征:
- 📉 回复简短:GPT-5 时代起就以短回复闻名,省 output token,完成同等任务所需时间被进一步压缩
- 🧊 冷漠到不近人情:创意写作用户因此抛弃了 GPT
- 🤖 指哪打哪:不废话,just do it
- 💻 写后端 / 复杂前端的好选择
主要型号定位
| 型号 | 主打场景 | 备注 |
|---|---|---|
gpt-5.2 | 通用旗舰,默认 reasoning=medium | 中杯,新开工程 / 模块用这个 |
gpt-5.2-codex | 代理式编码专用 | 改 bug 用 codex 变体 |
gpt-5.2-pro | 企业级最高准确度 | 超大杯,支持 xhigh reasoning |
gpt-5.2-chat-latest | ChatGPT 网页”即时”模式 | 延迟最低但”很蠢” |
gpt-5.1-codex-max | 跨多窗口连贯处理数百万 tokens | 项目级长时间编码任务 |
gpt-5.4 / gpt-5.5 | 当前主力(截至 26.5) | 找回了一些”说人话”的能力 |
作者经验金句
💡 “改 bug 用
gpt-5.2-codex,新开工程 / 模块用gpt-5.2。codex 更突出指哪打哪的能力,而gpt-5.2会主动帮你多想些。”
⚠️ “网页端给出的解决方案是自动路由(其实就是超级降智)。”
💡 “Claude 更擅长于工程规划,而 GPT 精于解决特定问题。“
选 GPT 的场景
- ✅ 写后端逻辑或复杂前端逻辑(非 UI 美学)
- ✅ 需要在已有架构里”修 bug、写测试、补具体功能”
- ✅ 想要”指哪打哪”、不需要 AI 自作主张
- ❌ 创意写作 / 角色扮演(冷漠)
- ❌ 前端 UI 设计审美(审美一般)
1.2 Google Gemini:多模态和世界知识之王
性格画像
作者原话:“Gemini 更像一名文科生:大参数带来的丰富世界知识给了它更强的文学理解能力,思考之细腻和情感共鸣能力使得它成为创意写作的最优选。”
关键特征:
- 🌍 超强世界知识(参数量普遍认为 1T+)
- 🎨 前端审美顶级(Gemini 3 Pro 写出的前端效果”惊艳了所有关注 AI 前沿动向的人”)
- ⚡ 推理速度快得离谱(疑似 TPU 加持,大参数也跑得快)
- 🎭 创意写作首选(接梗能力强到分不清是 AI 还是人)
- 🧪 多模态王
当前痛点(26.5 更新版)
作者原话:“Gemini 目前已经成为了御三家中吊车尾的存在。”
具体问题:
- 较强的幻觉
- 注意力漂移(包括指令遵循能力退步)
- 长上下文注意力崩塌式退化
- 实际大型工程不建议使用:改崩工程 / 乱改文件
💡 优点仅剩:世界知识、VL 能力、不俗的硬智力。
主要型号定位
| 型号 | 主打场景 | 备注 |
|---|---|---|
gemini-3-pro | 旗舰多模态 + 推理 | 前端王,但长上下文幻觉严重 |
gemini-3-flash | 速度旗舰,为 Agent 设计 | ”Flash 反杀 Pro”——大部分搬砖活够用 |
gemini-2.5-pro | 2.5 世代旗舰 | 长文本召回能力强(实际”也一坨”) |
gemini-2.5-flash-lite | 极致性价比 | 目前最廉价的百万上下文模型 |
选 Gemini 的场景
- ✅ 多模态任务(图像理解 / 视频)
- ✅ 需要大量世界知识的问答
- ✅ 创意写作 / 角色扮演 / 接梗
- ✅ 前端 UI 设计 / 视觉效果
- ❌ 大型工程后端(改崩工程 / 注意力漂移)
- ❌ 严格指令遵循场景
1.3 Anthropic Claude:最均衡的编码代理模型
性格画像
作者原话:“Anthropic,又称 A÷ / A畜,大家很熟悉了,神一样的 Coding Agent,翔一样的口碑和服务可用性。”
⚠️ 作者梗:
A÷是 LINUX DO 社区对 Anthropic 的吐槽缩写——形容”模型能力天花板,但服务可用性是地下室”。同理后文Z÷指智谱 ZAI 也吃过类似亏。
关键特征:
- 🛠️ 最佳编码 Agent(2026 年公认)
- 🧠 强大的规划能力:能给出更适合工程上的方案
- 🎯 跑分没赢过,体验没输过
- 📊 超长上下文(Max 订阅 1M,大部分渠道 200K)
当前版本(26.5 更新)
| 型号 | 主打场景 | 备注 |
|---|---|---|
claude-sonnet-4-7 | 中杯,均衡编码 | 公认编程王 |
claude-opus-4-7 | 超大杯,科研编码 | 反重力反代优选 |
claude-mythos | 新型号 | — |
claude-4-5-haiku | 小杯 | 被 Gemini Flash 系列打出 shi |
作者吐槽:“Claude 4.7 系列口碑出现了倒退,主要问题在于不说人话(有一种说法是 Claude 在偷偷蒸 GPT,存疑)及注意力漂移等问题。“
关键警告
📌 官方 Max 订阅才有 1000K 上下文,大部分中转渠道 / 反重力 / Kiro 逆向都是 200K 上下文。
选 Claude 的场景
- ✅ 闭眼 vibe coding(一句话需求 → 完整工程)
- ✅ 前后端一把抓的项目
- ✅ 需要 AI 主动规划架构方案
- ❌ 服务稳定性敏感的生产场景(经常断流 / 限速)
- ❌ 需要”严格按我说的来”(Claude 会自作主张)
💡 作者吐槽:“当前版本的 Claude 会出现一些不遵循指令坚持按照自身设计方案执行的现象,我认为这是灾难性的。“
1.4 xAI Grok:力大砖飞
性格画像
作者原话:“马斯克也许缺乏品味,但他足够有钱。Grok 好不好用先放一边,超大规模的显卡集群是实打实存在的。”
关键特征:
- 💪 超大显卡集群 + 力大砖飞原则
- 🦄 沙雕网友式对齐:不是”a helpful assistant”,更像 X(Twitter)网友
- 🌐 背靠 X 语料(全自动开盒器)
- 🔞 极低审查下限(各家 API 中,Grok / Vertex / DeepSeek 审查相对最低)
- 🎭 创意写作 / 角色扮演 / NSFW 场景常客
当前痛点(26.5 更新)
作者原话:“如果说 Gemini 离牢字辈很近了,那么 Grok 已经是牢字辈的了。”
- Grok 团队经过数次重大变动,无力继续训练如此大规模的模型
- Grok 4.3 最后一舞不进反退
- 训练算力大部分将租给 Anthropic 用来推理
主要型号
| 型号 | 主打场景 | 备注 |
|---|---|---|
grok-4-heavy | 多智能体协作 | 推理强度最高(超大杯) |
grok-4.1 | 2025 底旗舰 | 高 EQ + 低幻觉,创意写作好 |
grok-4.1-fast | 长上下文 | 200 万 token,类似 Gemini Flash |
grok-code-fast-1 | 编程模型 | 体感约 Gemini 2.5 Flash 水平,但免费 |
💡 Grok Code Fast 是各种 Vibe Coding 客户端里常见的免费选项,质量一般但速度快,作为”备胎”很合适。
选 Grok 的场景
- ✅ NSFW / 角色扮演(无需破甲)
- ✅ 需要 X 平台实时搜索
- ✅ 想要一个”沙雕网友”风格的 AI
- ❌ 严肃的企业落地
- ❌ 大型工程开发
1.5 阿里通义千问 闭源版
性格画像
作者原话:“通义千问的特点是极强的指令遵循能力和稀烂的产品。”
📌 注意:Qwen 家族分为开源和闭源两种。除了每代的超大杯(通义千问 Max)闭源,其他商业 API 均能找到对应的开源型号。本节只讲闭源。开源版见 § 2.2。
关键特征:
- 🎯 极强的指令遵循能力(国内 T0 选手)
- 💼 国内企业落地友好:性价比适中、模型选择丰富、服务稳定
- 🤖 AI 味重:回答总感觉缺了点味道,Qwen3 RL 训练后尤甚
- ⚠️ 思考耗 Token 严重:Instruct 模型倾向于输出思维链,导致复杂任务总 Token 较高
主要型号(以闭源旗舰为代表)
| 型号 | 主打场景 | 备注 |
|---|---|---|
qwen-3.6-plus | 当前最新均衡(26.5) | 编程不错,可当小 Sonnet 用 |
qwen-3.6-max-preview | 超大杯 | 阿里祖传训不明白超大杯,“用着咳嗽” |
qwen3-max | 上一代超大杯 | 上下文 256K,输出 64K |
qwen-plus | 大杯,1M 上下文 | 适合复杂任务推理 |
qwen-long | 长文本专家 | 1000 万 token 超长输入 |
qwen3-coder-plus | 编码特化大杯 | 1M 上下文 + 64K 输出 |
qwen3-vl-plus | 视觉大杯 | 单图最大 16K tokens |
阿里系产品矩阵
阿里在 AI 上”养蛊”严重,除百炼外还有:
- ModelScope(魔搭):面向开发者
- iFlow:心流团队
- 蚂蚁灵光:面向 C 端
- 百炼平台:商业 API 主战场
💡 作者吐槽:“乱拳打死老师傅”——Meta 的 LLaMA 系列就是被乱拳打死的。
选 Qwen 闭源的场景
- ✅ 国内企业落地(性价比 + 服务稳定 + 指令遵循)
- ✅ 需要发票 / 合规
- ✅ 多模态任务(VL 系列)
- ❌ Token 预算极紧(思维链耗 Token)
- ❌ 需要”有人味”的创意写作
1.6 字节豆包
性格画像
作者原话:“如果你手机里需要一款不需要爬墙就很好用的 AI 应用,那我想应该是豆包没错了。但使用 LLM API?除非你的公司疯狂迷恋 Coze。”
关键特征:
- 📱 C 端市占率遥遥领先(国内)
- 🎬 多模态深耕(音视频)
- 🤖 底模一直一般,但产品做得好
- ⚠️ Seed 2.0 系列幻觉拖后腿
当前型号(26.5 更新)
| 型号 | 主打场景 | 备注 |
|---|---|---|
doubao-seed-2.0-pro | 当前旗舰 | T1 梯队但幻觉是短板 |
doubao-seed-2.0-lite-260428 | 轻量版 | — |
doubao-seed-1-8-251215 | 上一代大杯 | 思维链 64K |
doubao-seed-code-preview-251028 | 编码特化 | — |
💡 作者猜测:“网传神秘流出天梯里出现的、能力接近 GPT-5.4 的模型,据说是豆包家族,Seed 团队完全有能力搞成。“
选豆包的场景
- ✅ 国内 C 端 AI 应用(用户体验好)
- ✅ 音视频多模态场景
- ✅ 接入 Coze 工作流
- ❌ 严肃企业 API 调用(底模一般 + 幻觉)
1.7 闭源模型 ID 速查表
📅 截至 2026 年 5 月,以官网为准。
OpenAI GPT
| 模型名称 | 模型 ID | 上下文 | 最大输出 | 备注 |
|---|---|---|---|---|
| GPT-5.2 Thinking | gpt-5.2 | 400K | 128K | 最高推理强度(大杯) |
| GPT-5.2 Pro | gpt-5.2-pro | 400K | 128K | 企业级超大杯 |
| GPT-5.2 Chat | gpt-5.2-chat-latest | 128K | 16K | 即时模式(小杯,很蠢) |
| GPT-5.2 base | gpt-5.2 | 400K | 128K | 通用旗舰中杯 |
| GPT-5.2 Codex | gpt-5.2-codex | 400K | 128K | 代理式编码专用 |
| GPT-5.1 Codex Max | gpt-5.1-codex-max | 400K | 128K | 跨窗口压缩,百万级编码 |
Google Gemini
| 模型名称 | 模型 ID | 上下文 | 最大输出 | 备注 |
|---|---|---|---|---|
| Gemini 3 Pro | gemini-3-pro | 1M | 64K | 旗舰多模态,前端王 |
| Gemini 3 Flash | gemini-3-flash | 1M | 64K | 速度旗舰,Flash 反杀 Pro |
| Gemini 2.5 Pro | gemini-2.5-pro | 2M | 64K | 长文本召回 |
| Gemini 2.5 Flash | gemini-2.5-flash | 1M | 64K | 均衡版 |
| Gemini 2.5 Flash Lite | gemini-2.5-flashlite | 1M | 64K | 最廉价的百万上下文 |
Anthropic Claude
| 模型名称 | 模型 ID | 上下文 | 最大输出 | 备注 |
|---|---|---|---|---|
| Claude 4.5 Opus | claude-4-5-opus-20251124 | 200K | 64K | 超大杯(反重力优选) |
| Claude 4.5 Sonnet | claude-4-5-sonnet-20250929 | 200K / 1M* | 64K | 中杯,Agent 项目级代码 |
| Claude 4.5 Haiku | claude-4-5-haiku-20251014 | 200K | 64K | 小杯,被 Gemini Flash 反超 |
* 200K vs 1M:只有官方 Max 订阅有 1M,大部分渠道(反重力 / Kiro 逆向)200K。
xAI Grok
| 模型名称 | 模型 ID | 上下文 | 最大输出 | 备注 |
|---|---|---|---|---|
| Grok 4 Heavy | grok-4-heavy | 256K | 8-16K | 多智能体超大杯 |
| Grok 4.1 | grok-4.1 | 256K | 16K | 高 EQ + 低幻觉(大杯) |
| Grok 4 | grok-4 | 256K | 8K | 多模态 + X 搜索 |
| Grok 4.1 Fast | grok-4.1-fast | 2M | 16K | 超长上下文(中杯) |
| Grok 4 Fast | grok-4-fast | 2M | 30K | 极速 / 高性价比(小杯) |
| Grok Code Fast 1 | grok-code-fast-1 | 256K | 16K | 免费编程模型 |
阿里 Qwen 闭源
| 模型名称 | 模型 ID | 上下文 | 最大输出 | 备注 |
|---|---|---|---|---|
| Qwen3 Max | qwen3-max | 256K | 64K | 超大杯 |
| Qwen Plus | qwen-plus | 1M | 32K | 大杯 |
| Qwen Flash | qwen-flash | 1M | 32K | 中杯 |
| Qwen3 VL Plus | qwen3-vl-plus | 256K | 32K | 视觉大杯 |
| Qwen3 VL Flash | qwen3-vl-flash | 256K | 32K | 视觉中杯 |
| Qwen Long | qwen-long | 10M | 32K | 长文本专家(1000 万 token) |
| Qwen3 Coder Plus | qwen3-coder-plus | 1M | 64K | 编码大杯 |
| Qwen3 Coder Flash | qwen3-coder-flash | 1M | 64K | 编码小杯 |
字节豆包
| 模型名称 | 模型 ID | 上下文 | 最大输出 | 备注 |
|---|---|---|---|---|
| Doubao Seed 1.8 | doubao-seed-1-8-251215 | 256K | 32K | 大杯,思维链 64K |
| Doubao Seed Code | doubao-seed-code-preview-251028 | 256K | 32K | 编码特化 |
| Doubao Seed Lite | doubao-seed-1-6-lite-251015 | 256K | 32K | 中杯 |
| Doubao Seed Flash | doubao-seed-1-6-flash-250828 | 256K | 32K | 小杯,视觉定位 |
| Doubao Seed Vision | doubao-seed-1-6-vision-250815 | 256K | 32K | 视觉中/大杯 |
2. 开源模型:十大家族
📌 作者原话:“如果说商业闭源领域里牢美是老大哥,那牢中就是开源赛道上的扛把子。”
国产开源已成为全球开源主力。Meta 的 LLaMA 4 表现不佳后,Reddit 的 r/LocalLlama 已经变成 r/LocalQwen 的形状。
| 公司/机构 | 模型系列 | 核心定位 |
|---|---|---|
| 深度求索 | DeepSeek 系列 | 开源领域试金石 |
| 阿里巴巴 | Qwen 开源系列 | 模海战术 + 各尺寸全覆盖 |
| 智谱 ZAI | GLM 系列 | 编码 Agent,Z÷ 称号 |
| 月之暗面 | Kimi 系列 | 1T 巨模,Claude 追赶者 |
| MiniMax | MiniMax 系列 | 小参数 + T1 编码 |
| 腾讯 | Hunyuan 系列 | 略过(只有 A13B 还行) |
| 小米 | MiMo 系列 | 智能家居视觉特化 |
| 美团 | LongCat 系列 | 难绷的名字 |
| 谷歌 | Gemma 系列 | QAT 量化感知训练优势 |
| OpenAI | gpt-oss 系列 | 研究学习用,中国部署不适合 |
2.1 DeepSeek:真金不怕火炼
性格画像
作者原话:“深度求索一直在认真做事…通义千问和 DeepSeek 有相似之处——拥抱开源,有真本事,产品稀碎。”
关键特征:
- 🏗️ 架构演进:Dense → V2/V2.5 转 MoE → V3/R1 火爆出圈 → V4 当下旗舰
- 💸 极致性价比:开源 + 极低 API 价格,大杯模型守门员
- 🎲 大规模 RL + 合成数据训练:能力强但对齐不够(幻觉严重 + 文风放飞)
- 🌍 685B 参数:配上美丽价格,适合企业接入
作者评语:“无论你喜欢它还是讨厌它,它就在这。大杯模型守门员,开源领域试金石;只要在几个领域能够超越 DeepSeek,就能加冕登基,打不过 DeepSeek 就别上桌吃饭了。“
V3 / R1 时代版本演进
| 模型名称 | 备注 |
|---|---|
DeepSeek-V3 | 初代 V3,“发癫” |
DeepSeek-V3-0324 | 解决部分发癫,幻觉依旧 |
DeepSeek-V3.1 | 融合思考与非思考,注意”极你太美”问题 |
DeepSeek-V3.1-Terminus | 修复极你太美 |
DeepSeek-V3.2 | 启用 DSA 稀疏注意力 + 交错思考 |
DeepSeek-R1 / R1-0528 | 初代 R1 系列 |
💡 “极你太美”事件:DeepSeek V3.1 融合思考与非思考时出现的对齐异常,模型在回答时混入鸡你太美等明显跑偏内容。同期的 Qwen3 因此把融合思考拆开了。
V4 时代(26.5 更新)
| 模型 | 上下文 | 参数 | 备注 |
|---|---|---|---|
| DeepSeek-V4-Pro | 1M | 1.6T-A49B | 编程介于 Opus 和 Sonnet 之间,角色扮演强,缓存命中率超高 |
| DeepSeek-V4-Flash | 1M | 284B-A13B | MiniMax 上位替代,把 MiniMax 打傻了 |
| DeepSeek-V4-Vision | 灰度中 | 推测 V4-Flash 底座 | — |
作者关键观察(对老法师):“V4-Pro 在部分场景可以和 Opus 掰手腕,大部分场景因缺乏工程能力只有 Sonnet 水平。V4 家族强上下文注意力 + 弱工程思维——需要先暖机再用(把需求相关文件尽可能先打入上下文,反正有前缀缓存)。“
选 DeepSeek 的场景
- ✅ 企业接入需要”性价比 + 大参数 + 开源”(可私有化)
- ✅ 角色扮演 / 创意写作(V4-Pro 强项)
- ✅ 长上下文场景(1M)
- ❌ 严格对齐场景(幻觉 + 文风放飞)
- ❌ 需要复杂工程规划(暖机弥补部分)
2.2 阿里 Qwen 开源系列:乱拳打死老师傅
性格画像
作者原话:“阿里从 Qwen 2.5 开始彻底发力,和当时风头正盛的 LLaMA 分庭抗礼。”
关键特征:
- 🎪 模海战术:0.6B → 235B 各尺寸全覆盖,Dense + MoE 都有
- 🎯 指令遵循能力强(开发者友好)
- 🎨 Qwen3-VL 系列:结束了”国模无视觉大将”的时代
- 🛠️ Hugging Face 仓库工具齐全:微调 / 私有化 / 套皮一应俱全
- ⚠️ Qwen 3.5 后训练有问题,3.6 修复了
作者评语:“端上来的太多力,求求你饶了我吧”——选择困难症患者警告。
Qwen3 系列(2507 版本)
💡 如果有 2507 变体,代指 2507 而非 2504 版本(2504 被钉上了耻辱柱)。
| 模型名 | 备注 |
|---|---|
| Qwen3-235B-A22B-Thinking | MoE 思考模式,推理强(很耗 Token!) |
| Qwen3-235B-A22B-Instruct | MoE 指令版,有输出思维链倾向 |
| Qwen3-30B-A3B-Thinking | 激活 3B 核显也能跑,推理飞快 |
| Qwen3-30B-A3B-Instruct | 同上,指令版 |
| Qwen3-32B | Dense,性能强于 30B-A3B,但不适合端侧 |
| Qwen3-14B | Dense,家用显卡爽玩门槛 |
| Qwen3-8B / 4B / 1.7B / 0.6B | 依次小型化,4B 起视为端侧推理 |
Qwen3-VL 系列
| 模型名 | 备注 |
|---|---|
| Qwen3-VL-235B-A22B-Thinking/Instruct | MoE 视觉,开源视觉模的神 |
| Qwen3-VL-30B-A3B-Instruct | MoE 推理飞快,也是神 |
| Qwen3-VL-32B-Instruct | Dense 视觉,较少使用 |
| Qwen3-VL-8B/4B/2B-Instruct | Dense,端侧适用 |
Qwen3-Coder & Qwen3-Next
| 模型名 | 备注 |
|---|---|
| Qwen3-Coder-480B-A35B-Instruct | Qwen Coder CLI 提供免费,但烧 Token,被 GLM/MiniMax 反超 |
| Qwen3-Coder-30B-A3B-Instruct | 国企/军工码农优选,易本地部署 |
| Qwen3-Next-80B-A3B-Instruct | 门控注意力稀疏模型,80B 总参 + 3B 激活,本地推理飞快 |
| Qwen3-Next-80B-A3B-Thinking | 同上思考版 |
Qwen 3.5 / 3.6(26.5 最新)
📅 作者更新:“跑了跑了,Junyang Lin 带着 Qwen 3.6 跑了!Qwen 3.5 系列可能是 Qwen 家族开源矩阵的最后一舞,Qwen 3.6 只有 35B-A3B 和 27B 两个尺寸了。“
| 模型名 | 备注 |
|---|---|
| Qwen3.6-35B-A3B | 对应百炼 Qwen3.6-Flash,养虾/养马优选 |
| Qwen3.6-27B | 不错的本地 Coding/Agent 模型 |
| Qwen3.5-397B-A17B | 对应百炼 Qwen3.5-Plus |
| Qwen3.5-122B-A10B | 本地 Coding/Agent,知识丰富 |
| Qwen3.5-35B-A3B | 对应百炼 Qwen3.5-Flash |
| Qwen3.5-27B | Dense,智力密度高 |
| Qwen3.5-9B/4B/2B/0.8B | 研究用 |
选 Qwen 开源的场景
- ✅ 各尺寸需求都能满足(从核显 1.7B 到 GPU 集群 235B)
- ✅ 国企 / 军工本地部署(Qwen3-Coder-30B-A3B)
- ✅ 视觉任务(Qwen3-VL 系列,神)
- ✅ 需要丰富 HuggingFace 生态工具
2.3 智谱 GLM:从六小龙到四小虎
性格画像
作者原话:“前身是 THUDM,属于从 LLaMA 时代一路走过来的老将了。当年本地部署最早能讲明白中文的就是 chatglm-6b,给人留下了深刻印象。”
关键特征:
- 📜 老将:从 ChatGLM-6B 起就在做中文 LLM
- 🛠️ Coding Agent 路线:从 GLM-4.5 起一路高歌猛进,国产小 Claude
- 🐢 服务质量痛点:推理速度慢、有降智、官方调整 Coding Plan
- 🏷️ 作者称号:
Z÷——和 Anthropic 的 A÷ 并列,因服务可用性问题获此”殊荣”
⚠️ 作者吐槽:“由于推理速度过慢、服务有时不稳定、官方调整 Coding Plan 等问题存在,ZAI 荣获 Z÷ 称号,与 Anthropic 占了一头一尾。“
主要型号
| 模型名 | 参数 | 备注 |
|---|---|---|
| GLM-4.5 | 358B-A32B | 梦开始的地方 |
| GLM-4.5-Air | 106B-A12B | 中小企业部署优选,四张 4090 美美跑量化版 |
| GLM-4.5V | 同 Air | 带视觉,上下文受限 |
| GLM-4.6 | — | 进一步增强 |
| GLM-4.6V | — | 视觉版 |
| GLM-4.7 | — | 支持交错思考的旗舰 |
| GLM-5 | 744B-A40B | 国产小 Claude,能力介于 Sonnet 和 Opus 之间 |
| GLM-5.1 | — | 进一步增强代码能力 |
选 GLM 的场景
- ✅ 国内写代码不能用国外模型时(GLM-5/5.1 替代 Claude)
- ✅ RAG 场景(GLM-4 系列稳定低幻觉)
- ✅ 中小企业本地部署(GLM-4.5-Air)
- ❌ 实时性敏感(推理慢)
- ❌ 服务可用性要求高(Z÷ 问题)
2.4 MiniMax:小参数大智慧
性格画像
作者原话:“跟智谱真是一对苦命鸳鸯,在港股赛跑上市,最终智谱领先一天。MiniMax 在学习 Claude 的路上更加激进。”
关键特征:
- 💎 激进的 Claude 跟随者
- 🐎 230B 参数掰手腕 GLM 358B:激活参数小,推理速度优势显著
- 🎬 音视频合成性价比高,海外业务好
- ⚠️ M2.5 / M2.7 在增强 Agent 后部分领域退步
主要型号
| 模型名 | 参数 | 备注 |
|---|---|---|
| MiniMax-M2 | 230B-A10B | 编码 T1 梯队 |
| MiniMax-M2.1 | 同上 | 进一步增强代码 |
| MiniMax-M2.5 | — | 增强工程思维 + Agent |
| MiniMax-M2.7 | — | 强化外部工具调用 |
💡 作者关键观察:“在实际工作中 one shot 是很难的,很多时候都需要手动测试然后提出问题再尝试修复 BUG 才能得到最终满意的结果,所以推理速度是很重要的一个评判指标。“
选 MiniMax 的场景
- ✅ 需要快速迭代的编码任务(推理速度优势)
- ✅ 中小参数 + T1 能力的平衡
- ✅ 音视频合成(海外业务)
- ✅ “养虾养马”(俗称大批量低成本任务)
2.5 月之暗面 Kimi:1T 巨模震撼
性格画像
作者原话:“美国有基米(GPT),中国有 Kimi!”
💡 作者梗:“基米”是 LD 社区对 Google Gemini 的爱称(“基”是 Gemini 首音节)。原句模仿 NBA “美国有科比,中国有易建联”的梗。
关键特征:
- 🐘 1T 巨模:震撼所有人眼球,有没有比 DeepSeek 更适合编码的 DeepSeek?有的,Kimi K2
- 🧠 大参数泛化能力强:情感细腻,冷门编码场景也能解决
- 🌐 网页比 API 好用:搜索 + 深度研究是少数几个值得用网页的厂
- 💰 缺点:1T 计算成本高,性价比和推理速度不如 MiniMax / GLM
主要型号
| 模型名 | 备注 |
|---|---|
| Kimi-K2-Instruct | 1T 巨模,不带思考 |
| Kimi-K2-Instruct-0905 | 进一步增强代码 |
| Kimi-K2-Thinking | 思考版 |
| Kimi-K2.5 | 融合思考 + 视觉,K2 完全体,1T+视觉 → 前端飞跃 |
| Kimi-K2.6 | 例行提升,比 GLM-5.1 略强 |
选 Kimi 的场景
- ✅ 网络搜索 + 深度研究(网页端王)
- ✅ 需要 1T 大参数泛化的冷门编码场景
- ✅ 前端开发(K2.5 + 视觉)
- ❌ 性价比敏感(1T 成本高)
- ❌ 推理速度敏感
2.6 腾讯 Hunyuan:略过
作者原话:“腾讯和字节有点像的是,都在音视频媒体/多模态方向发力。但腾讯的 LLM…就此略过。”
唯一值得提一下:Hunyuan-A13B 在 80B 这个档可以和 Qwen 掰手腕。混元的 3D 一直做得不错。
2.7 小米 MiMo:互联网厂赶晚集
作者原话:“如果小米进场,那么这个时机一定已经成熟。”
关键特征:
- 👩🔬 罗福莉加入后,MiMo 家族露峥嵘
- 🏠 MiMo-VL-Miloco-7B:在 MiMo-VL 上再训练,智能家居视觉特化,小尺寸保证私有化部署
- 🚀 MiMo-V2-Flash:309B-A15B MoE,前 DeepSeek 研究员归来挑战老东家
- 💰 当前 MiMo V2 处于免费阶段,免费就是免费
💡 作者期待:“我更希望看到的是 MiMo 在 Agent 结合米厂的各种智能硬件的落地探索,现在 AI 成功落地转化的场景太少了。“
| 模型名 | 备注 |
|---|---|
| Xiaomi-MiMo-VL-Miloco-7B | 智能家居视觉特化 |
| MiMo-V2-Flash | 编码 & Agent 模型 |
2.8 美团 LongCat:难绷的名字
作者原话:“龙猫?长猫?这个名字有点难绷。”
- LongCat-Flash:虽叫 Flash,实际是 560B-A27B 大模
- 美团也在音视频发力,有生图 + 视频模型
- 黏着 Qwen 贴身搏斗
- 平平无奇,价格不如 MiMo Flash 实惠(5 元输出 vs MiMo 2.1 元)
2.9 OpenAI gpt-oss 与 谷歌 Gemma:海外开源代表
gpt-oss(秀肌肉式开源)
作者原话:“命里缺啥,名字里就得起啥,所以 OpenAI 不 Open 也非常合理。“
| 模型名 | 备注 |
|---|---|
gpt-oss-20b | 原生 MXFP4,小而快,日常任务还挺好用 |
gpt-oss-120b | 一坨,强烈不推荐,LiveCodeBench 上 20b 反杀 120b(120b 幻觉太高) |
作者评语:“在 Antigravity 里和 Claude 4.5 Opus 并列有一种’我和科比合砍 83 分’的美感。”
启发:稀疏注意力、原生 MXFP4、思考中调用工具——适合研究学习,不适合中国应用部署(自我审查 + 高幻觉)。
Gemma 3(谷歌的国外社区选项)
关键特征:
- 📦 QAT 量化感知训练权重:量化到低精度时保持较好性能(对 HomeLab 玩家友好)
- 👁️ Gemma 3 27B Dense 带视觉,某些场景可与 Qwen3-VL 掰手腕
- 🏥 多变体:medgemma(医疗)、t5gemma、gemma-3n 等
| 模型名 | 备注 |
|---|---|
| gemma-3-1b-it / 4b-it / 12b-it / 27b-it | 主力家族,各尺寸全覆盖 |
💡 HomeLab 选型决策:Gemma 3 还是 Qwen 3? 如果你想在家部署性能尚可且带视觉的大模型,这是核心选择题。Gemma 优势:QAT 量化更友好。Qwen 优势:中文 + 国内生态。
2.10 开源模型 ID 速查表
📅 截至 2026 年 5 月,以 Hugging Face 仓库为准。版本变化非常快,本表只列代表性型号。
(具体型号见上面各家族小节,这里只列家族对应关系)
| 家族 | 代表当前旗舰 | 适用场景 |
|---|---|---|
| DeepSeek | V4-Pro / V4-Flash | 企业接入,极致性价比 |
| Qwen | Qwen3.5/3.6 全尺寸 | 任意尺寸 + 中文 + 视觉 |
| GLM | GLM-5 / 5.1 | 国产小 Claude,Coding Agent |
| MiniMax | M2.7 | 推理速度优势 + 编码 T1 |
| Kimi | K2.5 / K2.6 | 1T 大参数 + 网络搜索 |
| MiMo | MiMo-V2-Flash | Agent + 智能硬件 |
| LongCat | LongCat-Flash | (作者评:平平无奇) |
| Gemma | gemma-3-27b-it | 国外开源 + QAT 友好 |
| gpt-oss | gpt-oss-20b | 研究学习,不适合中国部署 |
3. 选型经验:作者的核心金句
💎 这些是从原文中提炼出的核心方法论,适合贴在工位上。
3.1 关于排行榜与 SOTA
🔑 “现在看排行榜的意义已经几乎没有了,重要的还是看这个模型能不能解决你所处的领域/工程的实际问题。“
3.2 关于编程之王
🔑 “在编程领域里似乎一直是 Claude 和 GPT 在争大哥与二弟的位置。Claude 更擅长于工程规划,而 GPT 精于解决特定问题。“
3.3 关于 GPT codex 用法
🔑 “改 bug 用
gpt-5.2-codex,新开工程 / 模块用gpt-5.2。codex 更突出指哪打哪,而gpt-5.2会主动帮你多想些。“
3.4 关于 Claude 的自作主张
🔑 “当前版本的 Claude 会出现一些不遵循指令坚持按照自身设计方案执行的现象,我认为这是灾难性的。如果你是闭眼 vibe coding 的选手,那么 Claude 绝对是不二之选。“
3.5 关于 DeepSeek 的工程能力
🔑 “V4 家族强上下文注意力 + 弱工程思维——需要先暖机再用(把需求相关文件尽可能先打入上下文,反正有前缀缓存)。“
3.6 关于推理速度的重要性
🔑 “在实际工作中 one shot 是很难的,很多时候都需要手动测试然后提出问题再尝试修复 BUG 才能得到最终满意的结果,所以推理速度是很重要的一个评判指标。“
3.7 关于模型大小的相对性
🔑 “30B-A3B 体感类似于 14B Dense 模型。“(MoE 激活参数与 Dense 参数的换算经验)
3.8 关于产品 vs 模型
🔑 通义千问 / DeepSeek:“拥抱开源,有真本事,产品稀碎。” 🔑 豆包 / Kimi:“产品做得很好,底模一般 / 中等。“
4. 与本知识库其他章节的关联
4.1 API 调用与选型
- 选完模型后,如何调用 → LLM 接口规范实战:OpenAI / Response / Gemini / Anthropic 四种接口的请求格式与坑
- 选模型的决策框架 → LLM-API 选型方法论:5 维度分析 + 3 场景案例 + 提供商对比
4.2 模型架构本身
- DeepSeek 家族的架构创新 → DeepSeek.md:MLA / MoE / GRPO / R1 训练
- Dense vs MoE 的对比 → Dense与MoE架构对比.md:Qwen3-32B vs Qwen3-30B-A3B 对照实验
- 训练方法 → 模型训练技术速查.md:预训练 / SFT / RLHF / DPO / 蒸馏
4.3 本地部署相关
- 本地部署量化 → 本地部署模型量化选型.md:各种精度 + 量化方法 + 显卡架构匹配
- 显卡硬件基础 → NVIDIA显卡架构与AI算力.md:架构演进 + Tensor Core + 老黄刀法
4.4 应用工程
- Claude Code 实战 → Claude Code 实战速查.md:3 家国产模型接入 Claude Code
- 多 CLI 联动 → 多CLI联动.md:Claude / Codex / Gemini 三家协同
- 真实 toB 场景里 VL 模型选型 → 宠物CT影像AI辅助诊断方案.md:候选 Gemini 3.1 Pro / GPT-5.5 / Claude Opus 4.7 三家多模态对照测试的实战案例
- 选完模型怎么部署 → HomeLab到中小企业LLM部署架构.md:4 层部署架构 + 网关 + 监控
- 推理引擎选型 → LLM推理引擎选型.md:7 大引擎横评 + 选型决策树
5. 术语速查
| 术语 | 全称 | 含义 |
|---|---|---|
| SOTA | State of the Art | 特定领域当前最高水准,各家自称 |
| MoE | Mixture of Experts | 混合专家架构,激活参数 < 总参数 |
| Dense | Dense Model | 稠密模型,所有参数全激活 |
| VL | Vision-Language | 视觉语言模型,带图像理解 |
| Coding Agent | — | 编程智能体,能写代码 + 调用工具 |
| 御三家 | — | 行业头部三家,通常指 OpenAI/Anthropic/Google |
| 上下文 | Context Window | 模型一次能处理的最大 token 数 |
| 最大输出 | Max Output | 模型单次回答的最大 token 数 |
| 思考模型 | Thinking Model | 显式 CoT 思维链推理的模型(o1 / R1 / Gemini Thinking 等) |
| 交错思考 | Interleaved Thinking | 思考与工具调用交替进行(V3.2 / M2 等) |
| 稀疏注意力 | Sparse Attention | 不对所有 token 算 attention,降推理成本(DSA / NSA) |
| YaRN | — | 上下文外推方法,见 Dense与MoE架构对比.md |
| 蒸馏 | Distillation | 大模型教小模型,见 模型训练技术速查.md |
| Prefix Cache | 前缀缓存 | 重复前缀的 KV 缓存复用,降推理成本 |
| 暖机 | Warm-up | DeepSeek V4 经验:先把需求相关文件打入上下文,触发前缀缓存 |
| RL 训练 | Reinforcement Learning | 强化学习,DeepSeek V3/R1 大量使用 |
| 极你太美事件 | — | DeepSeek V3.1 融合思考与非思考时出现的对齐异常 |
| LMArena | — | LLM 主流排行榜,作者认为参考价值低,可被刷分 |
| A÷ | — | 作者对 Anthropic 的吐槽:模型能力天花板,服务可用性地下室 |
| Z÷ | — | 作者对智谱 ZAI 的同款吐槽 |
| 牢字辈 | — | LD 社区俚语,讽刺某厂”作茧自缚”或团队动荡 |
| 力大砖飞 | — | LD 社区俚语,形容堆参数 / 堆算力的暴力解法 |
| 养虾养马 | — | LD 社区俚语,大批量低成本任务的口语化表达 |
| QAT | Quantization-Aware Training | 量化感知训练,见 本地部署模型量化选型.md |
| MXFP4 | Microscaling FP4 | gpt-oss 使用的原生 4-bit 浮点,见 本地部署模型量化选型.md |
| One Shot | — | 一次给出最终答案,不来回迭代 |
| Vibe Coding | — | 凭感觉一句话需求 → AI 出完整工程,无需自己规划 |
| 老法师 | — | 自己设计架构 + 把 AI 当工具的资深开发者 |
6. 来源、评分与可商榷点
6.1 来源
- 原始素材:LINUX DO 社区 @flymyd 的「简单易懂的 LLM 相关知识梳理」系列
- ep.1-1 各家模型的特点-闭源篇(2026 年 1 月 4 日初稿,5 月 11 日更新)
- ep.1-2 各家模型的特点-开源篇(2026 年 1 月 4 日初稿,5 月 11 日更新)
- 整理日期:2026 年 5 月 24 日
6.2 笔者评分
| 维度 | 评分 |
|---|---|
| 信息密度 | ★★★★☆ |
| 实战经验真实性 | ★★★★★ |
| 时效性(2026 年 5 月) | ★★★★☆ |
| 可读性 | ★★★★☆(主观语气重) |
| 总分 | 8.5 / 10 |
6.3 笔记吸收策略
- ✅ 完整吸收:6 家闭源 + 10 家开源的核心特征评价
- ✅ 完整吸收:模型 ID 速查表(已按家族重组)
- ✅ 完整吸收:作者实战经验金句
- ⚠️ 标注作者梗:
A÷/Z÷/牢字辈/力大砖飞等 LD 社区俚语保留,但用引用块标注”作者原话”,并在术语速查节解释 - ✂️ 简化吸收:去掉过度娱乐化表达(原文中关于 NSFW / 瑟瑟相关描述只保留”低审查”的事实陈述,不展开)
- ✂️ 简化吸收:作者求职信息(“Base 重庆的 AI/全栈 PM 我”)已去除,与知识价值无关
6.4 作者没覆盖到的(可补充方向)
- 国产算力适配:作者没系统讲昇腾(Ascend)/ 寒武纪 / 海光等国产 GPU 跑这些模型的兼容性
- 多模态全模态(Omni):作者明说”暂不涉及音频/视频/Omni”,未来可补
- Function Calling / Tool Use 能力:各家模型的工具调用能力差异未细讲(作者 ep.6 待填坑)
- Embedding 模型:嵌入向量模型(作者 ep.7 待填坑)
- 东南亚 / 中东 / 欧洲本地化模型:Mistral 系列、Sea-LION、Falcon 等国际开源模型未覆盖
6.5 时效性提醒
⚠️ 本文模型版本截至 2026 年 5 月。LLM 行业版本变化以”周”为单位,使用具体型号前请:
- 去官网核对当前型号是否仍存在
- 上 LMArena / OpenRouter 看看最新口碑(虽然作者说”看排行榜意义不大”)
- 看 LINUX DO / r/LocalLlama / Reddit 等社区的最新体感反馈
6.6 主观色彩的提醒
作者写作风格非常 LD 社区化(吐槽 + 谐音 + 梗),阅读时请注意:
- 保留洞察:技术性判断(GPT 偏后端 / Claude 工程规划 / DeepSeek 暖机)有实战依据
- 客观对待评价:对厂商的褒贬(A÷ / Z÷ / 牢字辈)是个人体验,可能与你的体验不同
- 结合自身体感:同一个模型,做不同任务体验差异巨大;用自己的真实业务测试 优于看任何评价