各家 LLM 模型特点速查:选 API 前先认人

一句话:领导让你给项目选个 LLM,你打开 OpenAI / Anthropic / Google / 阿里云百炼 / 火山方舟…屏幕前一片家族产品矩阵图,每家都说自己 SOTA。这篇是开发者视角的”识人手册”——闭源六大家族 + 开源十大家族 + 当代主力型号速查表,告诉你每家擅长什么、坑在哪、什么场景该选谁。


目录


0. 写在前面:为什么需要”按家族”了解 LLM

如果你打开任何 API 聚合平台,会看到几十甚至上百个模型 ID。光看名字根本分不清:

gpt-5.2、gpt-5.2-codex、gpt-5.2-pro、gpt-5.2-chat-latest …
claude-sonnet-4-7、claude-opus-4-7、claude-mythos …
gemini-3-pro、gemini-3-flash、gemini-2.5-flashlite …
qwen-3.6-plus、qwen-3.6-max-preview、qwen-coder-plus …
DeepSeek-V4-Pro、DeepSeek-V4-Flash …

这种命名混乱的根因:每家都搞了”大杯 / 中杯 / 小杯”+ 推理 / 编程 / 视觉 / 极速等多个变体,再叠加版本号,光看 ID 完全分不清能力档位。

正确的姿势是按家族认人:先记住 6 家闭源 + 10 家开源 = 16 个家族,各家族有自己的核心定位(GPT 偏后端 / Claude 工程规划 / Gemini 多模态),再按版本号定位具体型号。

📅 本文的时间锚点:作者原稿写于 2026 年 1 月,2026 年 5 月做了大规模更新。模型版本变化非常快,使用具体型号前请去官网核对当前是否还存在。


1. 闭源模型:六大家族

公司/机构AI 模型系列核心定位
OpenAIGPT 系列冷静的理性思考(后端理工男)
GoogleGemini 系列多模态 + 世界知识之王(文科生)
AnthropicClaude 系列最均衡的编码代理(全能选手)
xAIGrok 系列力大砖飞 + 低审查(沙雕网友)
阿里巴巴通义千问系列指令遵循强,国内 T0(工业风)
字节跳动豆包系列产品强模型一般(C 端市占率王)

1.1 OpenAI GPT:冷静的理性思考

性格画像

作者原话:“GPT-5 更像一名理工男。当然,它是一名后端理工男,在审美上未必有多好的品味。”

关键特征:

  • 📉 回复简短:GPT-5 时代起就以短回复闻名,省 output token,完成同等任务所需时间被进一步压缩
  • 🧊 冷漠到不近人情:创意写作用户因此抛弃了 GPT
  • 🤖 指哪打哪:不废话,just do it
  • 💻 写后端 / 复杂前端的好选择

主要型号定位

型号主打场景备注
gpt-5.2通用旗舰,默认 reasoning=medium中杯,新开工程 / 模块用这个
gpt-5.2-codex代理式编码专用改 bug 用 codex 变体
gpt-5.2-pro企业级最高准确度超大杯,支持 xhigh reasoning
gpt-5.2-chat-latestChatGPT 网页”即时”模式延迟最低但”很蠢”
gpt-5.1-codex-max跨多窗口连贯处理数百万 tokens项目级长时间编码任务
gpt-5.4 / gpt-5.5当前主力(截至 26.5)找回了一些”说人话”的能力

作者经验金句

💡 “改 bug 用 gpt-5.2-codex,新开工程 / 模块用 gpt-5.2。codex 更突出指哪打哪的能力,而 gpt-5.2 会主动帮你多想些。”

⚠️ “网页端给出的解决方案是自动路由(其实就是超级降智)。”

💡 “Claude 更擅长于工程规划,而 GPT 精于解决特定问题。“

选 GPT 的场景

  • ✅ 写后端逻辑或复杂前端逻辑(非 UI 美学)
  • ✅ 需要在已有架构里”修 bug、写测试、补具体功能”
  • ✅ 想要”指哪打哪”、不需要 AI 自作主张
  • ❌ 创意写作 / 角色扮演(冷漠)
  • ❌ 前端 UI 设计审美(审美一般)

1.2 Google Gemini:多模态和世界知识之王

性格画像

作者原话:“Gemini 更像一名文科生:大参数带来的丰富世界知识给了它更强的文学理解能力,思考之细腻和情感共鸣能力使得它成为创意写作的最优选。”

关键特征:

  • 🌍 超强世界知识(参数量普遍认为 1T+)
  • 🎨 前端审美顶级(Gemini 3 Pro 写出的前端效果”惊艳了所有关注 AI 前沿动向的人”)
  • 推理速度快得离谱(疑似 TPU 加持,大参数也跑得快)
  • 🎭 创意写作首选(接梗能力强到分不清是 AI 还是人)
  • 🧪 多模态王

当前痛点(26.5 更新版)

作者原话:“Gemini 目前已经成为了御三家中吊车尾的存在。”

具体问题:

  • 较强的幻觉
  • 注意力漂移(包括指令遵循能力退步)
  • 长上下文注意力崩塌式退化
  • 实际大型工程不建议使用:改崩工程 / 乱改文件

💡 优点仅剩:世界知识、VL 能力、不俗的硬智力

主要型号定位

型号主打场景备注
gemini-3-pro旗舰多模态 + 推理前端王,但长上下文幻觉严重
gemini-3-flash速度旗舰,为 Agent 设计”Flash 反杀 Pro”——大部分搬砖活够用
gemini-2.5-pro2.5 世代旗舰长文本召回能力强(实际”也一坨”)
gemini-2.5-flash-lite极致性价比目前最廉价的百万上下文模型

选 Gemini 的场景

  • ✅ 多模态任务(图像理解 / 视频)
  • ✅ 需要大量世界知识的问答
  • ✅ 创意写作 / 角色扮演 / 接梗
  • ✅ 前端 UI 设计 / 视觉效果
  • ❌ 大型工程后端(改崩工程 / 注意力漂移)
  • ❌ 严格指令遵循场景

1.3 Anthropic Claude:最均衡的编码代理模型

性格画像

作者原话:“Anthropic,又称 A÷ / A畜,大家很熟悉了,神一样的 Coding Agent,翔一样的口碑和服务可用性。”

⚠️ 作者梗: 是 LINUX DO 社区对 Anthropic 的吐槽缩写——形容”模型能力天花板,但服务可用性是地下室”。同理后文 指智谱 ZAI 也吃过类似亏。

关键特征:

  • 🛠️ 最佳编码 Agent(2026 年公认)
  • 🧠 强大的规划能力:能给出更适合工程上的方案
  • 🎯 跑分没赢过,体验没输过
  • 📊 超长上下文(Max 订阅 1M,大部分渠道 200K)

当前版本(26.5 更新)

型号主打场景备注
claude-sonnet-4-7中杯,均衡编码公认编程王
claude-opus-4-7超大杯,科研编码反重力反代优选
claude-mythos新型号
claude-4-5-haiku小杯被 Gemini Flash 系列打出 shi

作者吐槽:“Claude 4.7 系列口碑出现了倒退,主要问题在于不说人话(有一种说法是 Claude 在偷偷蒸 GPT,存疑)及注意力漂移等问题。“

关键警告

📌 官方 Max 订阅才有 1000K 上下文,大部分中转渠道 / 反重力 / Kiro 逆向都是 200K 上下文。

选 Claude 的场景

  • ✅ 闭眼 vibe coding(一句话需求 → 完整工程)
  • ✅ 前后端一把抓的项目
  • ✅ 需要 AI 主动规划架构方案
  • ❌ 服务稳定性敏感的生产场景(经常断流 / 限速)
  • ❌ 需要”严格按我说的来”(Claude 会自作主张)

💡 作者吐槽:“当前版本的 Claude 会出现一些不遵循指令坚持按照自身设计方案执行的现象,我认为这是灾难性的。“


1.4 xAI Grok:力大砖飞

性格画像

作者原话:“马斯克也许缺乏品味,但他足够有钱。Grok 好不好用先放一边,超大规模的显卡集群是实打实存在的。”

关键特征:

  • 💪 超大显卡集群 + 力大砖飞原则
  • 🦄 沙雕网友式对齐:不是”a helpful assistant”,更像 X(Twitter)网友
  • 🌐 背靠 X 语料(全自动开盒器)
  • 🔞 极低审查下限(各家 API 中,Grok / Vertex / DeepSeek 审查相对最低)
  • 🎭 创意写作 / 角色扮演 / NSFW 场景常客

当前痛点(26.5 更新)

作者原话:“如果说 Gemini 离牢字辈很近了,那么 Grok 已经是牢字辈的了。”

  • Grok 团队经过数次重大变动,无力继续训练如此大规模的模型
  • Grok 4.3 最后一舞不进反退
  • 训练算力大部分将租给 Anthropic 用来推理

主要型号

型号主打场景备注
grok-4-heavy多智能体协作推理强度最高(超大杯)
grok-4.12025 底旗舰高 EQ + 低幻觉,创意写作好
grok-4.1-fast长上下文200 万 token,类似 Gemini Flash
grok-code-fast-1编程模型体感约 Gemini 2.5 Flash 水平,但免费

💡 Grok Code Fast 是各种 Vibe Coding 客户端里常见的免费选项,质量一般但速度快,作为”备胎”很合适。

选 Grok 的场景

  • ✅ NSFW / 角色扮演(无需破甲)
  • ✅ 需要 X 平台实时搜索
  • ✅ 想要一个”沙雕网友”风格的 AI
  • ❌ 严肃的企业落地
  • ❌ 大型工程开发

1.5 阿里通义千问 闭源版

性格画像

作者原话:“通义千问的特点是极强的指令遵循能力和稀烂的产品。”

📌 注意:Qwen 家族分为开源和闭源两种。除了每代的超大杯(通义千问 Max)闭源,其他商业 API 均能找到对应的开源型号。本节只讲闭源。开源版见 § 2.2

关键特征:

  • 🎯 极强的指令遵循能力(国内 T0 选手)
  • 💼 国内企业落地友好:性价比适中、模型选择丰富、服务稳定
  • 🤖 AI 味重:回答总感觉缺了点味道,Qwen3 RL 训练后尤甚
  • ⚠️ 思考耗 Token 严重:Instruct 模型倾向于输出思维链,导致复杂任务总 Token 较高

主要型号(以闭源旗舰为代表)

型号主打场景备注
qwen-3.6-plus当前最新均衡(26.5)编程不错,可当小 Sonnet 用
qwen-3.6-max-preview超大杯阿里祖传训不明白超大杯,“用着咳嗽”
qwen3-max上一代超大杯上下文 256K,输出 64K
qwen-plus大杯,1M 上下文适合复杂任务推理
qwen-long长文本专家1000 万 token 超长输入
qwen3-coder-plus编码特化大杯1M 上下文 + 64K 输出
qwen3-vl-plus视觉大杯单图最大 16K tokens

阿里系产品矩阵

阿里在 AI 上”养蛊”严重,除百炼外还有:

  • ModelScope(魔搭):面向开发者
  • iFlow:心流团队
  • 蚂蚁灵光:面向 C 端
  • 百炼平台:商业 API 主战场

💡 作者吐槽:“乱拳打死老师傅”——Meta 的 LLaMA 系列就是被乱拳打死的。

选 Qwen 闭源的场景

  • ✅ 国内企业落地(性价比 + 服务稳定 + 指令遵循)
  • ✅ 需要发票 / 合规
  • ✅ 多模态任务(VL 系列)
  • ❌ Token 预算极紧(思维链耗 Token)
  • ❌ 需要”有人味”的创意写作

1.6 字节豆包

性格画像

作者原话:“如果你手机里需要一款不需要爬墙就很好用的 AI 应用,那我想应该是豆包没错了。但使用 LLM API?除非你的公司疯狂迷恋 Coze。”

关键特征:

  • 📱 C 端市占率遥遥领先(国内)
  • 🎬 多模态深耕(音视频)
  • 🤖 底模一直一般,但产品做得好
  • ⚠️ Seed 2.0 系列幻觉拖后腿

当前型号(26.5 更新)

型号主打场景备注
doubao-seed-2.0-pro当前旗舰T1 梯队但幻觉是短板
doubao-seed-2.0-lite-260428轻量版
doubao-seed-1-8-251215上一代大杯思维链 64K
doubao-seed-code-preview-251028编码特化

💡 作者猜测:“网传神秘流出天梯里出现的、能力接近 GPT-5.4 的模型,据说是豆包家族,Seed 团队完全有能力搞成。“

选豆包的场景

  • ✅ 国内 C 端 AI 应用(用户体验好)
  • ✅ 音视频多模态场景
  • ✅ 接入 Coze 工作流
  • ❌ 严肃企业 API 调用(底模一般 + 幻觉)

1.7 闭源模型 ID 速查表

📅 截至 2026 年 5 月,以官网为准。

OpenAI GPT

模型名称模型 ID上下文最大输出备注
GPT-5.2 Thinkinggpt-5.2400K128K最高推理强度(大杯)
GPT-5.2 Progpt-5.2-pro400K128K企业级超大杯
GPT-5.2 Chatgpt-5.2-chat-latest128K16K即时模式(小杯,很蠢)
GPT-5.2 basegpt-5.2400K128K通用旗舰中杯
GPT-5.2 Codexgpt-5.2-codex400K128K代理式编码专用
GPT-5.1 Codex Maxgpt-5.1-codex-max400K128K跨窗口压缩,百万级编码

Google Gemini

模型名称模型 ID上下文最大输出备注
Gemini 3 Progemini-3-pro1M64K旗舰多模态,前端王
Gemini 3 Flashgemini-3-flash1M64K速度旗舰,Flash 反杀 Pro
Gemini 2.5 Progemini-2.5-pro2M64K长文本召回
Gemini 2.5 Flashgemini-2.5-flash1M64K均衡版
Gemini 2.5 Flash Litegemini-2.5-flashlite1M64K最廉价的百万上下文

Anthropic Claude

模型名称模型 ID上下文最大输出备注
Claude 4.5 Opusclaude-4-5-opus-20251124200K64K超大杯(反重力优选)
Claude 4.5 Sonnetclaude-4-5-sonnet-20250929200K / 1M*64K中杯,Agent 项目级代码
Claude 4.5 Haikuclaude-4-5-haiku-20251014200K64K小杯,被 Gemini Flash 反超

* 200K vs 1M:只有官方 Max 订阅有 1M,大部分渠道(反重力 / Kiro 逆向)200K。

xAI Grok

模型名称模型 ID上下文最大输出备注
Grok 4 Heavygrok-4-heavy256K8-16K多智能体超大杯
Grok 4.1grok-4.1256K16K高 EQ + 低幻觉(大杯)
Grok 4grok-4256K8K多模态 + X 搜索
Grok 4.1 Fastgrok-4.1-fast2M16K超长上下文(中杯)
Grok 4 Fastgrok-4-fast2M30K极速 / 高性价比(小杯)
Grok Code Fast 1grok-code-fast-1256K16K免费编程模型

阿里 Qwen 闭源

模型名称模型 ID上下文最大输出备注
Qwen3 Maxqwen3-max256K64K超大杯
Qwen Plusqwen-plus1M32K大杯
Qwen Flashqwen-flash1M32K中杯
Qwen3 VL Plusqwen3-vl-plus256K32K视觉大杯
Qwen3 VL Flashqwen3-vl-flash256K32K视觉中杯
Qwen Longqwen-long10M32K长文本专家(1000 万 token)
Qwen3 Coder Plusqwen3-coder-plus1M64K编码大杯
Qwen3 Coder Flashqwen3-coder-flash1M64K编码小杯

字节豆包

模型名称模型 ID上下文最大输出备注
Doubao Seed 1.8doubao-seed-1-8-251215256K32K大杯,思维链 64K
Doubao Seed Codedoubao-seed-code-preview-251028256K32K编码特化
Doubao Seed Litedoubao-seed-1-6-lite-251015256K32K中杯
Doubao Seed Flashdoubao-seed-1-6-flash-250828256K32K小杯,视觉定位
Doubao Seed Visiondoubao-seed-1-6-vision-250815256K32K视觉中/大杯

2. 开源模型:十大家族

📌 作者原话:“如果说商业闭源领域里牢美是老大哥,那牢中就是开源赛道上的扛把子。”

国产开源已成为全球开源主力。Meta 的 LLaMA 4 表现不佳后,Reddit 的 r/LocalLlama 已经变成 r/LocalQwen 的形状

公司/机构模型系列核心定位
深度求索DeepSeek 系列开源领域试金石
阿里巴巴Qwen 开源系列模海战术 + 各尺寸全覆盖
智谱 ZAIGLM 系列编码 Agent,Z÷ 称号
月之暗面Kimi 系列1T 巨模,Claude 追赶者
MiniMaxMiniMax 系列小参数 + T1 编码
腾讯Hunyuan 系列略过(只有 A13B 还行)
小米MiMo 系列智能家居视觉特化
美团LongCat 系列难绷的名字
谷歌Gemma 系列QAT 量化感知训练优势
OpenAIgpt-oss 系列研究学习用,中国部署不适合

2.1 DeepSeek:真金不怕火炼

性格画像

作者原话:“深度求索一直在认真做事…通义千问和 DeepSeek 有相似之处——拥抱开源,有真本事,产品稀碎。”

关键特征:

  • 🏗️ 架构演进:Dense → V2/V2.5 转 MoE → V3/R1 火爆出圈 → V4 当下旗舰
  • 💸 极致性价比:开源 + 极低 API 价格,大杯模型守门员
  • 🎲 大规模 RL + 合成数据训练:能力强但对齐不够(幻觉严重 + 文风放飞)
  • 🌍 685B 参数:配上美丽价格,适合企业接入

作者评语:“无论你喜欢它还是讨厌它,它就在这。大杯模型守门员,开源领域试金石;只要在几个领域能够超越 DeepSeek,就能加冕登基,打不过 DeepSeek 就别上桌吃饭了。“

V3 / R1 时代版本演进

模型名称备注
DeepSeek-V3初代 V3,“发癫”
DeepSeek-V3-0324解决部分发癫,幻觉依旧
DeepSeek-V3.1融合思考与非思考,注意”极你太美”问题
DeepSeek-V3.1-Terminus修复极你太美
DeepSeek-V3.2启用 DSA 稀疏注意力 + 交错思考
DeepSeek-R1 / R1-0528初代 R1 系列

💡 “极你太美”事件:DeepSeek V3.1 融合思考与非思考时出现的对齐异常,模型在回答时混入鸡你太美等明显跑偏内容。同期的 Qwen3 因此把融合思考拆开了

V4 时代(26.5 更新)

模型上下文参数备注
DeepSeek-V4-Pro1M1.6T-A49B编程介于 Opus 和 Sonnet 之间,角色扮演强,缓存命中率超高
DeepSeek-V4-Flash1M284B-A13BMiniMax 上位替代,把 MiniMax 打傻了
DeepSeek-V4-Vision灰度中推测 V4-Flash 底座

作者关键观察(对老法师):“V4-Pro 在部分场景可以和 Opus 掰手腕,大部分场景因缺乏工程能力只有 Sonnet 水平。V4 家族强上下文注意力 + 弱工程思维——需要先暖机再用(把需求相关文件尽可能先打入上下文,反正有前缀缓存)。“

选 DeepSeek 的场景

  • ✅ 企业接入需要”性价比 + 大参数 + 开源”(可私有化)
  • ✅ 角色扮演 / 创意写作(V4-Pro 强项)
  • ✅ 长上下文场景(1M)
  • ❌ 严格对齐场景(幻觉 + 文风放飞)
  • ❌ 需要复杂工程规划(暖机弥补部分)

2.2 阿里 Qwen 开源系列:乱拳打死老师傅

性格画像

作者原话:“阿里从 Qwen 2.5 开始彻底发力,和当时风头正盛的 LLaMA 分庭抗礼。”

关键特征:

  • 🎪 模海战术:0.6B → 235B 各尺寸全覆盖,Dense + MoE 都有
  • 🎯 指令遵循能力强(开发者友好)
  • 🎨 Qwen3-VL 系列:结束了”国模无视觉大将”的时代
  • 🛠️ Hugging Face 仓库工具齐全:微调 / 私有化 / 套皮一应俱全
  • ⚠️ Qwen 3.5 后训练有问题,3.6 修复了

作者评语:“端上来的太多力,求求你饶了我吧”——选择困难症患者警告。

Qwen3 系列(2507 版本)

💡 如果有 2507 变体,代指 2507 而非 2504 版本(2504 被钉上了耻辱柱)。

模型名备注
Qwen3-235B-A22B-ThinkingMoE 思考模式,推理强(很耗 Token!)
Qwen3-235B-A22B-InstructMoE 指令版,有输出思维链倾向
Qwen3-30B-A3B-Thinking激活 3B 核显也能跑,推理飞快
Qwen3-30B-A3B-Instruct同上,指令版
Qwen3-32BDense,性能强于 30B-A3B,但不适合端侧
Qwen3-14BDense,家用显卡爽玩门槛
Qwen3-8B / 4B / 1.7B / 0.6B依次小型化,4B 起视为端侧推理

Qwen3-VL 系列

模型名备注
Qwen3-VL-235B-A22B-Thinking/InstructMoE 视觉,开源视觉模的神
Qwen3-VL-30B-A3B-InstructMoE 推理飞快,也是神
Qwen3-VL-32B-InstructDense 视觉,较少使用
Qwen3-VL-8B/4B/2B-InstructDense,端侧适用

Qwen3-Coder & Qwen3-Next

模型名备注
Qwen3-Coder-480B-A35B-InstructQwen Coder CLI 提供免费,但烧 Token,被 GLM/MiniMax 反超
Qwen3-Coder-30B-A3B-Instruct国企/军工码农优选,易本地部署
Qwen3-Next-80B-A3B-Instruct门控注意力稀疏模型,80B 总参 + 3B 激活,本地推理飞快
Qwen3-Next-80B-A3B-Thinking同上思考版

Qwen 3.5 / 3.6(26.5 最新)

📅 作者更新:“跑了跑了,Junyang Lin 带着 Qwen 3.6 跑了!Qwen 3.5 系列可能是 Qwen 家族开源矩阵的最后一舞,Qwen 3.6 只有 35B-A3B 和 27B 两个尺寸了。“

模型名备注
Qwen3.6-35B-A3B对应百炼 Qwen3.6-Flash,养虾/养马优选
Qwen3.6-27B不错的本地 Coding/Agent 模型
Qwen3.5-397B-A17B对应百炼 Qwen3.5-Plus
Qwen3.5-122B-A10B本地 Coding/Agent,知识丰富
Qwen3.5-35B-A3B对应百炼 Qwen3.5-Flash
Qwen3.5-27BDense,智力密度高
Qwen3.5-9B/4B/2B/0.8B研究用

选 Qwen 开源的场景

  • ✅ 各尺寸需求都能满足(从核显 1.7B 到 GPU 集群 235B)
  • ✅ 国企 / 军工本地部署(Qwen3-Coder-30B-A3B)
  • ✅ 视觉任务(Qwen3-VL 系列,神)
  • ✅ 需要丰富 HuggingFace 生态工具

2.3 智谱 GLM:从六小龙到四小虎

性格画像

作者原话:“前身是 THUDM,属于从 LLaMA 时代一路走过来的老将了。当年本地部署最早能讲明白中文的就是 chatglm-6b,给人留下了深刻印象。”

关键特征:

  • 📜 老将:从 ChatGLM-6B 起就在做中文 LLM
  • 🛠️ Coding Agent 路线:从 GLM-4.5 起一路高歌猛进,国产小 Claude
  • 🐢 服务质量痛点:推理速度慢、有降智、官方调整 Coding Plan
  • 🏷️ 作者称号:——和 Anthropic 的 A÷ 并列,因服务可用性问题获此”殊荣”

⚠️ 作者吐槽:“由于推理速度过慢、服务有时不稳定、官方调整 Coding Plan 等问题存在,ZAI 荣获 Z÷ 称号,与 Anthropic 占了一头一尾。“

主要型号

模型名参数备注
GLM-4.5358B-A32B梦开始的地方
GLM-4.5-Air106B-A12B中小企业部署优选,四张 4090 美美跑量化版
GLM-4.5V同 Air带视觉,上下文受限
GLM-4.6进一步增强
GLM-4.6V视觉版
GLM-4.7支持交错思考的旗舰
GLM-5744B-A40B国产小 Claude,能力介于 Sonnet 和 Opus 之间
GLM-5.1进一步增强代码能力

选 GLM 的场景

  • ✅ 国内写代码不能用国外模型时(GLM-5/5.1 替代 Claude)
  • ✅ RAG 场景(GLM-4 系列稳定低幻觉)
  • ✅ 中小企业本地部署(GLM-4.5-Air)
  • ❌ 实时性敏感(推理慢)
  • ❌ 服务可用性要求高(Z÷ 问题)

2.4 MiniMax:小参数大智慧

性格画像

作者原话:“跟智谱真是一对苦命鸳鸯,在港股赛跑上市,最终智谱领先一天。MiniMax 在学习 Claude 的路上更加激进。”

关键特征:

  • 💎 激进的 Claude 跟随者
  • 🐎 230B 参数掰手腕 GLM 358B:激活参数小,推理速度优势显著
  • 🎬 音视频合成性价比高,海外业务好
  • ⚠️ M2.5 / M2.7 在增强 Agent 后部分领域退步

主要型号

模型名参数备注
MiniMax-M2230B-A10B编码 T1 梯队
MiniMax-M2.1同上进一步增强代码
MiniMax-M2.5增强工程思维 + Agent
MiniMax-M2.7强化外部工具调用

💡 作者关键观察:“在实际工作中 one shot 是很难的,很多时候都需要手动测试然后提出问题再尝试修复 BUG 才能得到最终满意的结果,所以推理速度是很重要的一个评判指标。“

选 MiniMax 的场景

  • ✅ 需要快速迭代的编码任务(推理速度优势)
  • ✅ 中小参数 + T1 能力的平衡
  • ✅ 音视频合成(海外业务)
  • ✅ “养虾养马”(俗称大批量低成本任务)

2.5 月之暗面 Kimi:1T 巨模震撼

性格画像

作者原话:“美国有基米(GPT),中国有 Kimi!”

💡 作者梗:“基米”是 LD 社区对 Google Gemini 的爱称(“基”是 Gemini 首音节)。原句模仿 NBA “美国有科比,中国有易建联”的梗。

关键特征:

  • 🐘 1T 巨模:震撼所有人眼球,有没有比 DeepSeek 更适合编码的 DeepSeek?有的,Kimi K2
  • 🧠 大参数泛化能力强:情感细腻,冷门编码场景也能解决
  • 🌐 网页比 API 好用:搜索 + 深度研究是少数几个值得用网页的厂
  • 💰 缺点:1T 计算成本高,性价比和推理速度不如 MiniMax / GLM

主要型号

模型名备注
Kimi-K2-Instruct1T 巨模,不带思考
Kimi-K2-Instruct-0905进一步增强代码
Kimi-K2-Thinking思考版
Kimi-K2.5融合思考 + 视觉,K2 完全体,1T+视觉 → 前端飞跃
Kimi-K2.6例行提升,比 GLM-5.1 略强

选 Kimi 的场景

  • ✅ 网络搜索 + 深度研究(网页端王)
  • ✅ 需要 1T 大参数泛化的冷门编码场景
  • ✅ 前端开发(K2.5 + 视觉)
  • ❌ 性价比敏感(1T 成本高)
  • ❌ 推理速度敏感

2.6 腾讯 Hunyuan:略过

作者原话:“腾讯和字节有点像的是,都在音视频媒体/多模态方向发力。但腾讯的 LLM…就此略过。”

唯一值得提一下:Hunyuan-A13B 在 80B 这个档可以和 Qwen 掰手腕。混元的 3D 一直做得不错。


2.7 小米 MiMo:互联网厂赶晚集

作者原话:“如果小米进场,那么这个时机一定已经成熟。”

关键特征:

  • 👩‍🔬 罗福莉加入后,MiMo 家族露峥嵘
  • 🏠 MiMo-VL-Miloco-7B:在 MiMo-VL 上再训练,智能家居视觉特化,小尺寸保证私有化部署
  • 🚀 MiMo-V2-Flash:309B-A15B MoE,前 DeepSeek 研究员归来挑战老东家
  • 💰 当前 MiMo V2 处于免费阶段,免费就是免费

💡 作者期待:“我更希望看到的是 MiMo 在 Agent 结合米厂的各种智能硬件的落地探索,现在 AI 成功落地转化的场景太少了。“

模型名备注
Xiaomi-MiMo-VL-Miloco-7B智能家居视觉特化
MiMo-V2-Flash编码 & Agent 模型

2.8 美团 LongCat:难绷的名字

作者原话:“龙猫?长猫?这个名字有点难绷。”

  • LongCat-Flash:虽叫 Flash,实际是 560B-A27B 大模
  • 美团也在音视频发力,有生图 + 视频模型
  • 黏着 Qwen 贴身搏斗
  • 平平无奇,价格不如 MiMo Flash 实惠(5 元输出 vs MiMo 2.1 元)

2.9 OpenAI gpt-oss 与 谷歌 Gemma:海外开源代表

gpt-oss(秀肌肉式开源)

作者原话:“命里缺啥,名字里就得起啥,所以 OpenAI 不 Open 也非常合理。“

模型名备注
gpt-oss-20b原生 MXFP4,小而快,日常任务还挺好用
gpt-oss-120b一坨,强烈不推荐,LiveCodeBench 上 20b 反杀 120b(120b 幻觉太高)

作者评语:“在 Antigravity 里和 Claude 4.5 Opus 并列有一种’我和科比合砍 83 分’的美感。”

启发:稀疏注意力、原生 MXFP4、思考中调用工具——适合研究学习,不适合中国应用部署(自我审查 + 高幻觉)。

Gemma 3(谷歌的国外社区选项)

关键特征:

  • 📦 QAT 量化感知训练权重:量化到低精度时保持较好性能(对 HomeLab 玩家友好)
  • 👁️ Gemma 3 27B Dense 带视觉,某些场景可与 Qwen3-VL 掰手腕
  • 🏥 多变体:medgemma(医疗)、t5gemma、gemma-3n 等
模型名备注
gemma-3-1b-it / 4b-it / 12b-it / 27b-it主力家族,各尺寸全覆盖

💡 HomeLab 选型决策:Gemma 3 还是 Qwen 3? 如果你想在家部署性能尚可且带视觉的大模型,这是核心选择题。Gemma 优势:QAT 量化更友好。Qwen 优势:中文 + 国内生态。


2.10 开源模型 ID 速查表

📅 截至 2026 年 5 月,以 Hugging Face 仓库为准。版本变化非常快,本表只列代表性型号。

(具体型号见上面各家族小节,这里只列家族对应关系)

家族代表当前旗舰适用场景
DeepSeekV4-Pro / V4-Flash企业接入,极致性价比
QwenQwen3.5/3.6 全尺寸任意尺寸 + 中文 + 视觉
GLMGLM-5 / 5.1国产小 Claude,Coding Agent
MiniMaxM2.7推理速度优势 + 编码 T1
KimiK2.5 / K2.61T 大参数 + 网络搜索
MiMoMiMo-V2-FlashAgent + 智能硬件
LongCatLongCat-Flash(作者评:平平无奇)
Gemmagemma-3-27b-it国外开源 + QAT 友好
gpt-ossgpt-oss-20b研究学习,不适合中国部署

3. 选型经验:作者的核心金句

💎 这些是从原文中提炼出的核心方法论,适合贴在工位上。

3.1 关于排行榜与 SOTA

🔑 “现在看排行榜的意义已经几乎没有了,重要的还是看这个模型能不能解决你所处的领域/工程的实际问题。“

3.2 关于编程之王

🔑 “在编程领域里似乎一直是 Claude 和 GPT 在争大哥与二弟的位置。Claude 更擅长于工程规划,而 GPT 精于解决特定问题。“

3.3 关于 GPT codex 用法

🔑 “改 bug 用 gpt-5.2-codex,新开工程 / 模块用 gpt-5.2。codex 更突出指哪打哪,而 gpt-5.2 会主动帮你多想些。“

3.4 关于 Claude 的自作主张

🔑 “当前版本的 Claude 会出现一些不遵循指令坚持按照自身设计方案执行的现象,我认为这是灾难性的。如果你是闭眼 vibe coding 的选手,那么 Claude 绝对是不二之选。“

3.5 关于 DeepSeek 的工程能力

🔑 “V4 家族强上下文注意力 + 弱工程思维——需要先暖机再用(把需求相关文件尽可能先打入上下文,反正有前缀缓存)。“

3.6 关于推理速度的重要性

🔑 “在实际工作中 one shot 是很难的,很多时候都需要手动测试然后提出问题再尝试修复 BUG 才能得到最终满意的结果,所以推理速度是很重要的一个评判指标。“

3.7 关于模型大小的相对性

🔑 “30B-A3B 体感类似于 14B Dense 模型。“(MoE 激活参数与 Dense 参数的换算经验)

3.8 关于产品 vs 模型

🔑 通义千问 / DeepSeek:“拥抱开源,有真本事,产品稀碎。” 🔑 豆包 / Kimi:“产品做得很好,底模一般 / 中等。“


4. 与本知识库其他章节的关联

4.1 API 调用与选型

  • 选完模型后,如何调用 → LLM 接口规范实战:OpenAI / Response / Gemini / Anthropic 四种接口的请求格式与坑
  • 选模型的决策框架 → LLM-API 选型方法论:5 维度分析 + 3 场景案例 + 提供商对比

4.2 模型架构本身

4.3 本地部署相关

4.4 应用工程


5. 术语速查

术语全称含义
SOTAState of the Art特定领域当前最高水准,各家自称
MoEMixture of Experts混合专家架构,激活参数 < 总参数
DenseDense Model稠密模型,所有参数全激活
VLVision-Language视觉语言模型,带图像理解
Coding Agent编程智能体,能写代码 + 调用工具
御三家行业头部三家,通常指 OpenAI/Anthropic/Google
上下文Context Window模型一次能处理的最大 token 数
最大输出Max Output模型单次回答的最大 token 数
思考模型Thinking Model显式 CoT 思维链推理的模型(o1 / R1 / Gemini Thinking 等)
交错思考Interleaved Thinking思考与工具调用交替进行(V3.2 / M2 等)
稀疏注意力Sparse Attention不对所有 token 算 attention,降推理成本(DSA / NSA)
YaRN上下文外推方法,见 Dense与MoE架构对比.md
蒸馏Distillation大模型教小模型,见 模型训练技术速查.md
Prefix Cache前缀缓存重复前缀的 KV 缓存复用,降推理成本
暖机Warm-upDeepSeek V4 经验:先把需求相关文件打入上下文,触发前缀缓存
RL 训练Reinforcement Learning强化学习,DeepSeek V3/R1 大量使用
极你太美事件DeepSeek V3.1 融合思考与非思考时出现的对齐异常
LMArenaLLM 主流排行榜,作者认为参考价值低,可被刷分
作者对 Anthropic 的吐槽:模型能力天花板,服务可用性地下室
作者对智谱 ZAI 的同款吐槽
牢字辈LD 社区俚语,讽刺某厂”作茧自缚”或团队动荡
力大砖飞LD 社区俚语,形容堆参数 / 堆算力的暴力解法
养虾养马LD 社区俚语,大批量低成本任务的口语化表达
QATQuantization-Aware Training量化感知训练,见 本地部署模型量化选型.md
MXFP4Microscaling FP4gpt-oss 使用的原生 4-bit 浮点,见 本地部署模型量化选型.md
One Shot一次给出最终答案,不来回迭代
Vibe Coding凭感觉一句话需求 → AI 出完整工程,无需自己规划
老法师自己设计架构 + 把 AI 当工具的资深开发者

6. 来源、评分与可商榷点

6.1 来源

  • 原始素材:LINUX DO 社区 @flymyd 的「简单易懂的 LLM 相关知识梳理」系列
    • ep.1-1 各家模型的特点-闭源篇(2026 年 1 月 4 日初稿,5 月 11 日更新)
    • ep.1-2 各家模型的特点-开源篇(2026 年 1 月 4 日初稿,5 月 11 日更新)
  • 整理日期:2026 年 5 月 24 日

6.2 笔者评分

维度评分
信息密度★★★★☆
实战经验真实性★★★★★
时效性(2026 年 5 月)★★★★☆
可读性★★★★☆(主观语气重)
总分8.5 / 10

6.3 笔记吸收策略

  • 完整吸收:6 家闭源 + 10 家开源的核心特征评价
  • 完整吸收:模型 ID 速查表(已按家族重组)
  • 完整吸收:作者实战经验金句
  • ⚠️ 标注作者梗: / / 牢字辈 / 力大砖飞 等 LD 社区俚语保留,但用引用块标注”作者原话”,并在术语速查节解释
  • ✂️ 简化吸收:去掉过度娱乐化表达(原文中关于 NSFW / 瑟瑟相关描述只保留”低审查”的事实陈述,不展开)
  • ✂️ 简化吸收:作者求职信息(“Base 重庆的 AI/全栈 PM 我”)已去除,与知识价值无关

6.4 作者没覆盖到的(可补充方向)

  1. 国产算力适配:作者没系统讲昇腾(Ascend)/ 寒武纪 / 海光等国产 GPU 跑这些模型的兼容性
  2. 多模态全模态(Omni):作者明说”暂不涉及音频/视频/Omni”,未来可补
  3. Function Calling / Tool Use 能力:各家模型的工具调用能力差异未细讲(作者 ep.6 待填坑)
  4. Embedding 模型:嵌入向量模型(作者 ep.7 待填坑)
  5. 东南亚 / 中东 / 欧洲本地化模型:Mistral 系列、Sea-LION、Falcon 等国际开源模型未覆盖

6.5 时效性提醒

⚠️ 本文模型版本截至 2026 年 5 月。LLM 行业版本变化以”周”为单位,使用具体型号前请:

  1. 去官网核对当前型号是否仍存在
  2. LMArena / OpenRouter 看看最新口碑(虽然作者说”看排行榜意义不大”)
  3. 看 LINUX DO / r/LocalLlama / Reddit 等社区的最新体感反馈

6.6 主观色彩的提醒

作者写作风格非常 LD 社区化(吐槽 + 谐音 + 梗),阅读时请注意:

  • 保留洞察:技术性判断(GPT 偏后端 / Claude 工程规划 / DeepSeek 暖机)有实战依据
  • 客观对待评价:对厂商的褒贬(A÷ / Z÷ / 牢字辈)是个人体验,可能与你的体验不同
  • 结合自身体感:同一个模型,做不同任务体验差异巨大;用自己的真实业务测试 优于看任何评价