LLM-API 选型方法论:在预算内选对模型
一句话:某个普通的清晨,你在工位上吃着早餐,领导突然把你叫进会议室——“公司决定了!用 AI 赋能 XX 业务,blabla… 预算只有 XXX”。然后你打开 API 列表,300+ 模型,价格从 0 到 60 美元 / M tokens 不等,瞬间懵了。这篇是把”模糊业务需求”变成”具体技术指标”再变成”最优解”的方法论指南。
目录
- 0. 一个让人窒息的真实场景
- 1. 五维度分析框架
- 2. 三个典型场景案例
- 3. 三大方法论
- 4. 选型三问(决策框架)
- 5. API 提供商速查表
- 6. 与本知识库其他章节的关联
- 7. 术语速查
- 8. 来源、评分与可商榷点
0. 一个让人窒息的真实场景
💼 改编自原文:在一个普通的清晨,你在工位上吃着早餐,突然你的领导叫你去会议室,等你再出来时已经是彻底无语。“公司决定了!我们要用 AI 赋能 XX 业务…但预算只有 XXX。”
这种”模糊业务 + 紧预算”的甲方需求,在 LLM 应用落地中是 常态。
如何把它转化成”具体的 API 选型决策”?先把需求拆成 5 个维度,再按场景套方法论。
1. 五维度分析框架
拿到任何 LLM 应用需求,先按这 5 个维度过一遍:
| 维度 | 关键问题 | 影响 |
|---|---|---|
| 模型能力 | 它的能力是否足以支撑我的业务?会不会经常返回不想要的结果? | 决定项目能不能跑通 |
| 推理速度 | 在保证能力的前提下能多快?换提供商会不会更好? | 决定用户体验 |
| 服务稳定性 | 单一来源的可用性要求高吗?能不能 fallback 到其他模型/平台? | 决定生产事故频率 |
| 价格 | 预算够不够?Token 成本能扛吗? | 决定项目能不能持续 |
| 合规性 | 业务是国内还是海外?对数据落地、报销有要求吗? | 决定能不能用 / 能不能报销 |
💡 五维不是平等的——业务性质决定了哪个维度的权重最高。下面三个场景就是不同维度优先级的展示。
2. 三个典型场景案例
2.1 场景 1:toB / toG 展厅 AI 语音对话
业务画像:展厅里的迎宾 AI 终端,游客对着设备说话,设备语音回答。
需求拆解
| 维度 | 优先级 | 拆解 |
|---|---|---|
| 推理速度 | 🔥🔥🔥🔥🔥 | 高实时性 — 用小模型(提推理速度,对模型能力要求不高),且服务位于国内进一步降低时延 |
| 服务稳定性 | 🔥🔥🔥🔥🔥 | 高可用性 — 展厅里设备掉链子非常尴尬,避开高负载平台(热门但算力储备不足的) |
| 价格 | 🔥🔥 | toB / toG 对价格不见得敏感,且选小模型本就便宜 |
| 合规性 | 🔥🔥🔥🔥🔥 | 必须能开发票,所以要选 国内正规平台 |
| 模型能力 | 🔥🔥 | 听懂指令 + 给出回应就够,不需要复杂推理 |
推荐方案
- 提供商:阿里云百炼 / 火山方舟(国内大厂,卡多,稳定,能开发票)
- 模型:Qwen-Flash / 豆包 Lite(中小杯,推理快)
- fallback:同一提供商的备份模型,而非跨提供商(避免增加架构复杂度)
2.2 场景 2:toC 个人情感陪伴助手
业务画像:猫系女友 / 男友 AI,用户付费订阅,核心卖点是”沉浸感”。
需求拆解
| 维度 | 优先级 | 拆解 |
|---|---|---|
| 模型能力 | 🔥🔥🔥🔥🔥 | 能力先行 — “你也不想猫系女友几下就被提示词钓成柔情猫娘吧?” |
| 价格 | 🔥🔥 | 只要东西做好了,总会有人愿意为此付费 |
| 服务稳定性 | 🔥🔥🔥🔥 | Roleplay 时报个错太出戏了,可能因为几次错误痛失付费用户 |
| 推理速度 | 🔥🔥 | “最终能成功返回就行。你年少时的那个女神 / 男神不也经常不回你?” |
| 合规性 | 🔥🔥🔥 | 取决于: 个人 / 小团队?— 国外平台 Gemini 可能更好;正经公司项目?— 必须报销 → 国内 |
推荐方案
- 个人/小团队:Google Vertex(Gemini Pro,创意写作王 + 低审查 + 速度有保证)/ Anthropic Claude(沉浸感)
- 正经公司:Qwen-Max / DeepSeek-V4-Pro(国内合规 + 大参数 + 角色扮演)
2.3 场景 3:个人创业 / 随手糊项目
业务画像:自己的 side project,自负盈亏,先活下去再说。
需求拆解
| 维度 | 优先级 | 拆解 |
|---|---|---|
| 价格 | 🔥🔥🔥🔥🔥 | 便宜,便宜,还是 TM 要便宜! 反正自负盈亏,哪家便宜用哪家 |
| 模型能力 | 🔥🔥🔥🔥 | 要打点宽裕的量 — 个人项目缺乏商业项目的千锤百炼,测试少。更强的模型带来的溢价可以通过白嫖手段抹平 |
| 实时性 & 可用性 | 🔥🔥 | 起步阶段有些问题是可以忍受的,“服务炸了、输出崩了、速度太慢了给用户磕个得了” |
| 合规性 | 🔥 | “自己搞的东西不犯法啥都好说,数据落地合规性基本都是企业才考虑的事” |
推荐方案
- API 主力:OpenRouter(聚合,什么模型都有)+ 白嫖逆向中转站 + 多组 fallback
- 作者吐槽:“什么白嫖逆向中转站全安排上,fallback 多写几组。”
- 架构原则:多 fallback,自动降级,服务炸了切到备胎
3. 三大方法论
3.1 没有银弹,不要迷信 SOTA(不可能三角)
在实际落地中,模型也有不可能三角:
速度高
╱╲
╱ ╲
╱ ╲
╱ ╲
╱ ╲
╱──────────╲
质量好 成本低
三个角不可能同时占满。也许 Gemini 3 Flash 做到了三角内点,但对中国业务来说,还要加一个”合规性”维度——直接变四角不可能形(不可能四角)。
🔑 作者金句:“没有银弹,不要迷信 SOTA。”
具体怎么平衡?看场景:
- 场景 1 追求 极致响应 → 模型参数不能太大
- 场景 2 追求 极致智能 → 较高 Token 价格 + 较慢推理可接受
- 场景 3 追求 极致成本 → 先把项目最难熬的起步阶段度过
3.2 业务决定技术选型
技术再强也得为业务服务,最终的选择必须紧贴业务的生命周期和应用性质。
| 业务类型 | 核心诉求 | 选型导向 |
|---|---|---|
| toB / toG | 稳定压倒一切 | 够稳定 + 够合规 + 能开发票 + 不胡说八道。合同都签了你还要怎么样? |
| toC | 用户体验 | 用户只为体验付费,没有那么多愿意从起步陪你走到最后的神仙用户。模型能力不够 = 没核心竞争力 |
| 实验性业务 | 活下去 | 别的都可以工程上弥补,初创阶段最不值钱的就是人力 |
3.3 够用就是最好
🔑 作者金句:“对于展厅项目来说,听得懂指令并且能做出回应就是够用。对于个人项目来说,能跑就行。”
划一条红线,这是业务及格线。在这条线之上选择最适合你的方案就够了,不要盲目追求最强的 API,这毫无意义,不要掉入过度优化的陷阱。
反例:杀鸡用牛刀
假如做一个网页小游戏,模型只需要输出 True 和 False,选个 Thinking 大模有意义吗?用户早就等急了。
✅ 正确做法:gpt-5-nano / qwen-flash / gemini-2.5-flash-lite 这类廉价小模就够。
反例 2:展厅 AI 接 Claude Opus
需求:“游客你好,本展厅展示 XX 项目”。Claude Opus 杀鸡用牛刀,而且 Anthropic 服务可用性差(作者称 A÷),反复断流让你前台尴尬到死。
✅ 正确做法:Qwen-Flash / 豆包 Lite 等国内中小杯模型。
4. 选型三问(决策框架)
🔑 作者总结:“选 API 的过程本质上是把业务需求转换为技术指标,再在预算范围内寻找最优解的过程。”
在做方案前,先问自己三个问题:
┌─────────────────────────────────────┐
│ Q1:我的用户是谁? │
│ ↓ │
│ 决定:合规性 + 稳定性要求 │
└─────────────────────────────────────┘
↓
┌─────────────────────────────────────┐
│ Q2:他们最在乎什么? │
│ ↓ │
│ 决定:选强智能模型 还是 快速模型│
└─────────────────────────────────────┘
↓
┌─────────────────────────────────────┐
│ Q3:我的预算是? │
│ ↓ │
│ 决定:架构容错率 + 备选方案 │
└─────────────────────────────────────┘
↓
得出最优选型
5. API 提供商速查表
📅 截至 2026 年 5 月,以官网为准。国内监管 / 海外服务变化频繁,使用前请确认。
5.1 国内提供商
| 提供商 | 价格 | 速度/可用性 | 备注 |
|---|---|---|---|
| 阿里云百炼 | 便宜 | 较快 | 国内毫无疑问的老大哥,卡多模型多,提供通义全家桶。对公可以谈折扣,9 折到 5 折不等 |
| 硅基流动 | 便宜 | 较快 | ”祖国版 OpenRouter”,提供国内开源模型的推理服务,老牌。黑历史:DeepSeek 狂潮期间被冲爆,现在好很多 |
| 火山方舟 | 一般 | 较快 | 主要值得买自家豆包系列,开源模型的服务稳定性也很好,卡多就是任性 |
| 腾讯混元 | 一般 | 较快 | 混元用的人比较少,目前没被流量冲爆的黑历史。如果你的云服务器在腾讯云,可能是好选择 |
| 百度千帆 | 便宜 | 一般 | ”千帆在 LLM 服务上也就只有开源大模型推理值得一看了,该不会真有人花钱买文心吧?” |
| 华为云 MaaS | ? | ? | 提供开源模型推理,看起来平平无奇。但有神秘昇腾高奢定制服务,toG 项目可能合适 |
| 七牛云 | 一般 | 一般 | 比硅基流动多提供了一些国内闭源模型 + 甚至 Grok Code Fast |
| DeepSeek 官方 | 便宜 | 一般 | ”最好用的 DeepSeek 肯定不在 DeepSeek 平台上,但官价很便宜”。可用性 / 速度较差(小厂的卡都拉去训练了) |
| 月之暗面 | 一般 | 一般 | 1T 巨模快不起来,K2-Turbo 会快很多但贵不少(“迪士尼优速通”) |
| MiniMax | 便宜 | 较快 | 小模就是自信,用户多也不会出现显著降级。主要适合写代码 |
| 智谱 AI | 便宜 | 差 | ”GLM 本来就没多少卡,用户还特别多,推理速度饱受诟病,之前还有降智节奏。推荐去其他平台,反正是开放权重” |
| 小米 MiMo | 便宜 | 较快 | MiMo Flash 用户相对少,官价不贵,目前看起来还行 |
💡 国内选型常见决策:
- 需要发票 / 合规 → 阿里云百炼 / 火山方舟 / 腾讯混元
- 跑开源模型最便宜 → 硅基流动 / 火山方舟
- 跑 DeepSeek 官价最便宜但慢 → 去其他平台找 DeepSeek
- 跑 GLM → 别用智谱官方,去硅基 / OpenRouter
5.2 国外提供商
| 提供商 | 价格 | 速度/可用性 | 备注 |
|---|---|---|---|
| OpenRouter | 便宜~贵都有 | 视提供商而定,万金油 | 最大的聚合 API 平台,什么模型都有。口碑很好。注意:提供商对开源模型可能注水(参考 K2-Vendor-Verifier 工具) |
| Cerebras | 贵 | 断崖式领先 | 超大晶片,大力出奇迹,神秘推理速度宛如外星科技。主推 SOTA 开源模型 |
| Hugging Face | 便宜~贵都有 | 与 OpenRouter 类似 | HF 也做了聚合服务,类似 OpenRouter |
| Google Vertex | 适中 | 快(大部分时间) | Gemini 一手货源,企业服务审查力度很低,速度也有保证。前几个月有截断问题,总体可用性远强于 OAI 和 A÷。Vertex 也提供 Claude |
| OpenAI | 适中 | 一般 | GPT 一手货源,速度较慢,可用性一般 |
| Anthropic | 适中 | 差 | Claude 一手货源,但服务可用性非常感人(作者称 A÷) |
| Amazon Bedrock | 适中 | 较快 | 提供 Amazon Nova、Claude、一些开源模型 |
| Azure AI Foundry | 适中 | 较快 | 提供 GPT、Claude、一些开源模型 |
💡 国外选型常见决策:
- 想要 Gemini 又怕官方审查 → Google Vertex(企业服务,低审查)
- 想要 Claude 但怕断流 → Amazon Bedrock / Azure AI Foundry(企业版可用性好)
- 万金油 → OpenRouter(注意提供商注水)
- 极致推理速度 → Cerebras(贵)
5.3 聚合 / 中转平台
⚠️ 注意:适合不需要开发票、不要求数据合规的场景。正经企业不建议用中转。
- OpenRouter:国外最大聚合,口碑好
- Hugging Face Inference:国外聚合,与 OpenRouter 类似
- 七牛云:国内,提供国外闭源模型(Grok Code Fast 等)
- 各种白嫖逆向:个人项目可用,生产环境不要用(随时挂)
6. 与本知识库其他章节的关联
6.1 选完 API 之后
- 调用代码怎么写 → LLM 接口规范实战:4 种接口规范 + 常见坑
- 各家模型选哪个 → 各家 LLM 模型特点速查:16 个家族的核心定位 + 模型 ID 表
6.2 与本地部署的关系
- 不用 API,要自己部署 → 本地部署模型量化选型:硬件 + 量化方案匹配
- 硬件基础 → NVIDIA 显卡架构与 AI 算力
6.3 与工程实践的关系
- 上下文 + Token 计费 → 上下文窗口与 Token 计费
- 多 CLI 协同 → 多 CLI 联动:3 家协同的策略
- Claude Code 接入国产 → Claude Code 实战速查:配置 3 家国产模型 API
6.4 与 Agent 工程的关系
6.5 真实业务场景案例
- toB 医疗场景的完整 API 选型 + 方案:宠物CT影像AI辅助诊断方案.md——4000 份 DICOM + 3 个月 SaaS MVP,展示了”高合规 + 高准确率 + 中等延迟”的真实业务约束如何落地
- 多次调用集成的成本评估:Medprompt方法论解析.md——20 次集成意味着 API 成本 × 20,但准确率显著提升;本框架”价格”维度的实战补充
- 自建 vs API 的盈亏平衡分析:HomeLab到中小企业LLM部署架构.md § 9——月调用量阈值决定自建还是 API
7. 术语速查
| 术语 | 全称 | 含义 |
|---|---|---|
| toB | to Business | 面向企业客户的业务 |
| toG | to Government | 面向政府客户的业务,通常合规要求最严 |
| toC | to Consumer | 面向终端消费者的业务 |
| SOTA | State of the Art | 当前最优(自称),作者认为”参考价值已低” |
| Token | — | LLM 计费单位,中文约 1.5 token/字 |
| Fallback | 兜底 | 主模型失败时自动切换备用模型 |
| TPM | Tokens Per Minute | API 限速:每分钟 Token 数 |
| RPM | Requests Per Minute | API 限速:每分钟请求数 |
| 不可能三角 | Iron Triangle | 速度 / 质量 / 成本三选二 |
| 不可能四角 | — | 在中国语境下加”合规性”后变成四角不可能形 |
| MaaS | Model as a Service | 模型即服务(华为云、阿里云 MaaS) |
| 中转 | Proxy | 代理模型 API 的服务,通常更便宜但合规风险 |
| 反向 / 逆向 | Reverse | 通过逆向工程获取免费访问(灰色) |
| 一手货源 | First-party | 模型作者本家提供的官方 API |
| 降智 | — | 网页端 ChatGPT 等”自动路由”到弱模型,体感变笨 |
| 优速通 | Fast Pass | 迪士尼乐园术语,这里指 K2-Turbo 等”加钱换速度”的产品 |
| 养虾养马 | — | LD 社区俚语,大批量低成本任务的口语化表达(比如批量内容生成、数据清洗) |
| 暖机 | Warm-up | 把需求相关文件预先打入上下文,触发前缀缓存,专属于 DeepSeek V4 的经验 |
8. 来源、评分与可商榷点
8.1 来源
- 原始素材:LINUX DO 社区 @flymyd 的「简单易懂的 LLM 相关知识梳理」系列
- ep.2-1 如何选择模型 - API 篇(2026 年 1 月 5 日)
- 整理日期:2026 年 5 月 24 日
8.2 笔者评分
| 维度 | 评分 |
|---|---|
| 方法论清晰度 | ★★★★★ |
| 场景案例真实性 | ★★★★★ |
| 实用性 | ★★★★★ |
| 时效性 | ★★★★☆(2026.1 写的,5 月有更新但部分提供商动态难追) |
| 总分 | 9 / 10 |
8.3 笔记吸收策略
- ✅ 完整吸收:5 维度分析框架 + 3 场景案例 + 3 大方法论(不可能三角、业务决定技术、够用就好)
- ✅ 完整吸收:作者的”选型三问”(用户是谁 / 在乎什么 / 预算多少)— 这是核心干货
- ✅ 完整吸收:18 家 API 提供商对比表
- ⚠️ 标注作者梗:A÷ / Z÷ / 中转 / 白嫖逆向等用引用块标注,保留洞察
- ✂️ 简化吸收:作者求职信息已去除
8.4 作者没覆盖到的(可补充方向)
- 数据安全 / 出境合规:涉及个人数据 / 医疗数据 / 金融数据时,跨境 API 调用有 GDPR / 中国《个人信息保护法》/ 数据出境安全评估等问题,远比”能不能开发票”复杂
- 私有化部署 vs API 的决策边界:作者本文专讲 API,但很多场景”API 不通”或”必须私有化”,这个决策点未深讲(对应作者待填坑的 ep.2-2)
- 行业垂直场景:医疗(需 HIPAA / 国内医疗数据本地化)、金融(需符合人行 / 银保监要求)、政务(需信创要求,必须用昇腾 / 海光)— 这些场景的额外约束未涵盖
- Function Calling 能力差异:不同 API 提供商的 Function Call / Tool Use 实现差异,会显著影响 Agent 应用选型
- 多模态 API 的统一性问题:文本生成已基本标准化,但图片输入、视频输入、语音输入、视频输出等各家差异巨大,合规问题更复杂
- 流量峰值预估 / 弹性:对于初创业务,用户量从 0 到 100 万的扩展能力 也是关键。例如:Anthropic 的 quota 不容易扩,阿里云容易扩
- 审计 / 日志要求:金融 / 医疗 / 政务需要 API 调用全量审计日志,部分提供商不支持
8.5 国内提供商动态变化提醒
⚠️ 截至 2026 年 5 月,国内市场动态变化非常快:
- 降价潮:DeepSeek V4 Pro 上线后引发新一轮降价潮
- 资源调整:智谱 / MiniMax 等”小龙”在上市后服务质量可能变化
- 新平台:小米 MiMo / 美团 LongCat 等新入场厂商定价策略可能持续调整
- 昇腾 950 上市:作者提及”下半年昇腾 950 上市后,定价有望进一步下调”
使用本表前请去官网核对最新定价。
8.6 主观色彩的提醒
作者写作风格非常 LD 社区化(吐槽 + 谐音 + 梗),阅读时请注意:
- 保留洞察:5 维度框架 / 3 大方法论是经典且经得起推敲的
- 客观对待评价:对厂商的褒贬(A÷ / Z÷ / “牢字辈”)是个人体验
- 结合自身业务:同一个场景,你的业务约束和作者不同(比如你的客户更看重合规,或者你的预算更紧);用作者的方法论框架,自己跑一遍 5 维度分析,得出适合你的结论