新模型刚上线,单价未必更贵,账单却常常先涨起来。原因很现实:团队会把它拿去跑更长上下文、更复杂推理、更多工具调用,试错量也会变大。OpenAI 的 GPT-5.6 Sol 公开价格是每百万输入 token 4 美元、输出 20 美元,超过 272K 输入 token 还会按更高档计费;Anthropic 的 Claude Fable 5.1 是 10/50 美元,Thinking 默认开启;Google 的 Gemini 3.8 Flash 目前还是 0.75/3 美元的阶段价,但它会为了更难的任务主动拆步、调用工具、反复校验。单看标价,很难看出真实成本。
真正把账单推高的,往往是几件小事叠在一起:上下文越塞越大,缓存命中率下降,重试次数上升,输出上限放得过宽,工具循环又把 token 继续吃掉。新版本模型一换,旧的缓存策略、prompt 模板、函数调用参数都可能失配。对企业来说,这些变化比“单价涨了多少”更伤。
企业怎么降成本
降本不是一味找便宜模型,而是把任务分层。轻任务交给 Flash、Flash Lite、DeepSeek、Qwen、Kimi 这类高吞吐模型;代码审查、Agent 编排、长链路推理,再切到 GPT-5.6、Claude Opus 5 或 Claude Fable 5.1。把“全量最强”改成“按场景路由”,账单通常会明显收敛。现在的 DeepSeek API 兼容 OpenAI 和 Anthropic 格式,1M 上下文、缓存默认开启;Kimi API 也兼容 OpenAI/Anthropic,Kimi K3 支持 1M token,上下文缓存页直接写明,固定长上下文场景最高可降本 90%;GLM-5.3 是 1M 上下文、128K 输出,且思考默认开启;MiniMax-M3 也是 1M 上下文,面向 Agent、代码和长文档任务。
海外模型和国内模型的差别,已经不只是语言风格。海外模型更适合英文写作、复杂推理和成熟开发生态;国内模型在中文语义、支付、地域部署、企业合规上更顺手。阿里云百炼的 Qwen 模型价格页 已经把全球、美国、欧盟、日本等地域拆成不同计费层,这类差异对跨境团队尤其现实。选型时别只看能力榜,也要看地域、账单口径和接口兼容性。
接口稳定性也别只看宣传页。Anthropic 的 rate limits 会把 Fable 5.x、Opus 5、Sonnet 5 分开;DeepSeek、Kimi、GLM、百炼也都把模型版本、地域、套餐拆得很细。生产环境要把限流、超时、数据保留、版本锁定、降级策略一起设计好。429 不能靠无限重试,长文档不要一把塞满,固定知识库优先缓存,真的需要检索的内容再走 RAG。该省的 token 省掉,该贵的请求留给高能力模型。
如果团队已经同时用 OpenAI API、Claude API、Gemini API、Qwen API、DeepSeek API、Kimi API、GLM API、MiniMax,最省事的办法是把统一鉴权、用量监控、模型切换和失败兜底收进一层。像 Code0 这样的 AI API 聚合平台,适合把多模型接入、账单控制和接口排查放到同一个入口里,研发不用为每家厂商重复适配。
新模型出来后,最该升级的不是“追新”的冲动,是企业自己的路由和预算体系。能切模型,能看账单,能降级,才算真正把大模型 API 用稳了。