大模型API的计费逻辑是按Token算钱,但输入和输出单价不同,长上下文场景会加价,还有隐藏费用如峰值并发附加费、失败重试消耗和日志存储费。单次请求成本 = 输入Token数 × 输入单价 + 输出Token数 × 输出单价。月总成本还需考虑日均请求量、平均单次成本及缓存命中率修正系数。

举例:年预算20万,日均10万次请求,用GPT-4o mini(输入每百万Token 0.15美元,输出0.6美元),每次输入500 Token、输出200 Token,单次成本约0.0002美元,月成本约600美元。但未优化时,峰值并发和长上下文场景可能让成本翻倍。

主流平台定价差异:OpenAI输入输出价差大,长上下文模型价格约两倍,批量API可打五折但需最小批次;Anthropic的Claude输入输出价接近,但上下文缓存按Token分钟计费;Google Gemini的128K上下文输入价非线性增长;国内平台提供免费额度,试用后按量扣费。

不费劲就能见效果:零成本优化三板斧

第一招:压缩Prompt。减少Few-shot示例(留1-2个最代表性的),固化系统消息指令,用JSON Schema代替自然语言描述输出格式,用Stop序列控制截断(如只需“是/否”时设置停止符)。压缩后需做A/B测试,随机抽500条请求,输出一致率变化控制在2%以内即可。

第二招:控制输出长度。多数任务输出不超过512 Token,设置Max Tokens为实际需求值,配合Stop序列,平均输出Token可再降20%到40%。

第三招:缓存系统消息和示例。将不变的提示作为缓存前缀合并到第一个请求,后续只带变化部分。部分平台支持system_fingerprint利用内置缓存。

缓存:省钱利器,但用不好可能烧钱

缓存命中率是关键。当完全相同输入比例超30%或语义相似请求占比超50%时,值得建缓存。分为三级:

  • 简单KV缓存:针对完全相同的请求,直接返回历史结果。适合FAQ、模板化内容生成。

  • 语义缓存:基于向量相似度匹配,推荐阈值从0.85开始调。阈值过高降低命中率,过低可能导致语义漂移,需定期抽检。

  • 会话级缓存:同一会话中缓存前文编码结果,降低长上下文预填充成本,多轮对话场景效果显著。

缓存风险:TTL策略需谨慎。固定过期时间可能返回过时信息,动态TTL可根据请求频率自动调整。数据隐私要求可能迫使使用私有缓存,增加运维成本。

模型路由:别让小任务用旗舰

按任务复杂度分类:简单问答、摘要、分类等低难度请求路由到小模型(如GPT-4o mini、Claude 3 Haiku),复杂推理、代码生成等用旗舰。路由决策可用规则匹配(输入长度、关键词)或微调轻量分类器将请求分3-5个等级。

实测显示:简单问答场景小模型精度损失低于2%,代码生成可能损失10%-15%。建议建立精度损失参考表:客服标准回复损失1%以下可全路由;技术文档生成损失3%-5%可混合路由(80%小模型+20%旗舰抽检);专业代码审查损失超10%保留旗舰。

若小模型不够用可考虑微调。月调用量超100万次时,微调通常2-3个月回本。蒸馏则用大模型输出训练更小的学生模型,适合持续大规模场景。

用时间换折扣:批量与异步

批量API通常优惠40%-50%,但需满足最小批次(如OpenAI要求100条)且处理时间分钟到小时级。实时交互不适合,但数据后处理、夜间分析等延迟容忍场景可充分利用。若能容忍延迟超5秒,用批量;否则走单条请求配合缓存和路由。批量失败重试建议配置“部分成功即返回失败项”,避免浪费未失败请求的Token。

监控、告警与止损

设三级阈值:警告线(日预算70%):通知提醒;降级线(90%):自动切换旗舰为小模型或限流非关键请求;熔断线(100%):拒绝所有非核心请求,仅保留健康检查。自动化降级可通过API Gateway配合函数计算实现。监控还需关注缓存命中率变化和响应时间异常。

财务视角:从年度预算到合约谈判

年调用量超千万次可谈预留实例或预付费折扣,通常再省10%-20%。注意免费额度政策,手动关闭自动续费。综合投资回报估算:原始年预算20万,零成本优化省20%→16万,加缓存(命中率40%)→10万,模型路由(60%请求转小模型)→6万,批量API(剩余80%走批量)→4万。整体月省50%以上,但各步收益因业务而异,需用真实数据找到瓶颈。

优化没有银弹。按优先级推进:先零成本优化,再建缓存,接着模型路由,最后批量异步放大收益。财务谈判作为补充,持续监控迭代——最终目标是让每一笔API调用都产生匹配其成本的价值。