AI 推理成本优化:模型路由/缓存/压缩的实战数字
B 方向·OPC 最佳实践(COGS 执行层)。on-device-ai-app-opportunities 提了「模型路由+缓存」原则、indie-pricing-models 定了「混合计价防穿仓」——本篇把实战数字补齐。
背景与问题
生产环境的 LLM 成本优化各手段能省多少?组合拳怎么排?
发现(生产实证数字,访问 2026-09-14)
- 组合拳总量:caching+batching+routing 全开时生产团队报告 60-80% 账单削减(GMI Cloud);多数团队组合后省 50-70%(PremAI)。
- 单手段数字:模型路由(简单查询走小模型)省 40-75%;语义缓存命中时省 50-90%(命中率 25-35% 常态);prompt 压缩/上下文压缩省 50-70% token;输出 token 上限(Morph 五杠杆、Kalvium、Mavik Labs)。
- 推荐堆叠顺序:①模型路由(40-60%)→②prompt caching(重复 token 省 50-90%)→③输出上限→④批处理(非实时任务)(Tokonomics)。
推测(映射到本产品线)
- 防诈判断:可疑话术库比对是高重复查询——语义缓存命中潜力大(话术库有限集合);「新话术」才走大模型。
- 见守对话:每日确认是固定流程 → IVR 模板(零 token);AI 对话周 2-3 次(japan-ai-welfare-call 混合架构)已是最强压缩。
- 回忆录整理:批次化(夜间批处理非实时)+ 小模型初稿/大模型终稿双段路由。
结论
可行动启发:
- 堆叠顺序执行:路由(默认便宜模型+贵模型白名单触发)→ 话术库语义缓存 → 输出上限 → 夜间批处理——按此顺序每步测质量衰减,不一次全开。
- COGS 表加「缓存命中率」指标(opc-finance-dashboard):命中率 <20% 说明查询太散(产品/话术库该收敛),>40% 说明 COGS 优化到位。
- 「贵模型白名单」写进产品规则:哪些触发走大模型(新话术模式/成书章节生成),白名单外的升级请求拒绝——防止单用户烧穿(indie-pricing-models 的 credits 上限的技术执行件)。
- 模型换代复测节奏:季季用固定测试集重跑「便宜模型能否接住」——模型降价/能力提升是持续的外部红利(on-device-ai-app-opportunities 的端侧演进同理),COGS 只会越测越低。
待办 / 下次继续
关联
- 执行层服务 indie-pricing-models(COGS 假设)、on-device-ai-app-opportunities(路由原则)、japan-ai-welfare-call(混合架构)、opc-family-graph-schema(无直接关系但同属技术层)。