Skip to main content

成本优化

成本优化的核心不是单纯“少调用”,而是用更合适的模型与请求结构完成任务。

如何降低 API 调用成本?

最有效的做法通常包括:
  • 为不同任务选择合适的模型,而不是所有请求都使用高成本模型
  • 控制输入长度,减少不必要的上下文
  • 设置合理的输出上限,避免过长响应
  • 对重复请求引入缓存
  • 减少无意义的失败重试和循环请求

如何选择更合适的模型?

一个简单原则是:
  • 简单分类、改写、提取类任务,优先尝试更轻量模型
  • 高质量生成、复杂推理、多模态任务,再考虑更强模型
这能显著降低长期调用成本。

为什么 token 控制很重要?

许多成本问题并不来自请求次数,而来自:
  • 输入上下文过长
  • 输出无上限
  • 重复附带大量历史消息
因此建议:
  • 定期清理无关上下文
  • 根据业务场景设置 max_tokens
  • 对固定格式输出尽量使用更短的提示词和更明确的格式约束

缓存可以优化哪些场景?

缓存最适合这些情况:
  • 相同或高度相似的问题重复出现
  • 配置类、说明类、帮助类回答重复率高
  • 页面摘要、标签提取、固定模板生成等结果可复用

为什么要关注失败重试?

如果系统出现:
  • 超时后无上限自动重试
  • 同一请求在多个服务中重复发送
  • 失败后仍保留高成本模型策略
那么成本会快速放大。 建议同时监控:
  • 重试次数
  • 失败率
  • 平均输入长度
  • 平均输出长度
  • 各模型占比

一个实用的优化顺序

  1. 先看模型选择是否过重
  2. 再看上下文是否过长
  3. 再看输出是否超出业务需要
  4. 最后看缓存和重试策略
通常只做前两步,就能带来最明显的成本改善。