返回文章列表

AI 成本可观测性:token 预算、缓存和任务画像

整理 AI 应用成本治理的基础做法:记录 token、任务类型、缓存命中和异常请求。

AI 成本不是月底账单才该关心。每一次请求的输入长度、输出长度、模型选择、缓存命中和工具调用,都会影响成本。OpenAI prompt caching 和模型文档提供了理解成本结构的入口,LangSmith 可观测资料则适合记录运行链路。[cost-001][cost-002][cost-003]

先按任务画像统计

不要只看总 token。更有用的是按任务分组:

  • 搜索问答。
  • 长文总结。
  • 结构化抽取。
  • 代码审查。
  • 后台批处理。

成本优化先从“谁花得最多”开始,而不是盲目缩短所有 prompt。

概念日志:

{
  "task": "rag_answer",
  "input_tokens": 3200,
  "output_tokens": 420,
  "cache_hit": true
}

优化顺序

  1. 删除无效上下文。
  2. 固定可缓存前缀。
  3. 给简单任务换轻量模型。
  4. 批量任务异步处理。
  5. 对异常长请求加上限。

综合这些资料可以推断:AI 成本治理是一套观测和路由问题,不只是选择便宜模型。

参考资料

  1. [cost-001] OpenAI Developers, “Prompt caching”, https://developers.openai.com/api/docs/guides/prompt-caching
  2. [cost-002] OpenAI Developers, “Models”, https://developers.openai.com/api/docs/models
  3. [cost-003] LangSmith Docs, “Observability”, https://docs.langchain.com/langsmith/observability