AI 成本可观测性:token 预算、缓存和任务画像
整理 AI 应用成本治理的基础做法:记录 token、任务类型、缓存命中和异常请求。
AI 成本不是月底账单才该关心。每一次请求的输入长度、输出长度、模型选择、缓存命中和工具调用,都会影响成本。OpenAI prompt caching 和模型文档提供了理解成本结构的入口,LangSmith 可观测资料则适合记录运行链路。[cost-001][cost-002][cost-003]
先按任务画像统计
不要只看总 token。更有用的是按任务分组:
- 搜索问答。
- 长文总结。
- 结构化抽取。
- 代码审查。
- 后台批处理。
成本优化先从“谁花得最多”开始,而不是盲目缩短所有 prompt。
概念日志:
{
"task": "rag_answer",
"input_tokens": 3200,
"output_tokens": 420,
"cache_hit": true
}优化顺序
- 删除无效上下文。
- 固定可缓存前缀。
- 给简单任务换轻量模型。
- 批量任务异步处理。
- 对异常长请求加上限。
综合这些资料可以推断:AI 成本治理是一套观测和路由问题,不只是选择便宜模型。
参考资料
- [cost-001] OpenAI Developers, “Prompt caching”, https://developers.openai.com/api/docs/guides/prompt-caching
- [cost-002] OpenAI Developers, “Models”, https://developers.openai.com/api/docs/models
- [cost-003] LangSmith Docs, “Observability”, https://docs.langchain.com/langsmith/observability