同样的预算,为什么有人能多买好几倍 AI 能力?秘密就在 Harness —— 在请求到达模型之前,自动完成缓存匹配与上下文复用。命中率越高,省得越多。
每一次调用,都会先过 Harness 这一关。
模型假设:命中时 prompt 按 1 折计费、completion 直接复用(零费用)。命中率越高,等效倍率越高。
提示:聊天机器人、客服、批量相似问答等场景,命中率普遍可达 70%–95%。
| 缓存命中率 | 效率倍率 | 每 $1,000 支出等效价值 | 每月省下 |
|---|---|---|---|
| 0%(关闭 Harness) | 1.00× | $1,000 | $0 |
| 50% | 2.00× | $2,000 | $1,000 |
| 80% | 3.33× | $3,333 | $2,333 |
| 100%(满命中) | 5.00× | $5,000 | $4,000 |
* 以上为示意性测算,用于直观说明缓存复用的费效比;实际倍率取决于你的流量结构、模型与上下文长度。配置真实上游后可在 Playground 实时观察。