提示缓存无法在第一次调用时节省成本 笔记

提示缓存无法在第一次调用时节省成本

我寻找一种清晰的方式来展示提示缓存实际上为智能体节省了多少,而首先发现的一个事实是:如果你只关注‘高达 90% 的节省’这一标题,很容易忽略它。缓存首次对话的第一轮所花费的成本,高于不缓存该轮的成本。此时尚无可读取的缓存,因此你需要为内容支付输入费用,并额外承担 25% 的写入缓存溢价,却一无所获。节省效果从第二轮开始显现,前提是已有内容可供读取。该功能在 deepagents 中的位置Deep Agents 在其默认中间件栈中集成了来自 langchain-anthropic 的 AnthropicPromptCachingMiddleware。它并非通过猜测来决定缓存内容,而是在每次模型调用中精确标记两项内容: