LLM 服务中的四个缓存 笔记

LLM 服务中的四个缓存

随着大语言模型应用日益复杂,推理成本与延迟变得愈发关键。单个请求可能包含数千甚至数百万个 token,涵盖系统指令、对话历史、检索文档、工具定义及用户输入。反复处理相同信息既浪费算力也消耗时间。缓存有助于避免此类重复工作。但……