长上下文并非免费——我构建了一个安全的提示剪枝层,使大语言模... 笔记

长上下文并非免费——我构建了一个安全的提示剪枝层,使大语言模型系统得以高效运行

大语言模型(LLMs)的失败并非源于遗忘,而是源于记忆过多。随着对话的扩展,提示词中会累积大量冗余且低价值的 token,从而推高成本与延迟,并在静默中降低输出质量。本文介绍了一种确定性提示词剪枝层,可在不破坏依赖关系的前提下减少 token 用量,并辅以真实基准测试与经过生产环境验证的设计方案。