提示压缩技术:如何在降低大语言模型成本的同时不丢失重要上下文 笔记

提示压缩技术:如何在降低大语言模型成本的同时不丢失重要上下文

大语言模型往往接收了超出所需的信息。提示(prompt)可能包含冗长的指令、检索到的文档、对话历史、示例以及工具描述。这会增加 token 使用量、成本及响应时间,同时也可能使模型更难识别关键细节。提示压缩在保留核心语义、指令和……的同时,对提示进行精简。