大型语言模型与上下文完整性
第一篇文章 CIMemories 探讨了大型语言模型(LLMs)中持久记忆的上下文完整性。LLMs 越来越多地存储过往交互记录,以通过个性化提升用户体验和性能。然而,若敏感信息在不适宜的上下文中被暴露,这种持久记忆可能导致安全风险。CIMemories 基准测试旨在评估 LLMs 如何根据当前任务管理从记忆中流动的信息。该基准采用包含众多属性且任务场景各异的合成用户画像。这些场景判定某一属性在给定任务中是至关重要还是不恰当的。前沿 LLMs 表现出显著的属性级违规,违规率有时高达 69%。通常,较低的违规率会牺牲任务效用。此类违规会在多个任务和重复运行中累积。例如,GPT-5 的违规率随任务数量增加而显著上升。重复相同的提示也会导致任意且不稳定的信息泄露。即便是面向隐私的提示,也无法有效解决这一问题。该研究强调,LLMs 需要发展具备上下文感知能力的推理机制,以应对这一挑战。