我给 Claude Code 装上了大脑。这一次,让测试来评... 笔记

我给 Claude Code 装上了大脑。这一次,让测试来评判它。

本实验测试了 Claude Code 在具备记忆层的情况下执行真实仓库任务的能力。与以往侧重于答案正确性的测试不同,本实验要求代理修改文件并通过确定性检查。配备 RE-call 记忆系统的 Claude Code 取得了 58.3% 的成功率,显著优于无记忆层的 Claude Code(50.0%)及其自身的 CLAUDE.md 基线(36.1%)。RE-call 系统的提升在那些对特定项目记忆敏感的任务中尤为明显。有趣的是,静态的 CLAUDE.md 文件表现甚至不如无配置版本,这表明静态指令可能会引入噪声。RE-call 通过仅在需要时检索相关上下文来证明其效用,而非简单地增加 token 数量。记忆层在大多数符合条件的会话中被咨询,并提供了有用的上下文。尽管 RE-call 增加了 token 使用量和成本,但其目标是防止因过时信息导致的昂贵失败。实验还遇到了 GPT-5.3 Codex 的操作限制,阻碍了确切的对比。最终,本实验验证了生产级记忆层可以通过检索关键的项目特定上下文,提高代理在真实仓库任务中的成功率。未来的工作将专注于优化记忆检索的效率与准确性。