저는 Claude Code에 뇌를 부여했습니다. 이번에는 테스트가 그것을 판단하게 했습니다.
이 실험은 메모리 계층을 갖춘 실제 저장소 작업을 수행하는 Claude Code의 능력을 테스트했습니다. 답변 정확성에 초점을 맞춘 이전 테스트와 달리, 이 실험에서는 에이전트가 파일을 수정하고 결정론적 검사를 통과해야 했습니다. RE-call 메모리 시스템을 갖춘 Claude Code는 58.3%의 성공률을 달성하여, 단순 Claude Code의 50.0%와 자체 CLAUDE.md 기준선의 36.1%를 크게 능가했습니다. RE-call 시스템의 개선은 프로젝트별 메모리에 민감한 작업에서 가장 두드러졌습니다. 흥미롭게도, 정적 CLAUDE.md 파일은 단순 구성보다 성능이 떨어졌는데, 이는 정적 지침이 노이즈를 유발할 수 있음을 시사합니다. RE-call은 단순히 더 많은 토큰을 추가하는 대신 필요할 때만 관련 컨텍스트를 검색함으로써 유용성을 입증했습니다. 메모리 계층은 대부분의 적격 세션에서 참조되었으며 유용한 컨텍스트를 제공했습니다. RE-call은 토큰 사용량과 비용을 증가시켰지만, 오래된 정보로 인한 값비싼 실패를 방지하는 것을 목표로 했습니다. 이 실험은 또한 GPT-5.3 Codex의 운영상의 한계에 직면하여 결정적인 비교를 방해했습니다. 궁극적으로, 이는 프로덕션 메모리 계층이 중요한 프로젝트별 컨텍스트를 검색함으로써 실제 저장소 작업에서 에이전트의 성공률을 향상시킬 수 있음을 검증했습니다. 향후 작업은 효율성과 정확성을 위해 메모리 검색을 최적화하는 데 중점을 둘 것입니다.