DEV Community 日本語
フォロー
Claudeにコードの脳を与えた。今回はテストにそれを判断させた。
この実験では、Claude Code がメモリレイヤーを備えた実際のリポジトリタスクを実行する能力をテストしました。回答の正確性に焦点を当てた以前のテストとは異なり、この実験ではエージェントがファイルを変更し、決定的なチェックに合格する必要がありました。RE-call メモリシステムを備えた Claude Code は 58.3% の成功率を達成し、Claude Code 単体 (50.0%) および CLAUDE.md のベースライン (36.1%) を大幅に上回りました。RE-call システムの改善は、プロジェクト固有のメモリに敏感なタスクで最も顕著でした。興味深いことに、静的な CLAUDE.md ファイルは、ベア構成よりもパフォーマンスが悪く、静的な指示がノイズを導入する可能性を示唆しています。RE-call は、単にトークンを追加するのではなく、必要なときにのみ関連するコンテキストを取得することで、その有用性を実証しました。メモリレイヤーは、ほとんどの対象となるセッションで参照され、有用なコンテキストを提供しました。RE-call はトークン使用量とコストを増加させましたが、古い情報による高額な失敗を防ぐことを目的としていました。この実験では、GPT-5.3 Codex の運用上の制限にも遭遇し、決定的な比較ができませんでした。最終的に、これは、本番環境のメモリレイヤーが、重要なプロジェクト固有のコンテキストを取得することにより、実際のリポジトリタスクにおけるエージェントの成功率を向上させることができることを検証しました。今後の作業では、効率と精度のためのメモリ取得の最適化に焦点を当てます。