我讓三個 AI 各司其職寫程式:Codex 出測試、Grok... 笔记

我讓三個 AI 各司其職寫程式:Codex 出測試、Grok 寫實作、Claude 驗收

本实验测试了一种多智能体编码流水线,其中将单个功能分解为三个明确角色:测试生成、实现与验证。Codex 生成了测试用例和最小化存根,导致测试虽能编译但断言失败。Claude 审查这些测试用例与源代码的准确性及符号存在性。随后,Claude 将代码置于隔离环境中,以确保测试因特定原因真正失败。Grok 被 tasked 编写实现代码,使其通过失败的测试用例,同时不修改测试本身。最后,Claude 独立验证 Grok 的工作,通过运行测试、检查内存泄漏以及审查代码变更来完成。识别出的核心优势并非替代人力,而是通过在各智能体之间建立清晰的测试契约,将错误检测提前并使其更加独立。该方法不同于由单一智能体执行测试驱动开发(TDD),后者自我验证的风险更高。它也与“人工编写测试、智能体实现”的模式形成对比,后者虽更可靠,但需要显著的人力成本。实验遇到了一些具体问题,包括与 Grok 的参数不兼容,以及 Zig 构建系统细节需要手动测试发现。该流水线在严格的测试协议下被视为可行,尤其适用于具有静态类型和健全测试框架的项目。对于探索性工作或规范尚未明确的功能,则不太适用。作者得出结论:该多智能体工作流的成功取决于项目能否将测试视为具体的契约。