RSS DEV 커뮤니티
팔로우
我讓三個 AI 各司其職寫程式:Codex 出測試、Grok 寫實作、Claude 驗收
이 실험은 단일 기능을 테스트 생성, 구현, 검증의 세 가지 고유한 역할로 분해하는 멀티 에이전트 코딩 파이프라인을 테스트합니다. Codex는 처음에 컴파일은 되지만 어설션에 실패하는 테스트와 최소한의 스텁을 생성했습니다. Claude는 정확성과 심볼 존재 여부를 확인하기 위해 소스 코드와 대조하여 이러한 테스트를 검토했습니다. Claude는 테스트가 특정 이유로 실제로 실패하는지 확인하기 위해 코드를 격리된 환경에 배치했습니다. Grok은 테스트 자체를 변경하지 않고 실패하는 테스트를 통과하도록 구현을 작성하는 임무를 맡았습니다. 마지막으로 Claude는 테스트를 실행하고 메모리 누수를 확인하며 코드 변경 사항을 검토하여 Grok의 작업을 독립적으로 검증했습니다. 확인된 핵심 이점은 인간의 노력을 대체하는 것이 아니라 명확한 테스트 계약을 에이전트 간에 생성하여 오류 탐지를 더 일찍 전환하고 더 독립적으로 만드는 것입니다. 이 접근 방식은 단일 에이전트가 TDD를 수행하는 것과 다르며, 자체 검증 위험이 더 높습니다. 또한 인간이 작성한 테스트와 에이전트 구현과도 대조되는데, 이는 더 안정적이지만 상당한 인간 비용이 필요합니다. 이 실험에서는 Grok과의 매개변수 비호환성 및 수동 테스트 검색이 필요한 Zig 빌드 시스템 세부 정보와 같은 특정 문제가 발생했습니다. 이 파이프라인은 엄격한 테스트 프로토콜 하에서, 특히 정적 타이핑과 강력한 테스트 프레임워크를 갖춘 프로젝트에 대해 실행 가능한 것으로 간주됩니다. 사양이 아직 정의되지 않은 탐색적 작업이나 기능에는 덜 적합합니다. 저자는 이 멀티 에이전트 워크플로우의 성공이 프로젝트가 테스트를 구체적인 계약으로 취급할 수 있는지 여부에 달려 있다고 결론짓습니다.