동일한 DeepSeek V4 Flash, 다른 에이전트... 노트

동일한 DeepSeek V4 Flash, 다른 에이전트: 런타임이 결과를 바꾸는 이유

저자는 DeepSeek V4 Flash의 성능을 두 가지 다른 코드 에이전트 런타임과 대조합니다. 로컬 테스트에서는 Codex와 Flash가 복잡한 파일 간 작업을 성공적으로 완료했습니다. 반대로 Claude Code와 Flash는 여러 검토를 시작했지만 품질은 검증되지 않았습니다. 이는 에이전트의 효과성이 모델뿐만 아니라 전체 런타임에 달려 있음을 강조합니다. 런타임은 모델, 프로토콜, 도구, 컨텍스트, 복구 메커니즘 및 수락 기준을 포함합니다. 네 가지 핵심 계층이 결과에 영향을 미칩니다. 프로토콜은 상호 작용 궤적을 정의하고, 도구는 구조화된 계약 역할을 하며, 컨텍스트와 복구는 시간 경과에 따른 작업 내구성을 보장하고, 수락은 완료 상태를 정의합니다. DeepSeek의 공개 업데이트는 보편적인 지배력이 아닌 특정 모델 및 환경에 대한 적응을 시사합니다. 저자는 에이전트 효과성이 모델 잠재력에 하네스의 실현율을 곱한 결과라고 제안합니다. 신뢰할 수 있는 비교를 위해서는 모델을 제외한 모든 런타임 변수를 고정해야 합니다. 그렇지 않으면 결과는 모델 순위표가 아닌 런타임 관찰로 간주되어야 합니다. 모델은 잠재력을 설정하지만 런타임은 그 잠재력의 얼마만큼이 실현되는지를 결정합니다. 저자는 현재 에이전트 사용에서 가장 약한 고리에 대한 성찰을 촉구합니다.