相同的 DeepSeek V4 Flash,不同的智能体:为... 笔记

相同的 DeepSeek V4 Flash,不同的智能体:为何运行时会影响结果

作者将 DeepSeek V4 Flash 的性能与两种不同的代码代理运行时进行了对比。本地测试表明,Codex 结合 Flash 成功完成了一项复杂的跨文件任务;相反,Claude Code 结合 Flash 启动了多次审查,但其质量尚未得到验证。这凸显了代理的有效性取决于整个运行时,而不仅仅是模型本身。运行时涵盖模型、协议、工具、上下文、恢复机制和验收标准。四个关键层影响最终结果:协议定义交互轨迹,工具作为结构化契约发挥作用,上下文与恢复机制确保任务在时间维度上的持久性,验收标准界定完成状态。DeepSeek 的公开更新表明其针对特定模型和环境进行了适配,而非追求普遍主导。作者提出,代理的有效性是模型潜力乘以运行时实现率的产物。可信的比较需要固定除模型外的所有运行时变量;否则,结果应被视为对运行时的观察,而非模型排行榜。模型设定潜力上限,而运行时决定该潜力被实现的程度。作者借此引发对当前代理使用中薄弱环节的反思。