DeepSeek 排名第一的 V4 Flash 在真实智能体任务中表现受阻,而其价格却持续上涨
DeepSeek 的 V4 Flash 模型因其在大模型排行榜上的强劲表现而受到开发者的广泛关注。然而,实际测试显示,该模型在处理涉及多种工具的复杂多步骤任务时存在困难。Composio 的测试表明,V4 Flash 仅完成了此类任务的 53.8%,凸显了编排相对于原始模型能力的关键作用。模型的性能因所使用的 harness 和工具配置不同而有显著差异。DeepSeek 正在提高其 V4 Flash 和 Pro 模型的价格,这一举措显著改变了其成本优势。尽管价格上涨,DeepSeek 模型仍比主要竞争对手的模型便宜得多。这一转变迫使企业更加重视性能与安全,而非单纯的成本。企业正在考虑将 DeepSeek 用于批处理等特定工作负载,其中效率至关重要。Naman Ahuja 的家庭自动化项目展示了对于执行操作的代理而言,可靠性与结构化输出的重要性。DeepSeek 在企业环境中的未来,取决于其能否在基准表现之外,证明其可靠性、安全性以及可验证的商业案例。