Qwen 3.8-Max 与 Claude Opus 5 表... 笔记

Qwen 3.8-Max 与 Claude Opus 5 表明,原始基准分数无法预测实际账单。

Alibaba 推出的新模型 Qwen 3.8-Max 呈现出相互冲突的性能结果:Alibaba 宣称其仅次于 Claude Fable 5,而独立基准测试则将其置于中游。这种差异源于测试中使用的 token 预算和时间预算不同。Alibaba 的基准测试采用了显著更长的超时时间,从而获得了更高的分数。文章认为,每 token 价格不足以作为评估推理模型的有效指标。相反,文章提出采用“单次成功任务成本”(cost per successful task)指标,该指标将全部支出(包括失败尝试)除以成功完成的任务数。这种方法能更真实地反映模型的效率与成本。此外,文章强调失败率深受配置设置的影响,尤其是时间或 token 预算。基准测试往往无法区分 outright 错误答案与因超时而失败的任务,预算耗尽是失败的主要原因。文章建议必须更清晰地报告失败原因。作者主张将时间或 token 预算明确列为验收标准,而非隐藏细节。这对于构建高效的代理系统至关重要,因为仅优化速度而忽视成功率会导致成本增加和结果不佳。已有若干组织开始采用“单次成功任务成本”指标。为改进模型评估,建议分别输出失败原因、按努力级别计算单次成功任务成本,并在非关键延迟场景下以 token 数量而非墙钟时间(wall clock time)为上限。最后,建议检查已部署模型的默认努力级别设置,因为更高的努力设置并不总能带来更好的结果。
CdXz5zHNQW_gokBEm64di.png