Qwen3.8-Max 以大胆宣称登场:其在智能体计算机使用方面优于 GPT-5.6 Sol Max 和 Fable 5。
阿里巴巴通义团队发布了 Qwen3.8-Max,这是一个拥有 2.4 万亿参数的多模态大语言模型。该新模型旨在在自主软件工程以及复杂、长周期的企业任务中表现出色。初步基准测试表明,Qwen3.8-Max 在关键智能体计算评估中超越了领先的专有模型,如 GPT-5.6 Sol Max 和 Fable 5。据报道,该模型在 OSWorld-Verified、PaperBench 以及其他软件工程与多模态推理基准测试中取得了高分。一项重要的战略举措是,阿里巴巴计划于下周开放 Qwen3.8-Max 和 Qwen3.8-27B 的权重。这将首次使 Max 级别的通义模型可用于自托管部署,有望改变企业采用模式。然而,这些开放权重的许可条款尚未披露,导致对潜在限制存在不确定性。基础模型的竞争格局日益专业化,各公司聚焦于不同的优势领域。Qwen3.8-Max 力求整合众多此类能力,将自己定位为执行长期项目的自主协作者。其性能表现凸显了一个趋势:前沿模型正通过工作流完成度而非单一提示响应进行评估。随发布一同推出的基准测试套件强调长周期执行能力,Qwen3.8-Max 在 OSWorld 和 PaperBench 中展现出领先地位。尽管未在所有类别中占据主导,但其提供了广泛且均衡的性能表现,对企业具有吸引力。其潜在优势在于长期运行的软件工程、计算机操作智能体、研究自动化以及多模态工业工作流。Qwen3.8-Max 的 API 定价也具有竞争力,低于美国主要专有服务的报价。然而,其开放权重发布的最终影响,取决于阿里巴巴所实施的具体许可条款。