SpaceXAI 推出 Grok 4.6,超越 Kimi K3 的性能,并与 GPT-5.6 Sol 并列,成为人工智能分析领域全球第三最佳。
SpaceXAI 已推出 Grok 4.6,其最新人工智能模型,专注于长运行代理、编程与知识型工作。该新模型相较于前代 Grok 4.5 展现出显著改进。Grok 4.6 在第三方基准测试中取得具有竞争力的分数,与 OpenAI 的 GPT-5.6 Sol Max 持平,并在代理与编程任务上实现大幅提升。尽管表现优异,但在所有评估中并未全面超越顶级模型如 Claude Opus 5 和 Fable 5。Grok 4.6 的一个关键方面是其定价策略,旨在为这些高需求工作负载提供成本效益。API 定价从每百万输入令牌 2 美元和每百万输出令牌 6 美元起,相较于其他领先模型处于中等价位。SpaceXAI 强调 Grok 4.6 在长时间操作中维持上下文与任务专注度的增强能力,这通过扩展训练数据及在代理环境中的强化学习实现。该模型还展现出更强的自我测试与验证能力。然而,智能与任务成本分析表明,按任务计算,其经济性可能不如某些前代产品或竞争对手。企业需谨慎考量长上下文的定价,因为超过 20 万个提示令牌后费率显著上升。除技术性能与成本之外,Grok 品牌因过往在安全性、偏见及滥用方面的争议而背负显著包袱。这些历史问题可能影响企业采用,无论 Grok 4.6 在能力与定价上如何改进。