基础设施与计算:企业为追求速度而采购 AI 算力,却在成本方... 笔记

基础设施与计算:企业为追求速度而采购 AI 算力,却在成本方面盲目行事。

AI 基础设施已在三分之二的企业中投入运营,其中十分之三的企业已实现大规模工作负载运行。然而,与此基础设施相关的成本追踪能力并未同步提升。在采购决策中,性能与 GPU 可用性已超越总体拥有成本(TCO)成为首要考量,而可靠性也优先于价格作为成功指标。对于面临生产压力的团队而言,这一转变可以理解,但也凸显出一个显著问题:不到一半的公司能够严格追踪其 AI 计算成本。许多 GPU 的利用率不足一半,而未来的投资正转向目前仅有极少数企业使用的专用云。调查显示,大多数企业使用三种不同的基础设施平台,其中主要云服务商和 AI 模型 API 最为常见。尽管与现有系统的集成仍是首要选择因素,但性能与 GPU 可访问性的重要性已显著提升。如今,成功主要以上机时间和可靠性来衡量,其次是开发者生产力,而非成本指标。尽管重点关注性能与可用性,但 AI 计算的经济效益并未得到有效控制。拥有自有 GPU 的大部分公司报告了较低的利用率,且不到一半的公司能够严格追踪 AI 计算成本与回报。因此,“性价比”成为满意度最低的指标。展望未来,企业计划评估 AI 专用云,尽管其当前使用率较低。非 NVIDIA 加速器也是计划评估的重要领域。相当一部分企业打算在未来一年内更换或增加服务提供商,但其考虑范围仍主要由现有 incumbent 主导。
CdXz5zHNQW_que3v8B7Hr.png