停止增加更多 GPU:Weka 的新存储平台通过将 AI 模型 100% 的预计算 token 进行缓存,从而降低负载。
GPU 内存是 AI 生产环境中成本最高且消耗最快的资源。更长的上下文窗口和多轮对话会导致已处理信息的不必要重复计算。Weka 凭借 NeuralMesh 6 平台和 Wekapod 3 硬件,旨在利用经济实惠的闪存扩展 GPU 内存。其增强型内存网格(Augmented Memory Grid)聚合 NAND 闪存,以更低成本模拟 GPU 内存。该技术进入了一个竞争激烈的市场,Dell 和 NetApp 等成熟厂商同样聚焦于 AI 基础设施。Weka 强调其原生 AI 设计,满足客户对即时计算可用性的需求。核心优势在于提升 GPU 利用率、降低推理成本以及加速 AI 工作负载部署。该技术对大规模 AI 运营及快速成长的企业尤为宝贵。NeuralMesh 6 的关键特性包括可组合的虚拟多租户支持,以实现高效的资源共享;同时提供统一的文件与对象存储,消除数据冗余。基于元数据的复制机制加快了数据在目标环境中的可用性。增强型内存网格专门针对浪费的计算资源问题,通过缓存预计算 token,防止在长对话中产生重复处理。这种方法允许使用远超传统 GPU 内存的 NAND 存储容量,从而实现预计算 token 的完整缓存。