扩展智能体 AI:UiPath 如何在 AI 超算上构建其高... 笔记

扩展智能体 AI:UiPath 如何在 AI 超算上构建其高性能 GPU 平台

UiPath 正转向代理式人工智能(agentic AI),部署能够进行推理并做出决策的自主代理,以编排复杂的业务流程。这一转变需要强大的计算能力和可靠的基础设施,尤其是对于大型企业而言。在全球 AI 平台上高效地编排数百个 GPU 至关重要,需在提升训练与推理能力的同时,不增加成本或延迟。UiPath 在 Google Cloud 上重构了其基础设施,转向用于智能文档处理的共享 GPU 集群。如今,他们使用 A3 虚拟机实例进行训练,使用 G4 虚拟机实例进行推理,以应对波动性工作负载并确保成本可预测。与 Google Cloud 的合作伙伴关系为 UiPath 雄心勃勃的代理式 AI 计划提供了必要的规模、灵活性和专门的 AI 能力。该公司此前按需配置 GPU 的方法因工作负载波动、高端芯片供应瓶颈以及运营开销过大而变得难以管理。通过将 GPU 视为共享的战略资源,UiPath 的机器学习服务平台优先处理任务,并在各工作流之间平衡需求,从而优化利用率。Google Cloud 的 AI 超算架构整合了硬件、软件和灵活的消费模式,进一步支持 UiPath 不断增长的规模。UiPath 利用 Google Kubernetes Engine 和 Google Cloud 的动态工作负载调度器(Dynamic Workload Scheduler, DWS)提前锁定 GPU 容量,实现主动规划。他们现在使用 A3 虚拟机实例进行训练,使用具有成本效益的 G4 虚拟机实例进行推理,从而优化性能与价格。这一新基础设施使 UiPath 能够将先进模型投入生产,例如 Omega Healthcare 和 Thermo Fisher Scientific 所使用的模型,实现了显著的准确性和处理效率提升。关键经验教训包括:解耦容量、提前调度计算资源,以及根据不同工作负载对硅芯片进行合理 sizing。
CdXz5zHNQW_xB4j7Tpaox.jpeg