Comment Amazon a mis à l'échelle Rufus en construisant une inférence multi-noeud avec des puces AWS Trainium et vLLM
Dans cet article, Amazon explique comment ils ont développé une solution d'inférence multi-nœuds pour Rufus, leur assistant d'achat basé sur l'IA générative, en utilisant les puces Amazon Trainium et vLLM pour servir des grands modèles de langage à grande échelle. La solution combine un modèle d'orchestration leader/follower, des stratégies de parallélisme hybride et une couche d'abstraction d'unité d'inférence multi-nœuds construite sur Amazon ECS pour déployer des modèles sur plusieurs nœuds tout en maintenant des performances et une fiabilité élevées.