Amazon SageMaker Inference におけ... ノート

Amazon SageMaker Inference におけるプレフィックス認識ルーティングによる LLM レイテンシの削減

Amazon SageMaker Inference は、同じプロンプトプレフィックスを共有するリクエストを同じインスタンスに送信し、KVキャッシュをウォームに保つルーティング戦略であるプレフィックスアウェアルーティングを提供するようになりました。Llama 3.1 70B のベンチマークでは、P50 の初回トークンまでの時間を最大 77% 短縮し、KVキャッシュヒット率を約 25% から 80% 超に向上させました。
CdXz5zHNQW_Kz51MkzC1A.jpeg