VentureBeat 日本語
フォロー
Nvidiaは、単純な線形数学で高価なAIモデルのハンドオフを置き換えることができると発見
エージェンティックAIシステムは、異なるサイズの大規模言語モデル(LLM)間で切り替える際に、受信側のモデルが会話履歴全体を再計算する必要があるため、重大なボトルネックに直面しています。この再計算は、相当な計算コストとレイテンシを発生させ、長期間にわたるマルチLLMワークフローを妨げます。Nvidiaの研究者は、この問題に対処するために、クロスモデルKVキャッシュ転送技術を開発しました。この手法は、ソースモデルからターゲットモデルへ、事前に計算されたKey-Valueキャッシュを直接マッピングします。このプロセスは、エンタープライズAIアプリケーションの計算コストとレイテンシを大幅に削減します。実験によると、この線形マッピング技術は、キャッシュの再計算と比較して2.7倍から25倍高速です。また、互換性のあるモデルペアでは、ターゲットモデルのスタンドアロン精度を最大98%維持します。この技術は、KVキャッシュの線形構造を活用し、高価なディープラーニングトレーニングではなく、単純な代数的手法を採用しています。これにより、出力品質の向上を目指して、より小さなモデルからより大きなモデルへのシームレスなアップグレードが可能になります。また、初期の重い処理後に、より大きなモデルからより小さなモデルへの移行によるコスト削減も促進します。当初はファミリー内のモデル転送に焦点を当てていましたが、このフレームワークはより広範なアプリケーションの可能性を示しています。この進歩は、推論コストを管理しながら、マルチモデルエージェンティックシステムのスケーリングのための重要なツールを提供します。