より小さく、より速く、より安全に:KimiとGLMを大規模で... ノート

より小さく、より速く、より安全に:KimiとGLMを大規模で実行する

KimiやGLMのようなフロンティアモデルを提供するには、GPUメモリをめぐる戦いがあります。ここでは、KVキャッシュの量子化、モデルウェイトの圧縮、整合性チェックの追加により、それらをより速く、安く、安全に提供する方法を説明します。