The Cloudflare Blog 日本語 フォロー より小さく、より速く、より安全に:KimiとGLMを大規模で実行する KimiやGLMのようなフロンティアモデルを提供するには、GPUメモリをめぐる戦いがあります。ここでは、KVキャッシュの量子化、モデルウェイトの圧縮、整合性チェックの追加により、それらをより速く、安く、安全に提供する方法を説明します。 Smaller, faster, safer: running Kimi and GLM at scale blog.cloudflare.com The Cloudflare Blog 日本語 RSS thenote.app