The Cloudflare Blog 中文 关注 更小、更快、更安全:大规模运行 Kimi 和 GLM 为 Kimi 和 GLM 等前沿模型提供服务,意味着争夺 GPU 显存。本文将介绍如何通过量化 KV 缓存、压缩模型权重以及添加完整性校验,实现更快、更经济且更安全的推理服务。 Smaller, faster, safer: running Kimi and GLM at scale blog.cloudflare.com The Cloudflare Blog 中文 RSS thenote.app