The Cloudflare Blog 한국어 팔로우 더 작고, 더 빠르고, 더 안전하게: Kimi와 GLM을 대규모로 실행하기 Kimi 및 GLM과 같은 프론티어 모델을 서비스하려면 GPU 메모리를 확보하기 위한 싸움이 필요합니다. 여기서는 KV 캐시를 양자화하고, 모델 가중치를 압축하며, 무결성 검사를 추가하여 더 빠르고 저렴하며 안전하게 서비스하는 방법을 설명합니다. Smaller, faster, safer: running Kimi and GLM at scale blog.cloudflare.com The Cloudflare Blog 한국어 RSS thenote.app