The Cloudflare Blog на русском
Подписаться
Меньше, быстрее, безопаснее: запуск Kimi и GLM в масштабе
Обслуживание пограничных моделей, таких как Kimi и GLM, означает борьбу за память GPU. Вот как мы квантуем KV-кэши, сжимаем веса моделей и добавляем проверки целостности, чтобы обслуживать их быстрее, дешевле и безопаснее.