Towards Data Science | Medium на русском
Подписаться
Налогообложение KV-кэша: почему серверы для инференса исчерпывают память раньше, чем вычислительные ресурсы
Формула бюджета видеопамяти для обслуживания больших языковых моделей и три стратегии оптимизации, соответствующие шаблонам трафика, вызывающим ошибку нехватки памяти.