AWS Machine Learning Blog на русском
Подписаться
Многоуровневый KV-кэш для больших LLM на Amazon SageMaker HyperPod с Curvine
Запуск больших языковых моделей в масштабе требует компромисса в отношении KV-кэша: либо чрезмерно большие экземпляры GPU, либо медленное время до первого токена. В этой статье представлен многоуровневый KV-кэш на Amazon SageMaker HyperPod, который расширяет кэш в общий, распределенный NVMe-пул с Curvine, чтобы реплики могли повторно использовать кэш со скоростью, близкой к локальному диску, на экономически эффективных экземплярах.