Многоуровневый KV-кэш для боль... Заметка

Многоуровневый KV-кэш для больших LLM на Amazon SageMaker HyperPod с Curvine

Запуск больших языковых моделей в масштабе требует компромисса в отношении KV-кэша: либо чрезмерно большие экземпляры GPU, либо медленное время до первого токена. В этой статье представлен многоуровневый KV-кэш на Amazon SageMaker HyperPod, который расширяет кэш в общий, распределенный NVMe-пул с Curvine, чтобы реплики могли повторно использовать кэш со скоростью, близкой к локальному диску, на экономически эффективных экземплярах.
CdXz5zHNQW_kgyKTy3mMc.png