Бенчмаркинг инференса небольши... Заметка

Бенчмаркинг инференса небольших LLM на SageMaker AI: G7 против G5 и G6

Сравните две модели Mixture-of-Experts с 30 миллиардами параметров, Qwen3-Coder-30B и NVIDIA Nemotron-3-Nano-30B, на экземплярах GPU G5, G6, G6e и G7 в Amazon SageMaker AI. Сравните пропускную способность, задержку и стоимость за токен, а также узнайте, как GPU NVIDIA Blackwell в G7 обеспечивают измеримое улучшение соотношения цены и производительности для инференса LLM в реальном времени.
CdXz5zHNQW_agq3j9tzhI.png