SageMaker AIにおける小規模LLM推論のベンチマーキング:G7 vs G5およびG6
Amazon SageMaker AI 上の G5、G6、G6e、および G7 GPU インスタンスで、Qwen3-Coder-30B と NVIDIA Nemotron-3-Nano-30B の 2 つの 30B Mixture-of-Experts モデルをベンチマークします。スループット、レイテンシー、およびトークンあたりのコストを比較し、G7 の NVIDIA Blackwell GPU がリアルタイム LLM 推論で測定可能な価格性能の向上をどのように実現するかを確認します。