在 SageMaker AI 上对小型 LLM 推理进行基准... 笔记

在 SageMaker AI 上对小型 LLM 推理进行基准测试:G7 与 G5 和 G6 的对比

在 Amazon SageMaker AI 上,针对 G5、G6、G6e 和 G7 GPU 实例,对两个 30B 参数规模的混合专家模型 Qwen3-Coder-30B 和 NVIDIA Nemotron-3-Nano-30B 进行基准测试。比较吞吐量、延迟和每 token 成本,并观察 G7 实例搭载的 NVIDIA Blackwell GPU 如何为实时大语言模型推理带来可衡量的性价比提升。
CdXz5zHNQW_agq3j9tzhI.png