系统工程手册:在 Ironwood(TPU7x)上优化 Qwen 3.5-397B MoE
为在 Ironwood TPU 上部署 397B 参数的 Qwen 3.5 混合专家(MoE)模型,工程师开发了一套模块化 JAX/Pallas 优化栈,在预填充密集型工作负载下实现了高达 4.7 倍的推理加速。团队通过部署混合数据并行与专家并行(DP+EP)拓扑,并配合自定义的低层通信融合(如分层 reduce-scatter),有效规避了严重的硬件分片限制,从而优化了跨设备 token 路由。最终,通过执行硬件感知的自定义内核——包括 Batched Ragged Page Attention 和完全融合的 Gated DeltaNet(GDN)块——成功饱和了 HBM 带宽和 TensorCore MXU,将系统吞吐量推近其理论 Roofline 极限。