本次直播聚焦昇腾NPU算子性能优化,带来三大实践案例:我们将拆解RmsNormQuant的逐级优化链路,展示访存密集型算子的完整加速方法;深入剖析Scalar如何影响昇腾NPU算子性能,通过四类优化手段降低耗时;揭秘MXFP8/FP4混合精度矩阵乘的Vector+Cube混合核实现方案,展示M值较小场景的性能提升与位操作实践。精彩干货不容错过,立即预约直播吧!

Logo

1331

更多推荐