登录社区云,与社区用户共同成长
邀请您加入社区
本次直播聚焦昇腾NPU算子性能优化,带来三大实践案例:我们将拆解RmsNormQuant的逐级优化链路,展示访存密集型算子的完整加速方法;深入剖析Scalar如何影响昇腾NPU算子性能,通过四类优化手段降低耗时;揭秘MXFP8/FP4混合精度矩阵乘的Vector+Cube混合核实现方案,展示M值较小场景的性能提升与位操作实践。精彩干货不容错过,立即预约直播吧!
1331
更多推荐
CANN本周快递,请查收!
【CANN经验传递】HiF8 × Safe-Pruner:剪掉一半Token,8-bit VLA依然无损
【CANN经验传递】从一张查找表到 4GB/s:HiFloat8 Cast 算子的工程化之路
扫一扫分享内容
为遵守国家网络实名制规定,未绑定将限制内容发布与互动
所有评论(0)