登录社区云,与社区用户共同成长
邀请您加入社区
cann-samples是CANN社区提供的高性能实操样例库,致力于为开发者提供可复用的优化方法论和最佳实践代码。本系列文章将陆续介绍仓库中的典型样例,分享我们在算子优化过程中的思考与经验。计算公式ci,j=∑g=0ceil(K/G)−1(scaleAi,g⋅scaleBg,j⋅∑k′=0G−1(ai,gG+k′⋅bgG+k′,j))c_{i, j} = \sum^{ceil(K/G)-1}_{g
cann-samples是CANN社区提供的高性能实操样例库,致力于为开发者提供可复用的优化方法论和最佳实践代码。本系列文章将陆续介绍仓库中的典型样例,分享我们在算子优化过程中的思考与经验。 本文将帮助你 理解MX量化的硬件加速机制:MX量化相较传统量化实现优势掌握性能建模方法:如何定量分析Bound类型,针对性优化,避免盲目调优理解核心优化思路:SWAT等关键策略的原理与应用了解TensorAP
引言 在 AI 大模型时代,算子性能优化是提升整体训练和推理效率的关键。 TileLang 是一门面向高性能算子开发的领域特定语言(DSL),采用简洁直观的编程范式,让开发者能够以接近数学表达的方式描述计算逻辑。相比传统的手写算子开发,TileLang 大幅降低了开发门槛,使开发者能够更高效地完成高性能算子的开发与调优。 TileLang-Ascend 是 TileLang 针
1.引言 CANN开源社区首个聚焦材料化学工程的开源组织Material Chemical Engineering SIG(材料化学工程特别兴趣小组,以下简称“MCE SIG”)正式发布由Committer (@Magic_LF)提交的首个科学计算算子LJForceFused,该算子采用Ascend C原生开发,并已成功应用实践于中国石油集团材料设计场景,实现了学术研究工具到工业落地的闭环验证,打
当前AI模型部署设备通常采用CPU与算力卡组成的异构架构。在AI推理业务中,CPU主要负责任务调度,算力卡负责执行大量计算任务。由于算力卡成本远高于CPU,其计算执行又依赖CPU的任务下发,一旦CPU调度不及时,算力卡便会陷入空闲等待,造成高成本算力资源被低成本CPU拖累的局面。Overlap Scheduling是解决这一问题的通用优化手段——它将CPU的任务调度过程与算力设备的计算执行过程并行
融合了ACLGraph的调度能力和亲和NPU的图优化能力,在大模型推理场景下有效的消除了算子调度时延,显著提升了大模型的推理表现。然而使能npugraph_ex由于需要对模型进行编译优化会引入较长的冷启动时间,此时便需要使用编译缓存功能,将编译优化后的产物保存到磁盘以便下次运行直接加载,节省编译耗时。当前npugraph_ex不仅支持了第三方框架对于模型性能优化的集成,也支持了编译缓存功能的集成,
CANN开源社区cann-recipes-train仓链接: https://gitcode.com/cann/cann-recipes-train
随着人工智能技术的持续神户以及人形机器人产业的快速发展,算力在提升机器人运动控制精度、实时响应能力与智能化水平方面的作用日益凸显。为实现降本增效,国产化算力代替需求不断攀升,本文基于国产化适配的 Pi0机器 VLA大模型,在昇腾 Atlas 800I A2服务器上完成部署与测试,结果表明:该模型在推理性能、推理精度及功能完整性等方面,不仅实现了与英伟达同级别硬件相当的算力表现,更在部分场景下表现出
CANN开源社区ops-transformer仓链接: https://gitcode.com/cann/ops-transformer
CANN开源社区链接:https://gitcode.com/cann