登录社区云,与社区用户共同成长
邀请您加入社区
B站预约链接:点击预约
本周摘要CANN代码仓上新:cannbotCANN技术活动:CANN NEXT系列开播CANN 社区进展直达开源社区:https://gitcode.com/cannCANN 上新。
HiF8不只是节省带宽,而是通过QKPV全量化、紧凑数据表示、Scale复用以及访存/计算流水重构,进一步缓解了原有SparseMLA中明显的Scalar Bound。,HiF8 在权重、激活和KV Cache上均表现出较好的数值保真度,主要Benchmark与高精度基线基本持平;,通过RmsNorm+Quant、Rotary+Quant等融合,将中间结果尽可能留在片上,减少完整Tensor写回和
CANN技术活动:CANN挑战赛、HCCL通信库创新大赛火热报名中CANN社区进展直达开源社区:https://gitcode.com/cann竞 赛 进 行 时【2026 华为算法挑战赛_CANN挑战赛】开启预报名!面向高校学生同时启动5大赛区:京津冀东北赛区、上合赛区、西北赛区、西南赛区、杭厦赛区,荣誉证书 +秋招机考面试绿卡+丰厚奖金 欢迎广大学生报名参加!【2026 CANN-HCCL通信
需要注意的是,FLOPs会独立于数值精度统计multiply-accumulate operations:它反映的是token剪枝带来的FLOPs降低,但并不能体现HiF8带来的收益,例如低比特宽度带来的memory和bandwidth节省,以及低比特矩阵计算单元上的更高吞吐。因此,它能够在不依赖细粒度per-token / per-block scale的情况下,同时兼顾宽动态范围和高精度表示,
但 FP16/BF16 一共只有 65536 种位模式,HiFloat8 只有 256 种——干脆在 host(CPU)上预先把所有结果算出来打成一张表,device 上只剩"查表 + 写回",又快又简单。精度侧覆盖了 FP16/BF16 全 65536 个位模式的 roundtrip、HiFloat8 全 256 个值的 decode,以及 ±0、±Inf、NaN、subnormal 的边界场景
点击参与CANN开源开发者满意度有奖调研
PyPTO Professional 的赌注是:算子开发者应该把时间花在「切多大的块、开几级流水、Buffer 怎么摆」上,而不是花在「这个 offset 算对了吗、这个 event id 配对了吗」上。前者是创造性的、决定性能上限的工作;后者是机械的、只决定你今晚能不能下班的工作。PyPTO Professional 把后者全部接管,同时一寸不让地把前者留给你——因为想摸到理论峰值 0.9x 以
在 AI 大模型时代,模型部署时会遇到容量压力、带宽与吞吐压力和工程适配压力。同时,本可以收敛成一条工具链的工作被分散在各个流程中,进而导致在适配不同模型时做重复工作。如何低成本的部署模型,如何把模型量化收敛成一条统一的工作流,是这个时代需要解决的问题。AMCT-LLM 是一款面向大语言模型低比特量化的模型压缩工具,将模型适配、精度评估、量化优化与部署导出收敛为统一工作流。
CANN 全面开源开放,致力于为开发者构建统一、高效的算力使能平台,助力 AI 应用创新与加速落地。为进一步促进区域开发者交流、共建 CANN 生态,CANN 开源社区联合 AtomGit 正式发起「CANN 开发者 Meetup」南京站。
用 CANNBot去写高性能复杂算子时,拦住它的从来不是算法,而是一堆"天生对Agent不友好"的实现细节:为榨干多级流水而生的NBuffer、核内核间稍有不慎就出错的同步原语、各种Layout堆出来的复杂地址计算、还有因为极致性能而引入的私有格式。它们与算法无关,但也是Agent生成复杂算子最容易出错的主要原因。面对这些复杂的细节,当前的大模型能力、提示词和skills还无法
为什么写这篇文章? 随着大模型训练需求的爆发式增长,分布式训练已成为AI开发者的必备技能。作为CANN生态中的核心通信组件,HCCL承担着多机多卡训练中数据同步的关键任务。本文基于gitcode平台上的两台NPU Notebook,对HCCL进行了完整的体验、测试与评测,旨在帮助开发者: 了解HCCL的核心能力:它能为分布式训练带来什么价值?验证实际性能表现:在真实环境中的通信效率如
5月16日-17日,第九届信息技术新工科产学研联盟年会暨信息技术领域产学合作论坛在天津隆重召开。大会由信息技术新工科产学研联盟、中国软件行业协会主办,华为技术有限公司协办,南开大学承办。联盟理事单位、工委成员单位等全国各地专家学者、教育界和企业界代表共400余人参会。华为CANN领域总经理邵立欣发表主题演讲,分享《CANN开源开放,助力高校培养AI开发者》。 本届年会开幕式由联盟副理事
B站直播预约链接:点击预约
随着大模型训推规模持续增长,8-bit 数据格式已成为提升计算效率、降低显存占用和优化部署成本的重要方向。HiFloat8(HiF8)凭借大动态范围和灵活的精度表达,为大模型在低比特场景下兼顾精度与性能提供了新的路径。 HiF8的全面表达系统性地支持了大模型的低比特训推,其中的关键策略已被沉淀为可复现、可迁移的开源参考实现。在推理侧,提高效率的关键不只是“把权重压到8-bit”,更要将
当 Coding Agent 一次写出几十个算子已成为常态,"什么算优质算子"变成了一个单一维度无法评估准确的问题:能不能过编译只是入场券,精度是否经得起验证、换个 shape 换个 dtype 是否仍然稳定、性能离硬件上限还有多远,每一项都决定了这个算子是否值得真正部署。面对这样的多维需求,整个学界与产业界都在期待一把统一的尺子。 CANN Bench 由学界测试领域专家与C
cann-samples是CANN社区提供的高性能实操样例库,致力于为开发者提供可复用的优化方法论和最佳实践代码。本系列文章将陆续介绍仓库中的典型样例,分享我们在算子优化过程中的思考与经验。 本文将帮助你 理解MX量化的硬件加速机制:MX量化相较传统量化实现优势掌握性能建模方法:如何定量分析Bound类型,针对性优化,避免盲目调优理解核心优化思路:SWAT等关键策略的原理与应用了解TensorAP
B站直播预约:预约链接
随着大模型训练与推理、推荐系统及多模态应用等AI场景的爆发式发展,新一代AI芯片的算力突破已成为行业刚需。Ascend 950作为面向AI计算的新一代芯片,通过第三代DaVinci Core架构、灵衢互联技术以及MXFP4/MXFP8等低精度计算等特性支持,为AI应用提供了强大的算力底座。然而,硬件算力的充分释放离不开高效的软件栈支持。CANN作为昇腾AI处理器的异构计算架构,通过持续演进,已经形