随着稀疏注意力、长上下文和大规模 MoE 成为新一代大模型的核心结构,推理性能瓶颈也在发生变化。

过去做低精度优化,大家最先想到的是 Linear、MatMul、Grouped MatMul。但在DeepSeek V4这类模型上,真正影响端到端性能的,已经逐渐扩展到:

  • Sparse Attention中的离散访存和Scalar Bound
  • KV Cache与长上下文带来的带宽压力
  • Quant/DeQuant、Cast等低精度附加开销
  • 中间Tensor反复写回
  • 小算子与Kernel Launch
  • 不同低精度算子之间的数据流衔接

这次我们围绕 DeepSeek V4 做了一次比较完整的 HiF8 推理实践,思路也从“单个低精度算子加速”逐步走向“整网统一低精度数据流优化”。

几个比较有代表性的结果:

精度方面,HiF8 在权重、激活和KV Cache上均表现出较好的数值保真度,主要Benchmark与高精度基线基本持平;其中权重量化SQNR相比MXFP8具有明显优势。

SparseMLA方面,HiF8不只是节省带宽,而是通过QKPV全量化、紧凑数据表示、Scale复用以及访存/计算流水重构,进一步缓解了原有SparseMLA中明显的Scalar Bound。长上下文场景收益更加突出,1M Decode下单算子最高达到约 1.39× 加速。

融合方面,通过RmsNorm+Quant、Rotary+Quant等融合,将中间结果尽可能留在片上,减少完整Tensor写回和Kernel Launch,部分模块可达到2.31×加速。

整网方面,HiF8不再只是MatMul的输入格式,而是尽量形成:

HiF8输入 → HiF8计算 → HiF8输出

的连续运行路径,减少HiF8 BF16之间反复Quant/DeQuant和数据搬运。

最终,在当前方案下:

DeepSeek V4 Flash 相比 MXFP8 获得约 8%–30% 的整网性能收益;
DeepSeek V4 Pro 获得约 7%–15% 的整网性能收益。

这次实践给我们的一个核心体会是:

低精度的下一阶段竞争,可能不再只是“谁的 MatMul 更快”,而是谁能够把数据格式、算子融合、片上数据流和整网执行真正协同起来。

完整文章中,我会进一步展开:

DeepSeek V4的Prefill/Decode瓶颈如何随Context Length 迁移;
为什么SparseMLA会从Compute问题演变成Compute + Memory + Scalar混合瓶颈;
HiF8和MXFP8在权重、激活、KV Cache上的数值差异;
SparseMLA HiF8的具体优化思路;
VV/Quant融合为什么能带来比单纯MatMul 更直接的收益;
以及HiF8如何进一步支撑HiF4 W4A8和后续低比特推理。

完整技术报告、详细数据和相关资料已整理到社区,欢迎感兴趣的同学前往阅读和交流。

资料链接:cann-recipes-infer/models/deepseek_v4-代码预览-cann-recipes-infer:基于 CANN 平台的 LLM 与多模态模型推理优化样例项目 - AtomGit

Logo

CANN开发者社区旨在汇聚广大开发者,围绕CANN架构重构、算子开发、部署应用优化等核心方向,展开深度交流与思想碰撞,携手共同促进CANN开放生态突破!

更多推荐