DeepSeek V4 950实践:整网统一低精度数据流优化突破推理性能瓶颈
随着稀疏注意力、长上下文和大规模 MoE 成为新一代大模型的核心结构,推理性能瓶颈也在发生变化。
过去做低精度优化,大家最先想到的是 Linear、MatMul、Grouped MatMul。但在DeepSeek V4这类模型上,真正影响端到端性能的,已经逐渐扩展到:
- Sparse Attention中的离散访存和Scalar Bound
- KV Cache与长上下文带来的带宽压力
- Quant/DeQuant、Cast等低精度附加开销
- 中间Tensor反复写回
- 小算子与Kernel Launch
- 不同低精度算子之间的数据流衔接
这次我们围绕 DeepSeek V4 做了一次比较完整的 HiF8 推理实践,思路也从“单个低精度算子加速”逐步走向“整网统一低精度数据流优化”。
几个比较有代表性的结果:
精度方面,HiF8 在权重、激活和KV Cache上均表现出较好的数值保真度,主要Benchmark与高精度基线基本持平;其中权重量化SQNR相比MXFP8具有明显优势。
SparseMLA方面,HiF8不只是节省带宽,而是通过QKPV全量化、紧凑数据表示、Scale复用以及访存/计算流水重构,进一步缓解了原有SparseMLA中明显的Scalar Bound。长上下文场景收益更加突出,1M Decode下单算子最高达到约 1.39× 加速。
融合方面,通过RmsNorm+Quant、Rotary+Quant等融合,将中间结果尽可能留在片上,减少完整Tensor写回和Kernel Launch,部分模块可达到2.31×加速。
整网方面,HiF8不再只是MatMul的输入格式,而是尽量形成:
HiF8输入 → HiF8计算 → HiF8输出
的连续运行路径,减少HiF8 ↔ BF16之间反复Quant/DeQuant和数据搬运。
最终,在当前方案下:
DeepSeek V4 Flash 相比 MXFP8 获得约 8%–30% 的整网性能收益;
DeepSeek V4 Pro 获得约 7%–15% 的整网性能收益。
这次实践给我们的一个核心体会是:
低精度的下一阶段竞争,可能不再只是“谁的 MatMul 更快”,而是谁能够把数据格式、算子融合、片上数据流和整网执行真正协同起来。
完整文章中,我会进一步展开:
DeepSeek V4的Prefill/Decode瓶颈如何随Context Length 迁移;
为什么SparseMLA会从Compute问题演变成Compute + Memory + Scalar混合瓶颈;
HiF8和MXFP8在权重、激活、KV Cache上的数值差异;
SparseMLA HiF8的具体优化思路;
VV/Quant融合为什么能带来比单纯MatMul 更直接的收益;
以及HiF8如何进一步支撑HiF4 W4A8和后续低比特推理。
完整技术报告、详细数据和相关资料已整理到社区,欢迎感兴趣的同学前往阅读和交流。
更多推荐




所有评论(0)