DGX Spark 原生 FP4 矩阵指令:DwarfStar 如何利用 Blackwell 加速推理

发布时间:2026/9/2 11:51:37
DGX Spark 原生 FP4 矩阵指令:DwarfStar 如何利用 Blackwell 加速推理 DGX Spark 原生 FP4 矩阵指令DwarfStar 如何利用 Blackwell 加速推理【免费下载链接】ds4DeepSeek 4 Flash and PRO local inference engine for Metal, CUDA and ROCm项目地址: https://gitcode.com/GitHub_Trending/ds4/ds4DwarfStar 是专为 DeepSeek V4 Flash / PRO 打造的本地推理引擎支持 Metal、CUDA 与 ROCm 三大后端。在 NVIDIA DGX SparkGB10Blackwell 架构上DwarfStar 直接调用原生 FP4 块缩放矩阵指令block-scaled FP4 MMA来计算 MoE 专家权重让 156 GB 的 MXFP4 量化模型在这台 128 GB 统一内存工作站上跑出 400 t/s 的预填充速度 一、FP4 矩阵指令到底是什么FP4 是 Blackwell 一代 Tensor Core 新支持的 4-bit 浮点格式E2M11 位符号 2 位指数 1 位尾数配合 UE8M0 块缩放因子使用。相比 FP8/FP16它带来两个直接收益显存/带宽减半权重按 4 bit 存储MoE 这类专家权重占模型体积大头的结构收益最大吞吐翻倍Tensor Core 单次矩阵乘可处理的元素数是 FP8 的两倍。DwarfStar 在 cuda/mmq/mma.cuh 的mma_block_scaled_fp4中直接内联了 Blackwell 的 PTX 指令MXFP4 路径mma.sync.aligned.kind::mxf4.block_scale ... m16n8k64 ... f32.e2m1.e2m1.f32.ue8m0NVFP4 路径kind::mxf4nvf4缩放因子为 UE4M3、scale_vec::4X也就是说一次m16n8k64指令就完成了 16×64×8 的 FP4 矩阵乘累加无需先反量化回 FP16。二、为什么 FP4 对 MoE 推理尤其关键DeepSeek V4 是 MoE 架构每个 token 只路由到少数专家但所有专家权重都要常驻显存。DwarfStar 的量化策略是非对称激进量化——只把路由专家压到低比特注意力、共享专家、路由表保持 Q8/F16 不动。而 download_model.sh 提供的mxfp4包更特殊它原样保留 DeepSeek 官方发布的 MXFP4 专家权重不做二次量化约 156 GB./download_model.sh mxfp4在非 Blackwell 的 CUDA 卡上这套 FP4 权重只能先展开成 Q8 再计算而在 DGX Spark 上权重与激活全程保持 FP4批量专家 GEMM 直接喂给原生指令见 cuda/mmq/ds4_mmq.cu 中的ds4_mmq_mxfp4_dense与ds4_mmq_mxfp4_moe入口。三、DwarfStar 如何启用 FP4 路径编译目标做了硬件区分Makefilemake cuda-spark # Linux CUDA, DGX Spark / GB10该目标固定CUDA_ARCHsm_121并自动定义DS4_CUDA_HAVE_MXF41宏——这正是打开 Blackwell FP4 分支的开关。运行时内核还会做一道形状校验FP4 路径要求 K 维是MMQ_ITER_K_FP464的整数倍不满足则直接报错避免静默走错路径。其他架构Ada、Hopper 等同样能加载 MXFP4 GGUF但自动回退到 Q8_1 激活的通用 MMQ 路径精度无损速度则没有 FP4 红利。四、DGX Spark 实测速度仓库内置了 GB10 的完整基准数据 speed-bench/gb10.csv65k 上下文逐档扫描上下文长度Prefill 吞吐生成吞吐2048402.9 t/s14.2 t/s16384375.5 t/s13.8 t/s32768346.4 t/s13.0 t/s65536287.4 t/s12.1 t/sREADME.md 的速度表中还有一组 q2 量化、7047 token 长提示词的单次实测prefill 343.8 t/s生成 13.75 t/s——对一台桌面级工作站而言这个长上下文预填充速度已经非常可观。基准复现方法见 speed-bench/README.mdds4-bench会输出与 CSV 相同格式的逐档数据。五、快速上手清单 克隆仓库git clone https://gitcode.com/GitHub_Trending/ds4/ds4针对 DGX Spark 编译make cuda-spark下载 MXFP4 模型./download_model.sh mxfp4直接运行./ds4 -m gguf/DeepSeek-V4-Flash-MXFP4Experts-F16HC-F16Compressor-F16Indexer-Q8Attn-Q8Shared-Q8Out-chat-v2-mxfp4-0731.gguf想验证 FP4 点积正确性make test-mxfp4-cuda会运行 tests/test_mxfp4_cuda.cu 对照 CPU 参考实现做回归校验。六、延伸阅读量化格式背景MODEL_CARD.md 说明 DeepSeek V4 官方即为 FP4 FP8 混合权重发布前测试矩阵含 GB10 远程机QA_BEFORE_RELEASES.md多卡 CUDA 张量并行L40S 服务器场景与 Spark 的关系见 README.md Tensor Parallelism across CUDA GPUs 一节——注意 DGX Spark 是单 GPU 目标不要开启--cuda-tensor-parallel一句话总结Blackwell 的 FP4 块缩放 MMA DeepSeek 原生 MXFP4 权重 为 MoE 定制的批量专家内核是 DwarfStar 在 DGX Spark 上把大模型推理跑飞的三件套。【免费下载链接】ds4DeepSeek 4 Flash and PRO local inference engine for Metal, CUDA and ROCm项目地址: https://gitcode.com/GitHub_Trending/ds4/ds4创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考