ByteNoteByteNote
DeepSeek 开源算子库:LLM 内核的干净解法
字

字节笔记本

2026年10月7日 · 约 3 分钟读完

DeepSeek 开源算子库:LLM 内核的干净解法

API中转
¥120

推理框架的底层竞赛里,DeepSeek 又更新了一件武器。GitHub 日榜上的 deepseek-ai/DeepGEMM(8.7k stars,MIT)是面向 LLM 计算原语的高性能张量核内核库,设计哲学写在副标题里:干净且高效。

仓库卡片

项目简介

算子覆盖相当全:FP8、FP4、BF16 三种精度的 GEMM,融合 MoE 的 Mega MoE 内核,DeepSeek 闪电索引器用的 MQA 打分核,以及 HyperConnection 相关原语。它借鉴 CUTLASS 与 CuTe 的概念但刻意避开重模板依赖,内核由 DeepJIT 在运行时编译,安装阶段完全不碰 CUDA 编译,这对部署体验是实打实的改善。

硬件上要求 SM90(Hopper)或 SM100(Blackwell)架构 GPU,另有独立的昇腾版本仓库。性能口径为 H800 上最高 1550 TFLOPS,官方称达到或超过专家调优的库。细节考究也不少:SM90 仅支持 NT 布局而 SM100 全布局、SM90 用 FP32 缩放因子而 SM100 打包 UE8M0、分组 GEMM 提供连续与掩码两种形态(后者适配 CUDA Graph 解码)。

近期更新

算子与更新图解

最近的更新密度不低:Mega MoE 把通信与计算重叠、FP8xFP4 混合精度 GEMM、FP4 索引器、PDL 支持、稠密与 MoE 反向传播的权重梯度内核、SM100 上重构的低 CPU 开销 JIT 模块。从更新轨迹看,这个库正在从推理专用扩展成训练推理通用的算子底座。

快速上手

bash
git clone --recursive https://github.com/deepseek-ai/DeepGEMM.git
cd DeepGEMM && ./install.sh

环境要求 Python 3.8 以上、CUDA 12.9 以上、PyTorch 2.3 以上、CUTLASS 4.0 以上。装完 import deep_gemm 即用,暴露 set_num_sms、set_pdl 等调优旋钮。

适合谁用

自建推理服务与做 MoE 模型训练的团队是第一受众,尤其已经在 Hopper 或 Blackwell 硬件上的:FP8 与 FP4 内核加上 MoE 融合算子,正是当前混合专家模型的算力大头。与站内写过的 ds4(DeepSeek 4 本地推理引擎)、tilelang(多卡内核 DSL)对照,DeepSeek 系正在把从算子到引擎的整条推理栈开源,这个信号比单个仓库的星数更值得关注。

相关文章

分享: