DeepSeek V4 Pro
立即开始对话

deepseek-v4

深入 DeepSeek V4.1 全新开放推理工具包

DeepSeek-V4 Team · 2026年9月14日 · 9 分钟阅读

关键词: DeepSeek V4.1、推理工具包、DeepSelect、DeepJIT、模型优化

发布日期: 2026年9月14日 作者: DeepSeek-V4 Team

Try DeepSeek on MidassAI
深入 DeepSeek V4.1 全新开放推理工具包

同一周内更新的三个 DeepSeek 仓库,结合在一起比单独看更能说明问题。DeepSelect 加速了特定的 TopK 操作。DeepJIT 编译并缓存设备内核。deepseek-recipe 将 API 格式的对话转换为提示词,并将模型输出解析回响应。它们都不是完整的推理服务器,但结合在一起,它们揭示了通常隐藏在单一端点背后的层层架构。

这种区分至关重要,因为“更快的推理”经常被报道得仿佛只是一个单一的旋钮。实际上,一个请求可能在验证、渲染为模型 token、调度、在加速器上执行、采样以及转换为流式响应的过程中丢失时间。优化某一层可能很有价值,但未必能在端到端产生相同比例的改进。

DeepSelect:快速且专为特定场景设计的 TopK

DeepSelect 1.0 为 DeepSeek 稀疏注意力(DSA)和采样实现了 TopK 内核。其 README 指出 DSA 用于 DeepSeek V3.2、V4 和 V4.1。该项目报告比原生 torch.topk 快 2–20 倍,但该数字属于支持的测试形状,而非完整的模型生成。

约束条件是具体的。Lightning Indexer 路径接受 bfloat16、不超过 4096 的小 topk 值,以及小型和大型批次与词汇表。采样路径使用 float32,针对约 128K 的词汇表,也将 topk 限制为 4096。输入行需要特定的对齐,调用者可能需要填充它们。

几个选项揭示了实际速度在哪里。如果不需要索引排序,应禁用排序输出。如果不需要值,return_value=False 跳过该输出;项目称这使操作快约 10%。这些是 API 级别的节省,而非神秘的模型智能。

还有一个严格的 NaN 策略。检查始终启用,默认行为是在发现 NaN 时捕获并中止。这可能适合早期捕获损坏的计算,但推理服务需要决定如何隔离和报告工作进程崩溃。

DeepJIT:一次编译,凭据复用

DeepJIT 位于堆栈的更低层。它是一个仅头文件的 C++20 运行时,用于在 NVIDIA CUDA GPU 和华为 Ascend NPU 上 JIT 编译内核。共享接口涵盖编译、二进制缓存、加载和启动,而内核源代码和特定后端的选项保持分离。

缓存是其核心操作功能。缓存键考虑了源代码、跟踪的包含文件、编译器版本、有效的编译器选项以及应用程序提供的依赖签名。最后一个字段很重要,当生成的代码依赖于包含解析器无法看到的内容时。如果库升级了 CUTLASS 但保持额外签名不变,表面有效的缓存键可能代表错误的工件。

DeepJIT 支持内存和磁盘缓存,包括具有 POSIX 行为(原子重命名和 fsync)的共享存储。多个工作进程可以编译同一个条目,然后复用发布的结果。个人可写缓存也可以置于只读共享缓存之前。这是集群冷启动成本的实用解决方案,前提是共享目录受信任。

硬件支持并非对称的魔法。CUDA 需要最近的 CUDA 头文件和 NVCC;Ascend 需要 Bisheng 工具链、CANN 头文件、ACL 和 torch_npu。统一的运行时减少了重复的主机逻辑,但运算符仍然维护两个设备生态系统。

Try DeepSeek on MidassAI

deepseek-recipe:协议层也是真正的工程

在请求边界,deepseek-recipe 提供 Rust 库和 Python 绑定,用于将 Messages、Chat Completions 和 Responses 请求转换为共享的 Conversation 表示。然后它可以编码 DeepSeek V4 或 V4.1 提示词,并将生成的输出解析为调用者期望的格式。

支持的内容包括文本、图像、思考和客户端工具调用。生成设置涵盖推理努力、temperature、top-p 和输出限制。Responses 格式可以携带工具命名空间和 apply_patch 自定义工具。对于 V4.1 图像,预处理通过 OpenCV 提供。

省略的内容同样有用。该库不提供模型推理、HTTP 传输或工具执行。不支持服务器端 Web 搜索。它不强制执行严格的 JSON Schema 或 regex 输出,不通过 previous_response_id 存储对话,也不按 ID 检索文件。构建 OpenAI 兼容端点的团队仍必须提供这些服务。

各层如何对齐

LayerProjectPrimary jobDoes not provide
API and promptdeepseek-recipeConvert request formats; encode V4/V4.1 prompts; parse outputHTTP server, inference, tool execution
Kernel runtimeDeepJITCompile, cache, load, and launch CUDA/Ascend kernelsModel scheduler or model weights
Selection kernelDeepSelectTopK for DSA and sampling in supported shapesEnd-to-end inference engine

一个假设的请求通过 API 服务进入。deepseek-recipe 验证并标准化它,然后渲染正确的提示词。推理引擎调度模型工作并使用设备内核,其中一些可能通过 DeepJIT 编译和缓存。在稀疏注意力或采样期间,支持的 TopK 调用可能使用 DeepSelect。生成的 token 然后通过 recipe 解析器返回到流式 API 响应中。

该图表包含重要的假设连接逻辑。DeepSeek 并未声称安装这三个仓库会创建 V4.1 服务器。调度器、分布式执行、权重、HTTP 层、认证、配额、可观察性和实际工具运行器仍留在组合范围之外。

哪些人群需要关注

推理工程师可以将这些项目用作具体的构建块或可读参考。API 平台团队将从 deepseek-recipe 获得最直接的价值;内核作者从 DeepJIT 和 DeepSelect 获益。调用托管模型的应用程序开发者不需要安装任何它们。

对于评估者,纪律严明的结论是适度的:DeepSeek 正在开放更多围绕 V4 和 V4.1 的机制,接口显示其工程师在哪里花费精力。DeepSelect 的基准测试仅在其发布的形状内可信。DeepJIT 可以减少重复编译,而非生成 token。deepseek-recipe 提高协议一致性,而非模型准确性。

这些界限使发布更有用,而非更少。一个规格明确的组件可以被基准测试、替换和调试。有趣的更新不是一个戏剧性的速度声明;而是一个堆栈变得更容易逐层检查。

资料来源核查于 2026 年 9 月 14 日:DeepSelectDeepJITdeepseek-recipe

相关文章

Try DeepSeek on MidassAI