DeepSeek-V4
DeepSeek V4.1 新型オープン推論ツールキットの内幕
DeepSeek-V4 Team · 2026年9月14日 · 15 min read
Keywords: DeepSeek V4.1, 推論最適化, DeepSelect, DeepJIT
Published: 2026年9月14日 Author: DeepSeek-V4 Team
同じ週に更新された 3 つの DeepSeek リポジトリは、個別に見るよりも組み合わせることでより有用な物語を語ります。DeepSelect は狭義の TopK 操作を加速し、DeepJIT はデバイスカーネルをコンパイルおよびキャッシュします。deepseek-recipe は API 形状の会話をプロンプトに変換し、モデル出力をレスポンスとして解析します。これらはいずれも完全な推論サーバーではありませんが、組み合わせることで、通常は 1 つのエンドポイントの背後に隠されているレイヤーを可視化します。
この区別が重要なのは、「推論の高速化」がしばしば単一の調整ノブであるかのように報告されるためです。実際には、リクエストは検証、モデルトークンへのレンダリング、スケジュール、アクセラレーターでの実行、サンプリング、ストリーミングレスポンスへの変換という過程で時間を消費します。あるレイヤーを最適化しても、エンドツーエンドで同じ割合の改善が得られるとは限りません。
DeepSelect:高速かつ意図的に狭い TopK
DeepSelect 1.0 は、DeepSeek Sparse Attention (DSA) とサンプリング用の TopK カーネルを実装しています。README によると、DSA は DeepSeek V3.2、V4、V4.1 で使用されています。プロジェクトは標準の torch.topk と比較して 2〜20 倍の高速化を報告していますが、この数値は完全なモデル生成ではなく、サポートされるテスト形状に限定されます。
制約は具体的です。Lightning Indexer パスは bfloat16、4096 以下の小さな topk 値、および大小さまざまなバッチと語彙を受け入れます。サンプリングパスは float32 を使用し、約 128K の語彙をターゲットとし、topk も 4096 に制限します。入力行には特定のアライメントが必要であり、呼び出し側はパディング処理が必要な場合があります。
いくつかのオプションは、実用的な速度向上がどこで得られるかを示しています。インデックスに順序付けが不要な場合、ソートされた出力を無効にするべきです。値が不要な場合、return_value=False はその出力をスキップします。プロジェクトによると、これにより操作が約 10% 高速化されます。これらは API レベルの節約であり、謎めいたモデルの知能ではありません。
明確な NaN ポリシーもあります。チェックは常に有効であり、デフォルトの動作では NaN が見つかった時点でトラップし、中止します。これは腐敗した計算を早期に捉えるのに適しているかもしれませんが、推論サービスではワーカーのクラッシュをどのように分離し報告するかを決定する必要があります。
DeepJIT:一度コンパイルし、証拠とともに再利用
DeepJIT はスタックのより下層に位置します。これは、NVIDIA CUDA GPU および Huawei Ascend NPU 上でカーネルを JIT コンパイルするためのヘッダーのみの C++20 ランタイムです。共有インターフェースはコンパイル、バイナリキャッシュ、ロード、および起動をカバーしますが、カーネルソースとバックエンド固有のオプションは分離されたままです。
キャッシングがその中心的な運用機能です。キャッシュキーは、ソース、追跡されたインクルード、コンパイラーバージョン、実効コンパイラーオプション、およびアプリケーション提供の依存関係署名を考慮します。最後のフィールドは、生成されたコードがインクルードパーサーが見えない何かに依存する場合に重要です。ライブラリが CUTLASS をアップグレードしても追加の署名を変更しない場合、表面的には有効なキャッシュキーが誤ったアーティファクトを表す可能性があります。
DeepJIT はメモリキャッシュとディスクキャッシュの両方をサポートしており、アトミックなリネームと fsync のための POSIX 動作を持つ共有ストレージを含みます。複数のワーカーが同じエントリーをコンパイルし、公開された結果を再利用できます。個人用の書き込み可能キャッシュは、読み取り専用の共有キャッシュの前に配置することもできます。これは、共有ディレクトリが信頼されていることを前提とした、クラスター上のコールドスタートコストに対する実用的な答えです。
ハードウェアサポートは対称的な魔法ではありません。CUDA には最新の CUDA ヘッダーと NVCC が必要であり、Ascend には Bisheng ツールチェーン、CANN ヘッダー、ACL、および torch_npu が必要です。統一されたランタイムはホストロジックの重複を減らしますが、オペレーターは依然として 2 つのデバイスエコシステムを維持する必要があります。
deepseek-recipe:プロトコルレイヤーは真のエンジニアリング
リクエストの境界において、deepseek-recipe は Messages、Chat Completions、Responses リクエストを共有された Conversation 表現に変換するための Rust ライブラリと Python バインディングを提供します。その後、DeepSeek V4 または V4.1 のプロンプトをエンコードし、生成された出力を呼び出し側の期待する形式に解析できます。
サポートされるコンテンツには、テキスト、画像、思考、およびクライアントツール呼び出しが含まれます。生成設定には、推論努力、温度、top-p、および出力制限が含まれます。Responses 形式はツールネームスペースと apply_patch カスタムツールを運ぶことができます。V4.1 画像の場合、前処理は OpenCV を通じて提供されます。
省略されていることも同様に有用です。このライブラリはモデル推論、HTTP トランスポート、またはツール実行を提供しません。サーバー側の Web 検索はサポートされていません。strict JSON Schema または regex 出力の強制、previous_response_id を通じた会話の保存、または ID によるファイルの取得も行いません。OpenAI 互換のエンドポイントを構築するチームは、これらのサービスを依然として供給する必要があります。
レイヤーがどのように整列するか
| Layer | Project | Primary job | Does not provide |
|---|---|---|---|
| API and prompt | deepseek-recipe | Convert request formats; encode V4/V4.1 prompts; parse output | HTTP server, inference, tool execution |
| Kernel runtime | DeepJIT | Compile, cache, load, and launch CUDA/Ascend kernels | Model scheduler or model weights |
| Selection kernel | DeepSelect | TopK for DSA and sampling in supported shapes | End-to-end inference engine |
仮想的なリクエストは API サービスを通じて入力されます。deepseek-recipe がそれを検証および正規化し、正しいプロンプトをレンダリングします。推論エンジンはモデル作業をスケジュールし、デバイスカーネルを使用します。その一部は DeepJIT を通じてコンパイルおよびキャッシュされる可能性があります。スパースアテンションまたはサンプリング中に、サポートされる TopK 呼び出しが DeepSelect を使用する場合があります。生成されたトークンはその後、レシピパーサーを通じてストリーミング API レスポンスへと戻ります。
その図には重要な仮想的な接着剤が含まれています。DeepSeek は、これら 3 つのリポジトリをインストールすることで V4.1 サーバーが作成されると主張していません。スケジューラー、分散実行、重み、HTTP レイヤー、認証、クォータ、観測可能性、および実際のツールランナーは、結合された範囲の外に残っています。
誰が関心を持つべきか
推論エンジニアは、これらのプロジェクトを具体的な構築ブロックまたは読みやすい参照として使用できます。API プラットフォームチームは deepseek-recipe から最も即座の価値を得られ、カーネル作者は DeepJIT と DeepSelect から得られます。ホストされたモデルを呼び出すアプリケーション開発者は、これらのいずれもインストールする必要はありません。
評価者にとって、慎重な結論は控えめです。DeepSeek は V4 および V4.1 周辺のメカニズムの多くを開放しており、インターフェースはエンジニアがどこに努力を費やしているかを示しています。DeepSelect のベンチマークは、公開された形状内でのみ信頼できます。DeepJIT は繰り返しコンパイルを減らせますが、生成トークンを減らすわけではありません。deepseek-recipe はプロトコルの一貫性を向上させますが、モデルの精度を向上させるわけではありません。
それらの境界こそが、このリリースを単なる宣伝ではなく、実用的なものにしています。狭く指定されたコンポーネントは、ベンチマーク測定、交換、デバッグが可能です。興味深い更新は劇的な速度向上の主張ではなく、スタックが一度に 1 レイヤーずつ検査しやすくなる点にあります。
確認ソース(2026 年 9 月 14 日):DeepSelect、DeepJIT、deepseek-recipe。