DeepSeek V4 Pro
지금 바로 채팅 시작하기

DeepSeek V4

DeepSeek V4.1 추론 툴킷 분석: DeepSelect, DeepJIT, Recipe

DeepSeek-V4 Team · 2026년 9월 14일 · 15 min read

Keywords: DeepSeek V4.1, 추론 최적화, DeepSelect, DeepJIT, AI 모델 추론, 오픈소스 툴킷

Published: 2026년 9월 14일 Author: DeepSeek-V4 Team

Try DeepSeek on MidassAI
DeepSeek V4.1 추론 툴킷 분석: DeepSelect, DeepJIT, Recipe

같은 주에 업데이트된 세 개의 DeepSeek 저장소는 각각 따로 보기보다 함께 살펴볼 때 더 유용한 시사점을 줍니다. DeepSelect 는 제한적인 TopK 연산을 가속화합니다. DeepJIT 는 디바이스 커널을 컴파일하고 캐시합니다. deepseek-recipe 는 API 형태의 대화를 프롬프트로 변환하고 모델 출력을 다시 응답으로 파싱합니다. 어느 것도 완전한 추론 서버는 아니지만, 함께 사용하면 종종 단일 엔드포인트 뒤에 숨겨져 있는 레이어를 노출시킵니다.

이 구분이 중요한 이유는 '추론 속도 향상'이 마치 단일 조절 장치인 것처럼 보고되는 경우가 많기 때문입니다. 실제로 요청은 검증, 모델 토큰 렌더링, 스케줄링, 가속기 execution, 샘플링, 스트리밍 응답 변환 과정에서 시간을 잃을 수 있습니다. 한 레이어를 최적화하는 것은 가치 있을 수 있지만, 끝단에서 끝단까지 동일한 비율의 개선을 가져오지는 않습니다.

DeepSelect: 빠르고 의도적으로 제한적인 TopK

DeepSelect 1.0 은 DeepSeek Sparse Attention (DSA) 및 샘플링을 위한 TopK 커널을 구현합니다. README 에 따르면 DSA 는 DeepSeek V3.2, V4, V4.1 에서 사용됩니다. 이 프로젝트는 기본 torch.topk 대비 2~20 배 속도 향상을 보고하지만, 이 수치는 완전한 모델 생성이 아닌 지원되는 테스트形状에 해당합니다.

제약 조건은 구체적입니다. Lightning Indexer 경로는 bfloat16, 4096 이하의 작은 topk 값, 그리고 작은 및 큰 배치와 어휘를 모두 허용합니다. 샘플링 경로는 float32 를 사용하며 약 128K 어휘를 목표로 하고 topk 를 4096 으로 제한합니다. 입력 행은 특정 정렬이 필요하며 호출자가 패딩을 추가해야 할 수 있습니다.

몇 가지 옵션은 실제 속도가 어디서 나오는지 보여줍니다. 인덱스에 순서가 필요하지 않다면 정렬된 출력을 비활성화해야 합니다. 값이 필요하지 않다면 return_value=False 로 해당 출력을 건너뛰며, 프로젝트에 따르면 이는 연산 속도를 약 10% 향상시킵니다. 이는 미스터리한 모델 지능이 아닌 API 수준의 절약입니다.

또한 명확한 NaN 정책이 있습니다. 확인은 항상 활성화되며, 기본 동작은 NaN 이 발견되면 트랩하고 중단합니다. 이는 초기에 손상된 계산을 catch 하는 데 적합할 수 있지만, 추론 서비스는 워커 크래시를 어떻게 격리하고 보고할지 결정해야 합니다.

DeepJIT: 한 번 컴파일, 증거와 함께 재사용

DeepJIT 는 스택의 하위에 위치합니다. NVIDIA CUDA GPU 및 Huawei Ascend NPU 에서 커널을 JIT 컴파일하기 위한 헤더 전용 C++20 런타임입니다. 공유 인터페이스는 컴파일링, 이진 캐싱, 로딩 및 launch 를 다루지만, 커널 소스 및 백엔드 특정 옵션은 분리되어 있습니다.

캐싱이 핵심 운영 기능입니다. 캐시 키는 소스, 추적된 includes, 컴파일러 버전, 효과적 컴파일러 옵션, 그리고 애플리케이션 제공 의존성 서명을 고려합니다. 마지막 필드는 생성된 코드가 include 파서가 볼 수 없는 무언가에 의존할 때 중요합니다. 라이브러리가 CUTLASS 를 업그레이드하지만 추가 서명을 변경하지 않으면, 표면적으로 유효한 캐시 키가 잘못된 아티팩트를 나타낼 수 있습니다.

DeepJIT 는 메모리 및 디스크 캐시를 모두 지원하며, 원자적 rename 및 fsync 를 위한 POSIX 동작을 갖춘 공유 저장소를 포함합니다. 여러 워커가 동일한 항목을 컴파일한 후 게시된 결과를 재사용할 수 있습니다. 개인 쓰기 가능 캐시는 읽기 전용 공유 캐시보다 먼저 위치할 수도 있습니다. 이는 공유 디렉토리가 신뢰되는 경우 클러스터의 콜드 스타트 비용에 대한 실용적인 답변입니다.

하드웨어 지원은 대칭적인 마법이 아닙니다. CUDA 는 최근 CUDA 헤더와 NVCC 가 필요하며, Ascend 는 Bisheng 툴체인, CANN 헤더, ACL 및 torch_npu 가 필요합니다. 통합 런타임은 중복된 호스트 로직을 줄이지만, 운영자는 여전히 두 디바이스 생태계를 유지해야 합니다.

Try DeepSeek on MidassAI

deepseek-recipe: 프로토콜 층이야말로 실제 엔지니어링입니다

요청 경계에서 deepseek-recipe 는 Messages, Chat Completions 및 Responses 요청을 공유 Conversation 표현으로 변환하기 위한 Rust 라이브러리 및 Python 바인딩을 제공합니다. 이후 DeepSeek V4 또는 V4.1 프롬프트를 인코딩하고 생성된 출력을 호출자가 예상하는 형식으로 파싱할 수 있습니다.

지원되는 콘텐츠에는 텍스트, 이미지, thinking 및 클라이언트 도구 호출이 포함됩니다. 생성 설정은 추론 노력, temperature, top-p 및 출력 제한을 다룹니다. Responses 형식은 도구 네임스페이스와 apply_patch 사용자 정의 도구를 전달할 수 있습니다. V4.1 이미지의 경우 전처리는 OpenCV 를 통해 제공됩니다.

누락된 부분도 마찬가지로 유용합니다. 이 라이브러리는 모델 추론, HTTP 전송 또는 도구 execution 을 제공하지 않습니다. 서버 측 웹 검색은 지원되지 않습니다. strict JSON Schema 또는 regex 출력을 강제하거나, previous_response_id 를 통해 대화를 저장하거나, ID 로 파일을检索하지도 않습니다. OpenAI 호환 엔드포인트를 구축하는 팀은 여전히 이러한 서비스를 제공해야 합니다.

레이어가 어떻게 정렬되는지

LayerProjectPrimary jobDoes not provide
API and promptdeepseek-recipeConvert request formats; encode V4/V4.1 prompts; parse outputHTTP server, inference, tool execution
Kernel runtimeDeepJITCompile, cache, load, and launch CUDA/Ascend kernelsModel scheduler or model weights
Selection kernelDeepSelectTopK for DSA and sampling in supported shapesEnd-to-end inference engine

가상의 요청이 API 서비스를 통해 들어옵니다. deepseek-recipe 가 이를 검증 및 정규화한 후 올바른 프롬프트를 렌더링합니다. 추론 엔진은 모델 작업을 스케줄링하고 디바이스 커널을 사용하며, 그중 일부는 DeepJIT 를 통해 컴파일 및 캐시될 수 있습니다. 희소 attention 또는 샘플링 동안 지원되는 TopK 호출은 DeepSelect 를 사용할 수 있습니다. 생성된 토큰은 recipe 파서를 통해 스트리밍 API 응답으로 다시 이동합니다.

이 다이어그램에는 중요한 가상의 연결 로직이 포함되어 있습니다. DeepSeek 는 이 세 저장소를 설치하는 것이 V4.1 서버를 만든다고 주장하지 않습니다. 스케줄러, 분산 execution, 가중치, HTTP 레이어, 인증, 할당량, 관찰 가능성 및 실제 도구 실행기는 결합된 범위를 벗어납니다.

누가 관심을 가져야 하는가

추론 엔지니어는 이러한 프로젝트를 구체적인 빌딩 블록이나 읽기 쉬운 참조 자료로 사용할 수 있습니다. API 플랫폼 팀은 deepseek-recipe 에서 가장 즉각적인 가치를 얻으며, 커널 작성자는 DeepJIT 및 DeepSelect 에서 얻습니다. 호스팅된 모델을 호출하는 애플리케이션 개발자는 이 중 어느 것도 설치할 필요가 없습니다.

평가자를 위해 신중한 결론은 다음과 같이 요약할 수 있습니다. DeepSeek 는 V4 및 V4.1 주변의 machinery 를 더 많이 개방하고 있으며, 인터페이스는 엔지니어들이 어디에 노력을 기울이고 있는지를 보여줍니다. DeepSelect 의 벤치마크는 게시된形状 내에서만 신뢰할 수 있습니다. DeepJIT 는 반복 컴파일을 줄일 수 있지만 생성 토큰을 줄이지는 않습니다. deepseek-recipe 는 모델 정확도가 아닌 프로토콜 일관성을 개선합니다.

이러한 경계는 릴리스를 덜 유용하게 만들지 않고 더 유용하게 만듭니다. 좁게 지정된 구성 요소는 벤치마크, 교체 및 디버깅이 가능합니다. 흥미로운 업데이트는 하나의 극적인 속도 주장이 아니라 한 번에 한 레이어씩 검사하기 쉬워지는 스택입니다.

출처 확인일: 2026 년 9 월 14 일: DeepSelect, DeepJIT, 및 deepseek-recipe.

Related articles

Try DeepSeek on MidassAI