Redis 창시자 살바토레 산필리포가 C로 작성한 MIT 라이선스 추론 엔진 DwarfStar 4(ds4)의 기준 벤치마크가 개인용 AI 워크스테이션을 고르는 사람에게 중요한 갈림길을 드러냈다. 똑같이 128GB를 얹은 두 머신 가운데 한쪽은 프롬프트를 훨씬 빨리 집어넣고, 다른 한쪽은 토큰을 두 배 넘게 빨리 돌려준다.
DeepSeek V4 Flash를 q2, 컨텍스트 32,768토큰으로 돌릴 때 ds4는 통합 메모리 128GB를 갖춘 M5 Max 맥에서 초당 34.4토큰을 생성한다. 같은 128GB인 NVIDIA DGX Spark는 14.4토큰이다. 프리필에서는 순위가 뒤집힌다. 같은 컨텍스트에서 Spark는 초당 855.9토큰을 집어넣는 반면 맥은 557.0에 머문다. 컨텍스트를 65,536토큰까지 늘리면 Spark는 823.0으로 거의 떨어지지 않지만 맥은 398.5까지 내려간다.
핵심 요약
- ds4는 살바토레 산필리포가 만든 자기완결형 MIT 라이선스 C 추론 엔진이다. 범용 GGUF 러너가 아니라 특정 오픈웨이트 모델 몇 개만을 겨눈다.
- DeepSeek V4 Flash q2, 컨텍스트 32,768토큰에서 공개된 수치는 128GB M5 Max 초당 34.4토큰 생성, 128GB DGX Spark 14.4토큰이다. 프리필은 Spark가 855.9로 맥의 557.0을 앞선다.
- 바이너리 세 개가 함께 배포된다. CLI, OpenAI·Anthropic 호환 로컬 서버, 그리고 소켓이 아니라 프로세스 안에서 추론을 돌리는 코딩 에이전트다.
ds4가 일부러 되지 않으려는 것
프로젝트 문서는 ds4가 범용 GGUF 러너가 아니라고 못 박는다. 프로젝트가 직접 만든 GGUF 파일만 읽어들이며, 모델 지원은 기회주의적이라고 설명한다. 더 나은 대체 모델이 나오면 기존 모델은 빠진다. 엔진은 GGML과 링크하지 않지만 llama.cpp의 공로를 명시하고, 거기서 가져온 MIT 라이선스 양자화 레이아웃과 CPU 내적 로직, 일부 커널을 유지한다.
현재 지원 계열은 DeepSeek V4 Flash(실험적 비전 체크포인트 포함), DeepSeek V4.1 Flash, DeepSeek V4 PRO, GLM 5.2와 5.3, GLM 5.3 Flash, Qwen3.8 Flash Next이다. 맥에서는 96GB 이상 기기를 겨눈 Metal이 주 타깃이다. CUDA 작업은 DGX Spark를 중심에 두면서도 L40S 같은 Ada Lovelace 카드를 쓰는 멀티 GPU 구성까지 포괄하고, ROCm은 Framework Desktop 같은 Strix Halo 시스템을 담당한다.
거대한 전문가 혼합(MoE) 모델을 책상 하나에 올려놓는 비결은 비대칭 양자화다. 라우팅되는 전문가는 과감하게 압축하고, 공유되는 핵심 경로는 정밀도를 지킨다. Qwen3.8의 작은 Q2 빌드는 메인 가중치와 멀티 토큰 예측 가중치를 합쳐 41.73GiB에 들어가며, 프로젝트는 이를 64GB 맥의 입문 선택지로 제시한다.
에이전트를 엔진 안에서 돌리는 이유
ds4-server 바이너리는 OpenAI·Anthropic 방식 API를 말하므로 Claude Code나 Codex CLI, OpenCode 같은 도구가 베이스 URL만 로컬 머신으로 돌리면 된다. 별도 바이너리인 ds4-agent는 그 경계를 아예 건너뛰고 프로세스 안에서 추론을 구동한다. 그러면 코딩 세션 자체가 디스크에 놓인 KV 캐시가 된다. 긴 프리픽스는 SSD에 저장되고, 재시작 후 다시 집어넣는 대신 프롬프트 해시로 이어 받는다.
그게 에이전트 작업에서 비용이 큰 절반이다. DeepSeek도 모델 쪽에서 같은 레버를 당기고 있다. V4.1 Flash는 KV 캐시를 토큰당 890바이트로 줄였다.
단서는 대놓고 적어뒀다
산필리포는 이 소프트웨어를 베타 품질이라고 부른다. 릴리스마다 대규모 QA를 거치지만 회귀는 여전히 생길 수 있다는 것이다. 그는 ds4를 AI 코딩 에이전트의 강력한 도움을 받아 만들었고 아이디어와 테스트, 디버깅은 사람이 이끌었다고 밝히면서, AI가 작성한 코드가 불편한 독자라면 다른 선택지를 찾으라고 적었다. 완성된 제품이라기보다 각자의 에이전트로 확장해 쓸 동작하는 템플릿에 가깝다는 설명이다.
분산 구성 수치는 머신을 엮으려는 충동을 가라앉힌다. M5 Max 맥 두 대를 썬더볼트 5로 묶어 Flash Q4를 돌리면 프리필은 확장되지만 생성은 그렇지 않다. 자기회귀 특성이 그대로 남아 단일 머신 대비 약 19% 손실을 낸다. 더 빽빽한 L40S 8장 구성은 동시 세션 16개에서 생성 총합 초당 약 126토큰으로 보고됐다. 채팅 한 건이 더 빨라진 게 아니라 다중 사용자 서버의 성격이다.
수치는 ds4-bench에서 나왔다. 공개 도메인 텍스트를 2,048토큰 단위로 훑어 각 컨텍스트 경계까지 채운 뒤 그리디 토큰 128개를 측정하는 방식이라, 모든 행은 실행 평균이 아니라 해당 컨텍스트 크기에서의 처리량이다. 이 수치는 프로젝트 성능 가이드에 실려 있고 커뮤니티 DwarfStar 벤치마크 표에도 함께 올라와 있다. 이 표는 현재 ROCm과 일반 CUDA 사용자에게 자신들의 측정값을 보내 달라고 요청하고 있다.
FAQ 자주 묻는 질문
ds4는 오픈소스인가?
그렇다. ds4는 MIT 라이선스로 공개됐고, llama.cpp에서 가져와 손본 양자화 테이블과 커널도 같은 라이선스를 따른다. 소스는 github.com/antirez/ds4에 있으며, 저장소에는 프로젝트의 GGUF·imatrix·품질·속도 도구도 함께 들어 있다.
ds4로 아무 GGUF 모델 파일이나 돌릴 수 있나?
아니다. 이 엔진은 설계상 범위가 좁고, 지원 계열을 위해 프로젝트가 직접 만든 GGUF 파일만 실행한다. 외부에서 받은 일반 GGUF 파일은 대상이 아니라고 명시돼 있다. 지원 레이아웃마다 처음부터 끝까지 검증하기 위해 치른 대가다.
ds4에서 DeepSeek V4 Flash를 돌리려면 메모리가 얼마나 필요한가?
Metal은 96GB 이상 맥을 겨누고 있고, 기준 수치는 128GB 머신에서 측정됐다. 더 작은 시스템은 SSD 스트리밍으로 대응할 수 있으며, 41.73GiB짜리 Qwen3.8 Q2 빌드가 64GB 맥의 출발점으로 제시돼 있다.






