antirez의 ds4, M5 Max에서 DeepSeek V4 Flash를 초당 34.4토큰으로 — DGX Spark는 14.4

MIT 라이선스 C 엔진은 자신이 만든 GGUF만 읽는다. 공개된 기준 표는 프리필을 보느냐 생성을 보느냐에 따라 하드웨어 순위가 뒤집힌다.

|5분 읽기0
Apple's Mac Studio: high-memory Apple Silicon desktops are ds4's primary Metal target for running DeepSeek V4 Flash locally.
Apple's Mac Studio: high-memory Apple Silicon desktops are ds4's primary Metal target for running DeepSeek V4 Flash locally.

Redis 창시자 살바토레 산필리포가 C로 작성한 MIT 라이선스 추론 엔진 DwarfStar 4(ds4)의 기준 벤치마크가 개인용 AI 워크스테이션을 고르는 사람에게 중요한 갈림길을 드러냈다. 똑같이 128GB를 얹은 두 머신 가운데 한쪽은 프롬프트를 훨씬 빨리 집어넣고, 다른 한쪽은 토큰을 두 배 넘게 빨리 돌려준다.

DeepSeek V4 Flash를 q2, 컨텍스트 32,768토큰으로 돌릴 때 ds4는 통합 메모리 128GB를 갖춘 M5 Max 맥에서 초당 34.4토큰을 생성한다. 같은 128GB인 NVIDIA DGX Spark는 14.4토큰이다. 프리필에서는 순위가 뒤집힌다. 같은 컨텍스트에서 Spark는 초당 855.9토큰을 집어넣는 반면 맥은 557.0에 머문다. 컨텍스트를 65,536토큰까지 늘리면 Spark는 823.0으로 거의 떨어지지 않지만 맥은 398.5까지 내려간다.

핵심 요약

  • ds4는 살바토레 산필리포가 만든 자기완결형 MIT 라이선스 C 추론 엔진이다. 범용 GGUF 러너가 아니라 특정 오픈웨이트 모델 몇 개만을 겨눈다.
  • DeepSeek V4 Flash q2, 컨텍스트 32,768토큰에서 공개된 수치는 128GB M5 Max 초당 34.4토큰 생성, 128GB DGX Spark 14.4토큰이다. 프리필은 Spark가 855.9로 맥의 557.0을 앞선다.
  • 바이너리 세 개가 함께 배포된다. CLI, OpenAI·Anthropic 호환 로컬 서버, 그리고 소켓이 아니라 프로세스 안에서 추론을 돌리는 코딩 에이전트다.

ds4가 일부러 되지 않으려는 것

프로젝트 문서는 ds4가 범용 GGUF 러너가 아니라고 못 박는다. 프로젝트가 직접 만든 GGUF 파일만 읽어들이며, 모델 지원은 기회주의적이라고 설명한다. 더 나은 대체 모델이 나오면 기존 모델은 빠진다. 엔진은 GGML과 링크하지 않지만 llama.cpp의 공로를 명시하고, 거기서 가져온 MIT 라이선스 양자화 레이아웃과 CPU 내적 로직, 일부 커널을 유지한다.

현재 지원 계열은 DeepSeek V4 Flash(실험적 비전 체크포인트 포함), DeepSeek V4.1 Flash, DeepSeek V4 PRO, GLM 5.2와 5.3, GLM 5.3 Flash, Qwen3.8 Flash Next이다. 맥에서는 96GB 이상 기기를 겨눈 Metal이 주 타깃이다. CUDA 작업은 DGX Spark를 중심에 두면서도 L40S 같은 Ada Lovelace 카드를 쓰는 멀티 GPU 구성까지 포괄하고, ROCm은 Framework Desktop 같은 Strix Halo 시스템을 담당한다.

거대한 전문가 혼합(MoE) 모델을 책상 하나에 올려놓는 비결은 비대칭 양자화다. 라우팅되는 전문가는 과감하게 압축하고, 공유되는 핵심 경로는 정밀도를 지킨다. Qwen3.8의 작은 Q2 빌드는 메인 가중치와 멀티 토큰 예측 가중치를 합쳐 41.73GiB에 들어가며, 프로젝트는 이를 64GB 맥의 입문 선택지로 제시한다.

에이전트를 엔진 안에서 돌리는 이유

ds4-server 바이너리는 OpenAI·Anthropic 방식 API를 말하므로 Claude Code나 Codex CLI, OpenCode 같은 도구가 베이스 URL만 로컬 머신으로 돌리면 된다. 별도 바이너리인 ds4-agent는 그 경계를 아예 건너뛰고 프로세스 안에서 추론을 구동한다. 그러면 코딩 세션 자체가 디스크에 놓인 KV 캐시가 된다. 긴 프리픽스는 SSD에 저장되고, 재시작 후 다시 집어넣는 대신 프롬프트 해시로 이어 받는다.

그게 에이전트 작업에서 비용이 큰 절반이다. DeepSeek도 모델 쪽에서 같은 레버를 당기고 있다. V4.1 Flash는 KV 캐시를 토큰당 890바이트로 줄였다.

단서는 대놓고 적어뒀다

산필리포는 이 소프트웨어를 베타 품질이라고 부른다. 릴리스마다 대규모 QA를 거치지만 회귀는 여전히 생길 수 있다는 것이다. 그는 ds4를 AI 코딩 에이전트의 강력한 도움을 받아 만들었고 아이디어와 테스트, 디버깅은 사람이 이끌었다고 밝히면서, AI가 작성한 코드가 불편한 독자라면 다른 선택지를 찾으라고 적었다. 완성된 제품이라기보다 각자의 에이전트로 확장해 쓸 동작하는 템플릿에 가깝다는 설명이다.

분산 구성 수치는 머신을 엮으려는 충동을 가라앉힌다. M5 Max 맥 두 대를 썬더볼트 5로 묶어 Flash Q4를 돌리면 프리필은 확장되지만 생성은 그렇지 않다. 자기회귀 특성이 그대로 남아 단일 머신 대비 약 19% 손실을 낸다. 더 빽빽한 L40S 8장 구성은 동시 세션 16개에서 생성 총합 초당 약 126토큰으로 보고됐다. 채팅 한 건이 더 빨라진 게 아니라 다중 사용자 서버의 성격이다.

수치는 ds4-bench에서 나왔다. 공개 도메인 텍스트를 2,048토큰 단위로 훑어 각 컨텍스트 경계까지 채운 뒤 그리디 토큰 128개를 측정하는 방식이라, 모든 행은 실행 평균이 아니라 해당 컨텍스트 크기에서의 처리량이다. 이 수치는 프로젝트 성능 가이드에 실려 있고 커뮤니티 DwarfStar 벤치마크 표에도 함께 올라와 있다. 이 표는 현재 ROCm과 일반 CUDA 사용자에게 자신들의 측정값을 보내 달라고 요청하고 있다.

FAQ 자주 묻는 질문

ds4는 오픈소스인가?

그렇다. ds4는 MIT 라이선스로 공개됐고, llama.cpp에서 가져와 손본 양자화 테이블과 커널도 같은 라이선스를 따른다. 소스는 github.com/antirez/ds4에 있으며, 저장소에는 프로젝트의 GGUF·imatrix·품질·속도 도구도 함께 들어 있다.

ds4로 아무 GGUF 모델 파일이나 돌릴 수 있나?

아니다. 이 엔진은 설계상 범위가 좁고, 지원 계열을 위해 프로젝트가 직접 만든 GGUF 파일만 실행한다. 외부에서 받은 일반 GGUF 파일은 대상이 아니라고 명시돼 있다. 지원 레이아웃마다 처음부터 끝까지 검증하기 위해 치른 대가다.

ds4에서 DeepSeek V4 Flash를 돌리려면 메모리가 얼마나 필요한가?

Metal은 96GB 이상 맥을 겨누고 있고, 기준 수치는 128GB 머신에서 측정됐다. 더 작은 시스템은 SSD 스트리밍으로 대응할 수 있으며, 41.73GiB짜리 Qwen3.8 Q2 빌드가 64GB 맥의 출발점으로 제시돼 있다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

"GPU 몇 장뿐인 연구실", 125B 모델을 24GB 카드 한 장에 올렸다
Developer Tools

"GPU 몇 장뿐인 연구실", 125B 모델을 24GB 카드 한 장에 올렸다

CMU의 Tim Dettmers가 자신의 연구실 프레임워크로 125B 모델을 24GB GPU 한 장에서, 550B 모델을 128GB MacBook에서 돌린다고 밝혔다. 6건을 한꺼번에 푸는 오픈소스 위크를 하루 앞둔 발표다.

Seung Jung11일 전
Claude Opus 5.5에서 400을 뱉는 Opus 5 요청 패턴 네 가지
Developer Tools

Claude Opus 5.5에서 400을 뱉는 Opus 5 요청 패턴 네 가지

Claude Opus 5.5는 Opus 5보다 20% 저렴하지만, Opus 5가 받아주던 요청 네 가지에 HTTP 400을 돌려준다. 다섯 번째 변경은 에이전트 진행 상황 스트림을 조용히 끊는다.

Seung Jung5일 전
Docker, AI 에이전트 샌드박스를 클라우드로 옮겼다… 시간당 0.07달러부터 초 단위 과금
Developer Tools

Docker, AI 에이전트 샌드박스를 클라우드로 옮겼다… 시간당 0.07달러부터 초 단위 과금

Docker가 마이크로VM 기반 에이전트 격리를 호스팅 컴퓨트로 확장한 Cloud Sandboxes를 내놨다. 시간당 0.07달러부터 초 단위로 과금하고, Kits 규격은 CNCF에 이관한다.

Seung Jung8일 전
개발자 305명 설문 — 71%가 이해 못 한 AI 코드를 그대로 배포했다
Developer Tools

개발자 305명 설문 — 71%가 이해 못 한 AI 코드를 그대로 배포했다

Coddy가 AI 코딩 도구를 주 1회 이상 쓰는 개발자 305명을 설문했다. 5명 중 4명은 강점이 아닌 의존이라 답했고, 업무 외 코딩 비율은 도구별로 36%에서 62%까지 벌어졌다.

Seung Jung13일 전
Vercel, 1년 전 고쳐진 버그 때문에 플랫폼 전역에서 AVIF를 껐다
Developer Tools

Vercel, 1년 전 고쳐진 버그 때문에 플랫폼 전역에서 AVIF를 껐다

Vercel은 신고된 Next.js RCE의 원인을 libheif에서 찾아 8월 13일 플랫폼 전역에서 AVIF를 껐고, 8월 25일까지 sharp·libvips·libheif 수정을 조율했다.

Seung Jung14일 전
OpenAI, 중급 모델 토큰 가격 반토막…벤치마크 두 곳은 여전히 GPT-5.6이 앞선다
Developer Tools

OpenAI, 중급 모델 토큰 가격 반토막…벤치마크 두 곳은 여전히 GPT-5.6이 앞선다

OpenAI가 화요일 중급 모델 두 종을 내놓으면서 설득 논리를 거의 전부 가격에 걸었다. GPT-6 Sol은 100만 입력 토큰당 2달러, 출력 100만 토큰당 10달러다.

Seung Jung10일 전