카네기멜런대학 컴퓨터과학과 조교수 Tim Dettmers가 월요일 블로그 글로 자신의 연구실이 '오픈소스 위크(Open Source Week)'라 부르는 일정을 예고했다. 오픈소스 프로젝트 2건과 논문 4편을 한꺼번에 공개하며, 데이터센터가 있어야 돌아간다고 여겨온 모델이 이제는 독자들이 이미 가진 하드웨어에 들어간다는 주장을 축으로 삼았다.
핵심 요약
- Dettmers는 연구실의 추론 프레임워크가 1,250억 파라미터 모델 Qwen 3.8 Flash Next를 24GB 소비자용 GPU 한 장에서, 5,500억 파라미터 DeepSeek V4.1을 AMD Strix 머신·NVIDIA DGX Spark·메모리 128GB MacBook에서 구동한다고 밝혔다.
- 프레임워크의 Metal 커널에 에이전트를 붙여 자동으로 최적화한 결과, Qwen 3.6 35B-A3B를 가중치당 1.5비트로 양자화해 초당 450토큰을 뽑았다. 반정밀도 사본이 쓸 메모리의 약 10분의 1 수준이다.
- 연구실의 자동 압축 기법 CliffCompaction은 에이전트 비용을 절반가량 줄인다고 한다. 이를 사내에 도입한 한 협력사는 전체 AI 예산이 45% 감소했다고 측정했다.
프레임워크가 로컬에서 돌린다고 내세운 것
비교의 핵심은 같은 계열의 두 모델이다. 270억 파라미터짜리 Qwen 3.8은 Alibaba가 이 제품군을 오픈소스로 풀면서 괜찮은 카드 한 장을 가진 사용자의 기본 로컬 모델로 자리 잡았다. Dettmers의 주장은 같은 카드로 1,250억 파라미터 버전을 돌려야 한다는 것, 그리고 128GB 노트북이면 5,500억 파라미터 모델을 감당한다는 것이다.
그 격차는 공격적인 양자화에 자동 압축과 컨텍스트 관리를 얹어 메운다. 사용자가 따로 손댈 것 없이 긴 컨텍스트에서도 추론 속도가 유지된다는 게 그의 설명이다.
Mac과 Metal 작업은 소프트웨어를 어떻게 썼는지에 관한 두 번째 주장의 근거로 제시된다. 명령 하나로 연구실의 에이전트 하네스를 커널에 붙여놓고 실행 중에는 아무런 피드백 없이 내버려 뒀더니 1.5비트·초당 450토큰이라는 결과가 돌아왔다고 한다. 하네스의 설계 목표에 대한 그의 표현은 단호하다. 숙련된 연구자만 돌릴 수 있는 오픈소스는 오픈소스가 아니라는 것이다.
모든 주장의 바탕에 깔린 비용
CliffCompaction은 연구실이 가장 많이 쓰면서 가장 적게 이야기해온 기술이라고 Dettmers는 설명한다. 수백만 토큰짜리 세션, 본인의 경우 1억 토큰을 넘긴 세션까지 전체 비용의 절반 수준으로 돌렸다고 한다. KernelBench에서는 이 기법이 최고 성능에 도달해 AlphaEvolve 계열 접근과 계층적 메모리 시스템을 큰 격차로 앞섰다는 것이 그의 평가다.
아낀 비용은 다시 투입된다. 롤아웃 한 번 대신 같은 예산으로 여러 번을 돌리는 방식이다. 그는 이를 고정 비용에서 다중 롤아웃을 실질적 성능 향상으로 바꾸는 첫 실용적 방법이라고 내세우면서도, 일상적인 엔지니어링 업무에 쓰기에는 아직 무리라고 인정했다.
가장 과감한 주장은 연구 시스템이다. 하네스와 로컬 추론 스택 위에 올려 인터넷 연결을 완전히 끊은 채 돌렸는데도 프런티어 연구소들의 딥리서치 시스템을 능가하고, 자율 연구에서 Sakana AI의 시스템과 Google의 ScientistOne을 앞선다고 했다. 그가 든 시연은 자신이 모르는 분야를 일부러 골라 낸 생물정보학 문제다. 에이전트는 후보 문제 세 개를 제안했고, 그중 첫 번째에 약 두 시간을 쓴 결과 휴리스틱 방법의 새로운 하한을 내놓고 학계 최고 휴리스틱을 실제로 구현해 검증했으며, 해당 분야가 의존해온 평가 데이터의 결함까지 찾아냈다. 다만 문제 전체에서 최고 성능에는 이르지 못했다고 그는 덧붙였다.
단서가 중요한 이유
이 모든 것은 코드와 논문이 나오기 하루 전, 한 연구실이 스스로의 작업을 설명한 내용이다. 초당 450토큰도, 45% 예산 절감도, KernelBench 결과도 아직 연구실 밖에서 재현된 적이 없고, 글 어디에도 제3자 평가는 언급되지 않는다. 발표를 다룬 Hacker News 스레드도 게시 몇 시간이 지나도록 댓글이 한 자릿수에 머물렀다.
그럼에도 이번 주를 지켜볼 만하게 만드는 것은 그 뒤에 깔린 판돈이다. Dettmers는 해당 글에서 이를 직접 밝혔다. GPU 몇 장짜리 작은 연구실도 프런티어와 겨룰 시스템을 만들 수 있다는 것, 이유는 공략 비용이 싸면서 풀면 값어치가 큰 문제를 정작 거대한 컴퓨팅 예산을 쥔 쪽은 아무도 건드리지 않기 때문이라는 것이다. 이번 공개가 그 주장의 시험대이고, 결과는 공개된다.
자주 묻는 질문
125B 모델을 돌리려면 어떤 하드웨어가 필요하다고 했나?
Dettmers에 따르면 일반 데스크톱에 들어가는 24GB GPU 한 장이면 된다. 5,500억 파라미터로 훨씬 큰 DeepSeek V4.1에는 AMD Strix 시스템, NVIDIA DGX Spark, 또는 통합 메모리 128GB를 갖춘 MacBook을 제시했다.
dlab 오픈소스 위크 코드는 지금 받을 수 있나?
발표 시점에는 공개되지 않았다. Dettmers는 일정이 하루 밀렸으며 다음 날부터 오픈소스 프로젝트 2건과 논문 4편이 나가기 시작한다고 썼다. 여러 주에 걸쳐 나눠 내놓는 대신 하나의 생태계로 묶어 동시에 공개한다는 설명이다.
CliffCompaction은 기존 코딩 에이전트의 압축과 무엇이 다른가?
대화가 평소라면 끝났을 지점을 넘겨 에이전트를 계속 작동시키는 자동 압축 기법이다. Dettmers는 Claude Code나 Codex의 자동 압축보다 성능이 상당히 앞서며, 수백만 토큰 세션을 지탱하면서 전체 비용을 절반가량 줄인다고 주장한다. 이 비교는 연구실 자체 평가이며 독립 벤치마크가 아니다.






