"GPU 몇 장뿐인 연구실", 125B 모델을 24GB 카드 한 장에 올렸다

Tim Dettmers가 dlab 오픈소스 위크를 예고했다. 프로젝트 2건과 논문 4편, 그리고 아직 연구실 밖 누구도 확인하지 않은 로컬 추론 수치가 함께 나온다.

|5분 읽기0
A consumer desktop graphics card installed in a PC case — the class of hardware Tim Dettmers says his lab's inference framework targets for 125-billion-parameter models.
A consumer desktop graphics card installed in a PC case — the class of hardware Tim Dettmers says his lab's inference framework targets for 125-billion-parameter models.

카네기멜런대학 컴퓨터과학과 조교수 Tim Dettmers가 월요일 블로그 글로 자신의 연구실이 '오픈소스 위크(Open Source Week)'라 부르는 일정을 예고했다. 오픈소스 프로젝트 2건과 논문 4편을 한꺼번에 공개하며, 데이터센터가 있어야 돌아간다고 여겨온 모델이 이제는 독자들이 이미 가진 하드웨어에 들어간다는 주장을 축으로 삼았다.

핵심 요약

  • Dettmers는 연구실의 추론 프레임워크가 1,250억 파라미터 모델 Qwen 3.8 Flash Next를 24GB 소비자용 GPU 한 장에서, 5,500억 파라미터 DeepSeek V4.1을 AMD Strix 머신·NVIDIA DGX Spark·메모리 128GB MacBook에서 구동한다고 밝혔다.
  • 프레임워크의 Metal 커널에 에이전트를 붙여 자동으로 최적화한 결과, Qwen 3.6 35B-A3B를 가중치당 1.5비트로 양자화해 초당 450토큰을 뽑았다. 반정밀도 사본이 쓸 메모리의 약 10분의 1 수준이다.
  • 연구실의 자동 압축 기법 CliffCompaction은 에이전트 비용을 절반가량 줄인다고 한다. 이를 사내에 도입한 한 협력사는 전체 AI 예산이 45% 감소했다고 측정했다.

프레임워크가 로컬에서 돌린다고 내세운 것

비교의 핵심은 같은 계열의 두 모델이다. 270억 파라미터짜리 Qwen 3.8은 Alibaba가 이 제품군을 오픈소스로 풀면서 괜찮은 카드 한 장을 가진 사용자의 기본 로컬 모델로 자리 잡았다. Dettmers의 주장은 같은 카드로 1,250억 파라미터 버전을 돌려야 한다는 것, 그리고 128GB 노트북이면 5,500억 파라미터 모델을 감당한다는 것이다.

그 격차는 공격적인 양자화에 자동 압축과 컨텍스트 관리를 얹어 메운다. 사용자가 따로 손댈 것 없이 긴 컨텍스트에서도 추론 속도가 유지된다는 게 그의 설명이다.

Mac과 Metal 작업은 소프트웨어를 어떻게 썼는지에 관한 두 번째 주장의 근거로 제시된다. 명령 하나로 연구실의 에이전트 하네스를 커널에 붙여놓고 실행 중에는 아무런 피드백 없이 내버려 뒀더니 1.5비트·초당 450토큰이라는 결과가 돌아왔다고 한다. 하네스의 설계 목표에 대한 그의 표현은 단호하다. 숙련된 연구자만 돌릴 수 있는 오픈소스는 오픈소스가 아니라는 것이다.

모든 주장의 바탕에 깔린 비용

CliffCompaction은 연구실이 가장 많이 쓰면서 가장 적게 이야기해온 기술이라고 Dettmers는 설명한다. 수백만 토큰짜리 세션, 본인의 경우 1억 토큰을 넘긴 세션까지 전체 비용의 절반 수준으로 돌렸다고 한다. KernelBench에서는 이 기법이 최고 성능에 도달해 AlphaEvolve 계열 접근과 계층적 메모리 시스템을 큰 격차로 앞섰다는 것이 그의 평가다.

아낀 비용은 다시 투입된다. 롤아웃 한 번 대신 같은 예산으로 여러 번을 돌리는 방식이다. 그는 이를 고정 비용에서 다중 롤아웃을 실질적 성능 향상으로 바꾸는 첫 실용적 방법이라고 내세우면서도, 일상적인 엔지니어링 업무에 쓰기에는 아직 무리라고 인정했다.

가장 과감한 주장은 연구 시스템이다. 하네스와 로컬 추론 스택 위에 올려 인터넷 연결을 완전히 끊은 채 돌렸는데도 프런티어 연구소들의 딥리서치 시스템을 능가하고, 자율 연구에서 Sakana AI의 시스템과 Google의 ScientistOne을 앞선다고 했다. 그가 든 시연은 자신이 모르는 분야를 일부러 골라 낸 생물정보학 문제다. 에이전트는 후보 문제 세 개를 제안했고, 그중 첫 번째에 약 두 시간을 쓴 결과 휴리스틱 방법의 새로운 하한을 내놓고 학계 최고 휴리스틱을 실제로 구현해 검증했으며, 해당 분야가 의존해온 평가 데이터의 결함까지 찾아냈다. 다만 문제 전체에서 최고 성능에는 이르지 못했다고 그는 덧붙였다.

단서가 중요한 이유

이 모든 것은 코드와 논문이 나오기 하루 전, 한 연구실이 스스로의 작업을 설명한 내용이다. 초당 450토큰도, 45% 예산 절감도, KernelBench 결과도 아직 연구실 밖에서 재현된 적이 없고, 글 어디에도 제3자 평가는 언급되지 않는다. 발표를 다룬 Hacker News 스레드도 게시 몇 시간이 지나도록 댓글이 한 자릿수에 머물렀다.

그럼에도 이번 주를 지켜볼 만하게 만드는 것은 그 뒤에 깔린 판돈이다. Dettmers해당 글에서 이를 직접 밝혔다. GPU 몇 장짜리 작은 연구실도 프런티어와 겨룰 시스템을 만들 수 있다는 것, 이유는 공략 비용이 싸면서 풀면 값어치가 큰 문제를 정작 거대한 컴퓨팅 예산을 쥔 쪽은 아무도 건드리지 않기 때문이라는 것이다. 이번 공개가 그 주장의 시험대이고, 결과는 공개된다.

자주 묻는 질문

125B 모델을 돌리려면 어떤 하드웨어가 필요하다고 했나?

Dettmers에 따르면 일반 데스크톱에 들어가는 24GB GPU 한 장이면 된다. 5,500억 파라미터로 훨씬 큰 DeepSeek V4.1에는 AMD Strix 시스템, NVIDIA DGX Spark, 또는 통합 메모리 128GB를 갖춘 MacBook을 제시했다.

dlab 오픈소스 위크 코드는 지금 받을 수 있나?

발표 시점에는 공개되지 않았다. Dettmers는 일정이 하루 밀렸으며 다음 날부터 오픈소스 프로젝트 2건과 논문 4편이 나가기 시작한다고 썼다. 여러 주에 걸쳐 나눠 내놓는 대신 하나의 생태계로 묶어 동시에 공개한다는 설명이다.

CliffCompaction은 기존 코딩 에이전트의 압축과 무엇이 다른가?

대화가 평소라면 끝났을 지점을 넘겨 에이전트를 계속 작동시키는 자동 압축 기법이다. Dettmers는 Claude Code나 Codex의 자동 압축보다 성능이 상당히 앞서며, 수백만 토큰 세션을 지탱하면서 전체 비용을 절반가량 줄인다고 주장한다. 이 비교는 연구실 자체 평가이며 독립 벤치마크가 아니다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

Meta, 에이전트가 직접 질의하는 React 디자인 시스템 Astryx 오픈소스 공개
Developer Tools

Meta, 에이전트가 직접 질의하는 React 디자인 시스템 Astryx 오픈소스 공개

Meta가 사내 모노레포에서 8년간 다듬어온 React 디자인 시스템 Astryx를 6월 MIT 라이선스 퍼블릭 베타로 공개했다.

Seung Jung8일 전
LLM 버그 수정기, 멀쩡한 코드를 고친 것보다 열 배 더 망가뜨렸다
Developer Tools

LLM 버그 수정기, 멀쩡한 코드를 고친 것보다 열 배 더 망가뜨렸다

arXiv 연구에서 LLM 수리 루프의 정상 코드 손상률은 0.261, 버그 코드 수리율은 0.023으로 나왔다. 연구진은 이를 몰고 가는 내부 방향까지 찾아냈다.

Seung Jung9일 전
Vercel, 1년 전 고쳐진 버그 때문에 플랫폼 전역에서 AVIF를 껐다
Developer Tools

Vercel, 1년 전 고쳐진 버그 때문에 플랫폼 전역에서 AVIF를 껐다

Vercel은 신고된 Next.js RCE의 원인을 libheif에서 찾아 8월 13일 플랫폼 전역에서 AVIF를 껐고, 8월 25일까지 sharp·libvips·libheif 수정을 조율했다.

Seung Jung3일 전
AI 에이전트가 RubyGems에 패키지 2,000개를 쏟아냈다. 신규 가입은 나흘간 막혔다
Developer Tools

AI 에이전트가 RubyGems에 패키지 2,000개를 쏟아냈다. 신규 가입은 나흘간 막혔다

포렌식 보고서가 5월 GemStuffer 캠페인을 재구성했다. AI 에이전트가 gem 2,000개 이상을 올려 RubyGems가 나흘간 신규 가입을 동결하게 만든 사건이다.

Seung Jung10일 전
ZCode, 스냅샷 한 번에 파일 42,411개 묶어 전송... 복호화 키는 Z.ai 서버에만
Developer Tools

ZCode, 스냅샷 한 번에 파일 42,411개 묶어 전송... 복호화 키는 Z.ai 서버에만

역공학 보고서에 따르면 Z.ai의 ZCode 앱이 Git 히스토리 전체를 알리바바 클라우드로 전송했고, 복호화는 회사 서버에서만 가능했다.

Seung Jung3일 전
Claude Code Projects, 병렬 클라우드 스레드를 지휘하는 조정자로 돌아왔다
Developer Tools

Claude Code Projects, 병렬 클라우드 스레드를 지휘하는 조정자로 돌아왔다

새로 설계된 Claude Code Projects는 작업 스레드 위에 조정자를 둔다. 스레드는 저마다 자기 브랜치에서 도는 완전한 클라우드 세션이고, 메모리는 함께 쓴다.

Seung Jung4일 전