파리에 자리 잡은 H Company가 9월 28일 컴퓨터 사용(computer-use) 오픈웨이트 모델 Holo4 두 종을 공개했다. 이 가운데 파라미터 270억 개짜리 작은 모델이 이 회사가 내놓은 모든 점수에서 1위에 올랐지만, 정작 상용 제품에는 합법적으로 실을 수 없다.
함정은 발표문이 아니라 모델 카드에 있다. Hugging Face의 Holo4-27B는 CC BY-NC 4.0 라이선스를 달아 비상업 용도로 쓰임새를 묶었다. Apache 2.0이 붙은 쪽은 성능이 떨어지는 형제 모델 Holo4-35B-A3B뿐인데, 긴 데스크톱 작업에서는 점수가 대략 절반에 그친다.
Key takeaways
- Holo4-27B는 OSWorld 2.0에서 61.7%를 태스크당 약 1.22달러에 기록했다. 같은 벤치마크에서 Claude Opus 5.5는 81.8%를 8.48달러에 냈다.
- 27B 가중치는 CC BY-NC 4.0이다. Apache 2.0은 35B-A3B Mixture-of-Experts 버전에만 적용되며, 이 모델의 같은 벤치마크 점수는 30.9%다.
- H는 자체 Agentic Task Factory가 만든 약 1만 개 과제로 두 모델을 학습했고, 벤치마크 실행 궤적을 전부 공개해 재현이 가능하도록 했다.
GUI와 코드, 툴 호출을 한 모델로
Holo4는 눈앞에 어떤 인터페이스가 놓이든 소프트웨어를 직접 다루도록 설계했다. 화면을 클릭하고 입력하는 일, 스스로 코드를 짜서 실행하는 일, MCP와 API 도구를 호출하는 일을 모두 한 모델이 처리한다. H는 공개 글에서 대다수 에이전트 모델이 한쪽 길만 택한다고 지적했다. GUI로 학습한 모델은 화면이 없으면 아무것도 못 하고, 툴 호출형 모델은 API를 노출하지 않는 애플리케이션 앞에서 멈춘다. 정작 실무 과제 하나에는 두 능력이 같이 필요한 경우가 흔하다.
같은 체크포인트가 데스크톱과 웹, 안드로이드, 코드 샌드박스, 사내 API를 상대로 돌아가며 호출 방식도 동일하다. 두 크기 모두 공개 당일 H Models API에 올라갔고, 소형 모델 Holotron4 Nano의 개선판도 함께 나왔다.
숫자가 실제로 가리키는 지점
기존 OSWorld 데스크톱 세트에서 Holo4 27B는 85.2%를 태스크당 0.08달러에 기록했다. 베이스 모델인 Qwen3.8 27B의 84.3%·0.22달러를 근소하게 앞섰고, Fable 5의 86.0%에는 조금 못 미쳤다. 격차는 긴 작업을 모아 난이도를 높인 OSWorld 2.0에서 벌어진다. 여기서 Holo4 27B는 부분 점수 61.7%, 완전 성공률 41.5%를 냈고, Qwen3.8 27B의 48.0%·19.4%를 대략 3분의 1 비용으로 눌렀다.
프런티어 모델을 넘지는 못했다. Opus 5.5가 OSWorld 2.0에서 81.8%로 선두이며, 전문가 워크플로 항목인 ALE-CLI에서도 63.7%로 Holo4의 44.1%를 앞선다. AutomationBench는 Opus 5가 50.3%로 45.4%를 제쳤다. H가 내세우는 것은 그 점수 옆에 붙은 비용이다. AutomationBench 기준 태스크당 0.05달러 대 3.05달러다. AndroidWorld에서는 27B 모델이 85.1%를 기록해 Fable 5의 88.8%에 뒤졌다.
학습 방식
H의 Agentic Task Factory는 문서만으로 상호작용 환경과 검증 가능한 과제를 만들어낸다. 제품 문서와 실제 웹사이트·오픈소스 소프트웨어의 스크린샷이 재료다. 지금까지 만든 과제는 약 1만 개로, 웹 앱 4,000개, MCP 서버 3,000개, 데스크톱·OS 3,000개로 나뉜다고 밝혔다.
지도 미세조정에는 1,270억 토큰을 썼다. 이 가운데 4분의 3가량이 성공한 에이전트 궤적이며 데스크톱 작업에 비중을 크게 뒀다. 이어 비동기 온라인 강화학습으로 LoRA 전문가 둘을 따로 학습했다. 하나는 데스크톱·웹, 다른 하나는 터미널·MCP·API 담당이다. 둘은 추가 학습 없이 같은 비중으로 미세조정 모델에 병합했다.
H는 모델을 둘러싼 실행 환경도 다시 짰다. 상한을 2시간·200액션에서 6시간·500액션으로 끌어올렸다. 가장 큰 개선은 수백 단계에 걸쳐 유지되는 기억을 에이전트에 준 것, 그리고 데스크톱 머신 자체에 셸을 열어준 것에서 나왔다고 설명했다.
앞으로 볼 지점
공개 점수 뒤에 있는 궤적을 전부 내려받을 수 있다. 벤치마크 우위를 내세우는 연구소치고는 이례적인 공개이며, 알리바바의 Qwen3.8 오픈 공개가 내놓지 않았던 독립 재현의 길을 열어준다. 최적화한 DSpark 드래프터 체크포인트도 며칠 안에 나온다. 다만 지금 당장 상업 권리가 필요한 팀에게 현실적인 선택지는 유료 호스팅 API이거나, 점수가 절반인 Apache 라이선스 모델이다.
FAQ · 자주 묻는 질문
Holo4를 상용 제품에 쓸 수 있는가
일부만 가능하다. Holo4-35B-A3B는 Apache 2.0으로 공개돼 상업 배포가 가능하지만, 점수가 더 높은 Holo4-27B는 CC BY-NC 4.0이라 비상업 용도로 제한된다. 두 모델 모두 유료 H Models API로도 제공되며, 이쪽에는 같은 제약이 없다.
컴퓨터 사용 성능에서 Claude Opus 5.5와 비교하면 어떤가
정확도는 뒤지고 비용은 앞선다. OSWorld 2.0에서 Opus 5.5가 81.8%, Holo4 27B가 61.7%다. 대신 H는 태스크당 비용을 Opus 5.5 8.48달러, 자사 모델 1.22달러로 추산했다. Opus 수치는 H가 직접 측정한 값이 아니라 Anthropic이 공개한 최대 노력(max-effort) 실행 결과를 가져온 것이다.
Holo4의 베이스 모델은 무엇인가
Hugging Face 모델 카드에 따르면 밀집형 27B는 Qwen3.8-27B를, Mixture-of-Experts 버전은 Qwen3.6-35B-A3B를 미세조정했다. H는 두 모델을 각각의 베이스와 비교했는데, 개선 폭은 단일 화면 과제보다 여러 단계를 거치는 긴 작업에서 가장 컸다.






