Microsoft 연구진이 경쟁 진영이 가장 먼저 만드는 부품, 곧 오케스트레이터를 지워버린 멀티 에이전트 코딩 하네스를 공개했다. Agensh에서는 모든 작업자가 똑같은 5단계 루프를 돌고 똑같은 프롬프트를 받는다. 다른 것은 작업자 ID뿐이다. 일감을 나눠주는 리드 세션은 없다. 논문은 이 설계를 동시 작업자 1,024개까지 밀어붙였고, 그 수치는 아이디어가 성립하는 이유와 더 이상 수지가 맞지 않는 지점을 동시에 보여준다.
핵심 요약
- ProgramBench에서 가장 어려운 다섯 과제의 최종 테스트 통과율 평균은 에이전트 1개일 때 19.31%였고, 8개·32개·128개에서 각각 20.68%, 26.52%, 28.78%로 올랐다. 모두 GPT-5.6-sol(high)을 6시간 예산으로 돌린 결과다.
- pandoc 단일 과제만 보면 1개 에이전트가 33.89%, 128개가 50.94%, 1,024개가 55.06%를 기록했다. 작업자를 여덟 배로 늘려 얻은 몫이 4.12%포인트다.
- 조율은 평범한 인프라 위에서 돈다. 공유 작업 공간은 Gitea 저장소, 메시지는 Mattermost, 그리고 유형이 붙은 발견 기록을 덧붙이기만 하는 로그다.
하네스는 오케스트레이터를 어떻게 대신하나
각 작업자는 공유 목표와 동료의 진행 상황을 파악하고, 하위 작업을 점유한 뒤 그 범위를 공지한다. 이어 도구로 작업을 수행하고 수용 기준에 비춰 결과를 검증한 다음, 공유 작업 공간에 병합하고 처음으로 돌아간다. 점유가 겹치면 기획자가 아니라 작업자들끼리 다이렉트 메시지로 정리한다.
조율은 세 가지 서비스가 떠받친다. 공유 작업 공간은 Git 플랫폼이다. 실험에서는 Gitea를 썼고, 작업자는 각자 비공개 브랜치를 들고 main으로 통합하므로 병합 충돌이 일반적인 충돌로 드러난다. 메시지 인터페이스는 Mattermost다. 팀 채널은 루프가 한 바퀴 시작될 때 전달되고, 우선순위가 높은 다이렉트 메시지는 인프라 도구를 호출할 때마다 그 끝에 전달된다. 공유 컨텍스트는 유형이 붙은 항목을 덧붙이기만 하는 저장소다. 관찰한 동작은 OBSERVED, 확인된 사실은 FACT, 실패한 접근은 FAIL, 진행 중인 점유는 CLAIM, 완료된 변경 기록은 PATCH_SUMMARY로 남고, 최근 기억을 벗어난 이력은 grep 도구로 뒤진다.
협력 루프는 런타임이 아니라 작업자 프롬프트 안에 있다. 저자들이 Agensh를 단일 에이전트 하네스를 대체하는 것이 아니라 그 위에 얹은 계층이라고 설명하는 근거다. 실험은 그 밑에 Copilot을 깔고 돌렸으며, 논문은 얇은 어댑터만 있으면 Claude Code 같은 다른 하네스도 끼워 넣을 수 있다고 주장한다. 논문이 인용한 다른 하네스들과는 분명히 대비되는 지점이다. Claude Code의 에이전트 팀은 여전히 고정된 리드 세션을 중심으로 돌고, Codex는 하위 에이전트의 결과를 부모로 되돌리며, Kimi Agent Swarm은 작업을 분해하고 배분하도록 오케스트레이터를 학습시킨다.
확장 곡선이 실제로 말하는 것
ProgramBench는 에이전트 조직에 인터넷을 끊은 상태에서 6시간 안에 참조 프로그램의 동작을 맨바닥부터 재현하라고 요구한다. 연구진은 200개 인스턴스 가운데 가장 어려운 다섯 개를 골랐다. FFmpeg, GROMACS, pandoc, PHP-src, ctags로, 파일 수천 개와 수백만 바이트 소스를 품은 저장소들이다.
모델과 하네스를 고정한 상태에서 에이전트 128개는 1개보다 9.47%포인트 앞섰다. 상대 기준으로 약 49% 향상이다. 규모가 큰 집단은 도달 시점도 빨랐다. pandoc에서 128개는 30분 체크포인트에 테스트 통과율 30%를 넘겼고, 32개는 60분, 8개는 90분이 걸렸다. 단일 에이전트는 첫 두 시간 동안 그 선 아래에 머물렀다. 마감이 촉박한 작업이라면 최종 점수보다 이 지연 결과가 더 중요할 수 있다.
1,024개 실험은 머리기사인 동시에 단서다. 작업자 하나일 때보다 21.17점을 더 얹었지만, 128개와 견주면 4.12점 차이에 그친다. 논문은 어떤 구성에 대해서도 토큰이나 비용 계산을 내놓지 않았다. 마지막 896개 작업자의 값은 독자 몫으로 남은 셈이다. 게다가 상한이 동작의 완전한 재현인 벤치마크에서 55.06%는 여전히 부분적인 재현이다.
흥미로운 대목은 점수가 아니라 행동이다
모든 작업자가 동일한 프롬프트를 받기 때문에, 구조 비슷한 것은 무엇이든 스스로 떠올라야 한다. 실행 궤적은 실제로 그렇게 되는 모습을 보여준다. GROMACS에서는 작업자들이 모듈 인터페이스를 먼저 공지한 뒤 각자 그에 맞춰 구현했다. FFmpeg에서는 한 작업자가 동료의 범위 중복 지적을 받고 자기 범위를 좁혔다. PHP-src에서는 동료들이 승인한 기여에 다른 작업자가 반례를 제시하자 승인이 철회됐고, 수정본은 병합 전에 다시 검토를 거쳤다.
규모가 가장 커지면 역할이 굳는다. pandoc에서는 두 작업자가 통합 프로토콜을 만들어냈다. 작성자가 브랜치를 시험한 뒤 커밋 해시를 동료에게 보내 검증과 병합을 맡기는 방식이다. 다른 작업자들이 이를 베껴 썼고, 나중에는 검토를 맡은 동료가 주기 전체를 처리하도록 손질했다. 여러 작업자가 통합 담당으로 움직였고, 한 작업자는 후보 여럿에게 연락해 가장 먼저 유효한 응답을 보낸 쪽을 택한 뒤 나머지를 취소했다. 이 중복성 덕분에 작업자 하나가 실패해도 조직 전체가 멈추지 않았다. 표에 적힌 어떤 단일 수치보다 쓸모 있는 성질이다.
동시에 다른 군집 실험 결과가 던졌던 것과 같은 거버넌스 질문이 따라붙는다. 스스로 검토 규약을 써 내려가는 조직은 기획자의 지시를 따르는 조직보다 감사하기 어렵다. Agensh는 커밋, 메시지, 유형이 붙은 발견처럼 산출물을 읽을 수 있게 남기지만, 에이전트들이 스스로 정착시킨 그 작업 흐름을 승인한 사람은 아무도 없다.
FAQ — 자주 묻는 질문
Agensh 코드는 공개됐나
논문은 코드 공개를 알리지 않았고 저장소 링크도 걸지 않았다. 다만 하네스가 자체 호스팅 가능한 인프라 위에서 돈다는 점은 명시했다. 공유 작업 공간에는 Gitea, 메시징에는 Mattermost를 쓰며, 협력 루프는 런타임이 아니라 작업자 프롬프트에 들어 있어 설명만으로 재현이 가능한 설계다.
실험에는 어떤 모델을 썼나
보고된 모든 실행은 추론 강도 high의 GPT-5.6-sol을 썼고, 그 밑의 단일 에이전트 하네스로 Copilot을, 과제당 예산으로 6시간을 뒀다. 저자들은 협력 루프가 하네스에 구애받지 않는다고 말하지만 다른 모델의 결과는 내놓지 않았다.
에이전트가 많을수록 결과가 늘 좋아지나
비례하지는 않는다. 1개에서 1,024개까지 모든 구간에서 점수가 올랐지만, 128개에서 1,024개로 가며 얻은 몫은 pandoc 기준 4.12%포인트였다. 1개에서 128개 구간의 17.05%포인트와 대비된다. 논문은 에이전트 수를 확장 축으로 제시할 뿐, 공짜 축으로 두지 않는다.






