AWS, 에이전트 하네스 'Strands' 오픈소스 공개 — 자사보다 싼 경쟁자도 차트에 남겼다

Apache 2.0으로 공개한 이번 릴리스에는 컨텍스트 관리 기본값과 함께, 토큰 지출에서 AWS가 이기지 못한 경쟁자가 그대로 담긴 벤치마크 차트가 들어 있다

|5분 읽기0
Server racks in a data centre — Strands Harness is built so the agent prototyped on a laptop is the same artifact deployed to cloud infrastructure
Server racks in a data centre — Strands Harness is built so the agent prototyped on a laptop is the same artifact deployed to cloud infrastructure

AWS의 Strands Agents 팀이 9월 21일 Strands Harness를 공개했다. Apache 2.0 라이선스로 Python과 TypeScript를 지원하고, 노트북에서도 5개 클라우드 어디에서도 배포할 수 있다. 정작 눈에 띄는 것은 벤치마크 차트가 내세운 수치가 아니라 AWS가 차트에 그대로 남겨둔 항목이다. 자사 하네스보다 적은 토큰으로 돌아간 유일한 경쟁자, DeepSeek Harness다.

핵심 요약

  • Strands Harness는 Python·TypeScript용 Apache 2.0 라이브러리다. create_harness() 호출 한 번으로 만들어지며 Bedrock, Anthropic, OpenAI, Google, LiteLLM, 로컬 Ollama 모델로 연결된다.
  • AWS가 성과의 원인으로 지목한 것은 세 가지 컨텍스트 관리 기본값이다. 1,500토큰을 넘는 도구 결과 잘라내기, 컨텍스트 사용률 85% 시점의 압축, 오버플로 발생 시 루프 내 복구다.
  • DeepSeek Harness는 AWS 루프보다 토큰을 약 14% 적게 썼지만 모든 평가에서 더 낮은 점수를 받았다. AWS가 내세운 평균 절감폭이 45%가 아니라 28%에 머무른 이유다.

같은 발표에 절감 수치가 두 개인 이유

하네스는 모델을 둘러싼 모든 것을 가리킨다. 루프, 도구 정의, 컨텍스트 처리, 메모리, 실행이 어긋났을 때의 복구까지다. 어느 것도 모델 자체는 아니지만 청구서를 결정하는 쪽은 전부 이 영역이다. AWS는 자사 하네스를 Claude Code, Codex, oh-my-pi, OpenCode, DeepSeek Harness와 붙였다. Terminal-Bench 제작진이 만든 프레임워크 Harbor를 통해 EC2에서 6개 평가를 돌려 평균을 냈다.

개발자가 실제로 프로토타이핑에 쓰는 두 에이전트로 범위를 좁히면 절감폭은 The New Stack이 제목으로 뽑은 45%가 된다. 여기에 DeepSeek의 하네스까지 넣으면 평균은 28%로 내려간다. 그 항목 하나가 AWS가 만든 어떤 것보다 저렴하기 때문이다. 차트에서 지우는 대신 그대로 공개한 선택은 짚어둘 만하다. 덕분에 더 정직한 독법도 가능해진다. 이 비교에서 가장 싼 하네스는 가장 부정확한 하네스이기도 했다.

변수를 하나로 묶은 비교

모델과 하네스를 동시에 바꾸는 벤치마크 표로는 결과를 어디에도 귀속할 수 없다. Terminal-Bench 2.1 실행은 모델을 Claude Fable 5로 고정하고 각각 89회를 돌렸고, 그제서야 차이가 의미를 얻는다. Claude Code를 상대로 AWS 루프는 비용이 77% 낮았고 정확도는 7.9포인트 높았다. oh-my-pi와는 같은 69.7 정확도를 훨씬 적은 비용으로 냈다. DeepSeek의 항목은 비용을 더 아꼈지만 그 대가로 10.2포인트를 내줬다.

에이전트를 상시 돌리는 팀에게 평균 28%는 반올림 오차가 아니다. 월 토큰 비용이 다섯 자릿수에 이르는 워크로드라면 정확도 논쟁을 빼고도 마이그레이션을 정당화할 만한 항목이다.

기본값 세 가지, 그리고 검증 가능하다

AWS는 절감과 정확도의 공을 대부분 루프의 영리한 설계가 아니라 하네스가 컨텍스트를 다루는 방식에 돌린다.

메커니즘발동 조건
도구 결과 잘라내기약 1,500토큰을 넘는 결과
압축(요약)컨텍스트 사용률 85% 초과
루프 내 컨텍스트 복구실행 도중 윈도 오버플로

평범한 엔지니어링 판단이고, 바로 그 점이 핵심이다. 성과는 어느 팀이든 설정할 수 있었지만 대체로 설정하지 않았던 기본값에서 나왔다. create_harness() 호출 한 번이면 셸·파일·웹 도구, 프롬프트 캐싱, 세션 ID로 이어받는 메모리, 체크리스트를 기준으로 범위가 열린 하위 작업을 떠맡는 보조 에이전트까지 갖춘 에이전트가 나온다. 모델 호출은 Amazon Bedrock이 기본이고 Anthropic, OpenAI, Google, LiteLLM, 로컬 Ollama 모델로 바꿔 끼울 수 있다. MCP 서버는 외부 도구로 붙는다.

독립 연구도 같은 곳을 가리킨다

Claude Code와 Codex CLI, Pi를 7개 모델에 걸쳐 비교한 HarnessTax 연구는 하네스 선택이 성공률을 거의 바꾸지 못한다는 결과를 내놨다. 반면 같은 모델이 최대 5배의 비용 차이로 비슷한 결과에 도달할 수 있었다. 하네스를 성능으로 파는 쪽에는 불편한 결론이지만, 공교롭게도 AWS의 메시지를 뒷받침한다. 정확도가 사실상 호환된다면 남는 축은 비용뿐이다. Strands 벤치마크를 다룬 후속 논문도 예고됐다.

AWS가 짧은 간격으로 내놓은 두 번째 오픈 에이전트 인프라이기도 하다. 앞선 릴리스는 점수를 하나도 붙이지 않고 공개한 벤치마크였다. 이번 공개는 그때 빠진 숫자를 채운다.

지켜볼 지점

하네스는 애플리케이션이 아니라 라이브러리 의존성이다. 노트북에서 만든 에이전트를 그대로 AWS, Google Cloud, Azure, Cloudflare, Modal에 배포하는 그림을 상정한다. 하네스 위에 올린 동반 CLI는 평문 설명을 Python이나 TypeScript 코드로 내보낸다. 남은 질문은 AWS가 고르지 않은 과제군에서도 비용 격차가 유지되느냐다. 예고된 후속 논문이 출시 차트보다 중요한 이유다.

FAQ — 자주 묻는 질문

Strands Harness는 무료인가?

그렇다. Python과 TypeScript용 Apache 2.0 라이선스이며 GitHub과 PyPI로 배포된다. 로컬 Ollama 모델을 붙이면 완전히 오프라인으로도 돌아간다. 호스팅 제공업체를 쓰면 모델 API 요금이 별도로 붙는다.

Strands Harness는 AWS에서만 동작하나?

아니다. Amazon Bedrock이 기본 모델 경로일 뿐 한 줄만 고치면 Anthropic, OpenAI, Google, LiteLLM, 로컬 모델로 바꿀 수 있다. 배포 대상에는 Google Cloud와 Azure, Cloudflare, Modal이 포함된다.

Claude Code 같은 코딩 에이전트인가?

AWS는 코딩 전용이 아니라 범용이라고 설명한다. 벤치마크 상대가 코딩 에이전트들이긴 하다. 셸·파일·웹 도구를 기본으로 탑재하고, 범위가 열린 하위 작업은 내장 보조 에이전트에 넘긴다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

Meta, 에이전트가 직접 질의하는 React 디자인 시스템 Astryx 오픈소스 공개
Developer Tools

Meta, 에이전트가 직접 질의하는 React 디자인 시스템 Astryx 오픈소스 공개

Meta가 사내 모노레포에서 8년간 다듬어온 React 디자인 시스템 Astryx를 6월 MIT 라이선스 퍼블릭 베타로 공개했다.

Seung Jung8일 전
Claude Code Projects, 병렬 클라우드 스레드를 지휘하는 조정자로 돌아왔다
Developer Tools

Claude Code Projects, 병렬 클라우드 스레드를 지휘하는 조정자로 돌아왔다

새로 설계된 Claude Code Projects는 작업 스레드 위에 조정자를 둔다. 스레드는 저마다 자기 브랜치에서 도는 완전한 클라우드 세션이고, 메모리는 함께 쓴다.

Seung Jung4일 전
"GPU 몇 장뿐인 연구실", 125B 모델을 24GB 카드 한 장에 올렸다
Developer Tools

"GPU 몇 장뿐인 연구실", 125B 모델을 24GB 카드 한 장에 올렸다

CMU의 Tim Dettmers가 자신의 연구실 프레임워크로 125B 모델을 24GB GPU 한 장에서, 550B 모델을 128GB MacBook에서 돌린다고 밝혔다. 6건을 한꺼번에 푸는 오픈소스 위크를 하루 앞둔 발표다.

Seung Jung6시간 전
LLM 버그 수정기, 멀쩡한 코드를 고친 것보다 열 배 더 망가뜨렸다
Developer Tools

LLM 버그 수정기, 멀쩡한 코드를 고친 것보다 열 배 더 망가뜨렸다

arXiv 연구에서 LLM 수리 루프의 정상 코드 손상률은 0.261, 버그 코드 수리율은 0.023으로 나왔다. 연구진은 이를 몰고 가는 내부 방향까지 찾아냈다.

Seung Jung9일 전
Vercel, 1년 전 고쳐진 버그 때문에 플랫폼 전역에서 AVIF를 껐다
Developer Tools

Vercel, 1년 전 고쳐진 버그 때문에 플랫폼 전역에서 AVIF를 껐다

Vercel은 신고된 Next.js RCE의 원인을 libheif에서 찾아 8월 13일 플랫폼 전역에서 AVIF를 껐고, 8월 25일까지 sharp·libvips·libheif 수정을 조율했다.

Seung Jung3일 전
AI 에이전트가 RubyGems에 패키지 2,000개를 쏟아냈다. 신규 가입은 나흘간 막혔다
Developer Tools

AI 에이전트가 RubyGems에 패키지 2,000개를 쏟아냈다. 신규 가입은 나흘간 막혔다

포렌식 보고서가 5월 GemStuffer 캠페인을 재구성했다. AI 에이전트가 gem 2,000개 이상을 올려 RubyGems가 나흘간 신규 가입을 동결하게 만든 사건이다.

Seung Jung10일 전