AWS의 Strands Agents 팀이 9월 21일 Strands Harness를 공개했다. Apache 2.0 라이선스로 Python과 TypeScript를 지원하고, 노트북에서도 5개 클라우드 어디에서도 배포할 수 있다. 정작 눈에 띄는 것은 벤치마크 차트가 내세운 수치가 아니라 AWS가 차트에 그대로 남겨둔 항목이다. 자사 하네스보다 적은 토큰으로 돌아간 유일한 경쟁자, DeepSeek Harness다.
핵심 요약
- Strands Harness는 Python·TypeScript용 Apache 2.0 라이브러리다.
create_harness()호출 한 번으로 만들어지며 Bedrock, Anthropic, OpenAI, Google, LiteLLM, 로컬 Ollama 모델로 연결된다. - AWS가 성과의 원인으로 지목한 것은 세 가지 컨텍스트 관리 기본값이다. 1,500토큰을 넘는 도구 결과 잘라내기, 컨텍스트 사용률 85% 시점의 압축, 오버플로 발생 시 루프 내 복구다.
- DeepSeek Harness는 AWS 루프보다 토큰을 약 14% 적게 썼지만 모든 평가에서 더 낮은 점수를 받았다. AWS가 내세운 평균 절감폭이 45%가 아니라 28%에 머무른 이유다.
같은 발표에 절감 수치가 두 개인 이유
하네스는 모델을 둘러싼 모든 것을 가리킨다. 루프, 도구 정의, 컨텍스트 처리, 메모리, 실행이 어긋났을 때의 복구까지다. 어느 것도 모델 자체는 아니지만 청구서를 결정하는 쪽은 전부 이 영역이다. AWS는 자사 하네스를 Claude Code, Codex, oh-my-pi, OpenCode, DeepSeek Harness와 붙였다. Terminal-Bench 제작진이 만든 프레임워크 Harbor를 통해 EC2에서 6개 평가를 돌려 평균을 냈다.
개발자가 실제로 프로토타이핑에 쓰는 두 에이전트로 범위를 좁히면 절감폭은 The New Stack이 제목으로 뽑은 45%가 된다. 여기에 DeepSeek의 하네스까지 넣으면 평균은 28%로 내려간다. 그 항목 하나가 AWS가 만든 어떤 것보다 저렴하기 때문이다. 차트에서 지우는 대신 그대로 공개한 선택은 짚어둘 만하다. 덕분에 더 정직한 독법도 가능해진다. 이 비교에서 가장 싼 하네스는 가장 부정확한 하네스이기도 했다.
변수를 하나로 묶은 비교
모델과 하네스를 동시에 바꾸는 벤치마크 표로는 결과를 어디에도 귀속할 수 없다. Terminal-Bench 2.1 실행은 모델을 Claude Fable 5로 고정하고 각각 89회를 돌렸고, 그제서야 차이가 의미를 얻는다. Claude Code를 상대로 AWS 루프는 비용이 77% 낮았고 정확도는 7.9포인트 높았다. oh-my-pi와는 같은 69.7 정확도를 훨씬 적은 비용으로 냈다. DeepSeek의 항목은 비용을 더 아꼈지만 그 대가로 10.2포인트를 내줬다.
에이전트를 상시 돌리는 팀에게 평균 28%는 반올림 오차가 아니다. 월 토큰 비용이 다섯 자릿수에 이르는 워크로드라면 정확도 논쟁을 빼고도 마이그레이션을 정당화할 만한 항목이다.
기본값 세 가지, 그리고 검증 가능하다
AWS는 절감과 정확도의 공을 대부분 루프의 영리한 설계가 아니라 하네스가 컨텍스트를 다루는 방식에 돌린다.
| 메커니즘 | 발동 조건 |
|---|---|
| 도구 결과 잘라내기 | 약 1,500토큰을 넘는 결과 |
| 압축(요약) | 컨텍스트 사용률 85% 초과 |
| 루프 내 컨텍스트 복구 | 실행 도중 윈도 오버플로 |
평범한 엔지니어링 판단이고, 바로 그 점이 핵심이다. 성과는 어느 팀이든 설정할 수 있었지만 대체로 설정하지 않았던 기본값에서 나왔다. create_harness() 호출 한 번이면 셸·파일·웹 도구, 프롬프트 캐싱, 세션 ID로 이어받는 메모리, 체크리스트를 기준으로 범위가 열린 하위 작업을 떠맡는 보조 에이전트까지 갖춘 에이전트가 나온다. 모델 호출은 Amazon Bedrock이 기본이고 Anthropic, OpenAI, Google, LiteLLM, 로컬 Ollama 모델로 바꿔 끼울 수 있다. MCP 서버는 외부 도구로 붙는다.
독립 연구도 같은 곳을 가리킨다
Claude Code와 Codex CLI, Pi를 7개 모델에 걸쳐 비교한 HarnessTax 연구는 하네스 선택이 성공률을 거의 바꾸지 못한다는 결과를 내놨다. 반면 같은 모델이 최대 5배의 비용 차이로 비슷한 결과에 도달할 수 있었다. 하네스를 성능으로 파는 쪽에는 불편한 결론이지만, 공교롭게도 AWS의 메시지를 뒷받침한다. 정확도가 사실상 호환된다면 남는 축은 비용뿐이다. Strands 벤치마크를 다룬 후속 논문도 예고됐다.
AWS가 짧은 간격으로 내놓은 두 번째 오픈 에이전트 인프라이기도 하다. 앞선 릴리스는 점수를 하나도 붙이지 않고 공개한 벤치마크였다. 이번 공개는 그때 빠진 숫자를 채운다.
지켜볼 지점
하네스는 애플리케이션이 아니라 라이브러리 의존성이다. 노트북에서 만든 에이전트를 그대로 AWS, Google Cloud, Azure, Cloudflare, Modal에 배포하는 그림을 상정한다. 하네스 위에 올린 동반 CLI는 평문 설명을 Python이나 TypeScript 코드로 내보낸다. 남은 질문은 AWS가 고르지 않은 과제군에서도 비용 격차가 유지되느냐다. 예고된 후속 논문이 출시 차트보다 중요한 이유다.
FAQ — 자주 묻는 질문
Strands Harness는 무료인가?
그렇다. Python과 TypeScript용 Apache 2.0 라이선스이며 GitHub과 PyPI로 배포된다. 로컬 Ollama 모델을 붙이면 완전히 오프라인으로도 돌아간다. 호스팅 제공업체를 쓰면 모델 API 요금이 별도로 붙는다.
Strands Harness는 AWS에서만 동작하나?
아니다. Amazon Bedrock이 기본 모델 경로일 뿐 한 줄만 고치면 Anthropic, OpenAI, Google, LiteLLM, 로컬 모델로 바꿀 수 있다. 배포 대상에는 Google Cloud와 Azure, Cloudflare, Modal이 포함된다.
Claude Code 같은 코딩 에이전트인가?
AWS는 코딩 전용이 아니라 범용이라고 설명한다. 벤치마크 상대가 코딩 에이전트들이긴 하다. 셸·파일·웹 도구를 기본으로 탑재하고, 범위가 열린 하위 작업은 내장 보조 에이전트에 넘긴다.






