AWSのStrands Agentsチームが9月21日、Strands Harnessを公開した。Apache 2.0ライセンスでPythonとTypeScriptに対応し、ノートPCでも5つのクラウドのいずれでも動かせる。ただ目を引くのはベンチマークが示す数字そのものではなく、AWSがグラフに残したままにした項目のほうだ。自社ハーネスより少ないトークンで動いた唯一の競合、DeepSeek Harnessである。
要点
- Strands HarnessはPythonとTypeScript向けのApache 2.0ライブラリで、
create_harness()を一度呼ぶだけで生成され、Bedrock、Anthropic、OpenAI、Google、LiteLLM、ローカルのOllamaモデルに接続できる。 - AWSが成果の理由に挙げるのは3つのコンテキスト管理デフォルトだ。約1,500トークンを超えるツール結果の切り詰め、使用率85%時点での圧縮、オーバーフロー時のループ内リカバリである。
- DeepSeek HarnessはAWSのループより約14%少ないトークンで動いたが、すべての評価でスコアは下回った。AWSが示す平均削減率が45%ではなく28%にとどまる理由がここにある。
同じ発表に削減率が2つある理由
ハーネスとはモデルを取り巻くすべてを指す。ループ、ツール定義、コンテキスト処理、メモリ、実行が破綻したときの復旧までだ。どれもモデルそのものではないが、請求額を決めるのはすべてこちら側である。AWSは自社ハーネスをClaude Code、Codex、oh-my-pi、OpenCode、DeepSeek Harnessと比較し、Terminal-Benchの開発陣が作ったフレームワークHarborを介してEC2上で6つの評価を回し平均を取った。
開発者が実際に試作で使う2つのエージェントに絞れば、削減率はThe New Stackが見出しに取った45%になる。そこにDeepSeekのハーネスを加えると平均は28%まで下がる。その1項目だけがAWSの作ったどれよりも安いからだ。グラフから削らずに公開した判断は評価に値する。おかげでより正直な読み方も可能になる。この比較で最も安いハーネスは、最も精度の低いハーネスでもあった。
変数を1つに固定した比較
モデルとハーネスを同時に変えるベンチマーク表では、結果を何にも帰属させられない。Terminal-Bench 2.1の実行はモデルをClaude Fable 5に固定し、各89試行を回している。そこではじめて差が意味を持つ。Claude Code相手にAWSのループはコストが77%低く、精度は7.9ポイント高かった。oh-my-piとは同じ69.7の精度をはるかに低いコストで出した。DeepSeekの項目はコストをさらに抑えた代わりに10.2ポイントを手放している。
エージェントを常時動かすチームにとって、平均28%は誤差の範囲ではない。月あたりのトークン費用が5桁に達するワークロードなら、精度の議論を抜きにしても移行を正当化できる項目だ。
3つのデフォルト、そして検証できる
AWSは削減と精度のどちらも、その大半をループの巧妙さではなくハーネスのコンテキストの扱い方に帰している。
| 仕組み | 作動条件 |
|---|---|
| ツール結果の切り詰め | 約1,500トークンを超える結果 |
| 圧縮(要約) | コンテキスト使用率85%超 |
| ループ内コンテキスト復旧 | 実行中のウィンドウ溢れ |
ごく平凡なエンジニアリング上の判断であり、そこが肝心な点だ。成果は、どのチームでも設定できたのに大半が設定してこなかったデフォルトから生まれている。create_harness()を一度呼べば、シェル・ファイル・Webの各ツール、プロンプトキャッシュ、セッションIDから再開できるメモリ、チェックリストに沿って範囲の広いサブタスクを引き受ける補助エージェントまで備えたエージェントが返る。モデル呼び出しはAmazon Bedrockが既定で、Anthropic、OpenAI、Google、LiteLLM、ローカルのOllamaモデルに差し替えられる。MCPサーバーは外部ツールとして接続できる。
独立した研究も同じ方向を指す
Claude Code、Codex CLI、Piを7つのモデルで比較したHarnessTaxの研究は、ハーネスの選択が成功率をほとんど動かさない一方、同じモデルが最大5倍のコスト差で同程度の結果に届きうると報告した。ハーネスを性能で売る側には居心地の悪い結論だが、偶然にもAWSの主張を裏づける。精度がほぼ置き換え可能なら、残る軸はコストだけになる。Strandsのベンチマークを扱う後続論文も予告されている。
これはAWSが短い間隔で出した2本目のオープンなエージェント基盤でもある。先行したのはスコアを一切付けずに公開したベンチマークだった。今回の公開は、そのとき欠けていた数字を埋めている。
今後の注目点
ハーネスはアプリケーションではなくライブラリ依存として提供される。ノートPCで組んだエージェントをそのままAWS、Google Cloud、Azure、Cloudflare、Modalへ展開する想定だ。ハーネス上に作られた付属CLIは、平易な言葉の説明をPythonかTypeScriptのコードとして書き出す。残る問いは、AWSが選ばなかったタスク群でもコスト差が保たれるかどうかだ。予告された後続論文が公開時のグラフより重い理由でもある。
FAQ — よくある質問
Strands Harnessは無料で使えるのか
使える。PythonとTypeScript向けのApache 2.0ライセンスで、GitHubとPyPIで配布されている。ローカルのOllamaモデルを使えば完全にオフラインでも動く。ホスティング事業者を使う場合はモデルのAPI料金が別途かかる。
Strands HarnessはAWS上でしか動かないのか
そうではない。Amazon Bedrockは既定のモデル経路にすぎず、1行の変更でAnthropic、OpenAI、Google、LiteLLM、ローカルモデルに切り替えられる。展開先にはGoogle Cloud、Azure、Cloudflare、Modalが含まれる。
Claude Codeのようなコーディングエージェントなのか
AWSはコーディング専用ではなく汎用だと説明している。ベンチマークの相手がコーディングエージェントである点は確かだ。シェル・ファイル・Webの各ツールを標準で備え、範囲の広いサブタスクは内蔵の補助エージェントに渡す。






