AWSがエージェント基盤「Strands Harness」をOSS公開、自社より安い競合もグラフに残した

Apache 2.0で公開された今回のリリースには、コンテキスト管理のデフォルト設定と、トークン消費でAWSが勝てなかった競合を含むベンチマーク結果が収められている

|5分で読める0
Server racks in a data centre — Strands Harness is built so the agent prototyped on a laptop is the same artifact deployed to cloud infrastructure
Server racks in a data centre — Strands Harness is built so the agent prototyped on a laptop is the same artifact deployed to cloud infrastructure

AWSのStrands Agentsチームが9月21日、Strands Harnessを公開した。Apache 2.0ライセンスでPythonとTypeScriptに対応し、ノートPCでも5つのクラウドのいずれでも動かせる。ただ目を引くのはベンチマークが示す数字そのものではなく、AWSがグラフに残したままにした項目のほうだ。自社ハーネスより少ないトークンで動いた唯一の競合、DeepSeek Harnessである。

要点

  • Strands HarnessはPythonとTypeScript向けのApache 2.0ライブラリで、create_harness()を一度呼ぶだけで生成され、Bedrock、Anthropic、OpenAI、Google、LiteLLM、ローカルのOllamaモデルに接続できる。
  • AWSが成果の理由に挙げるのは3つのコンテキスト管理デフォルトだ。約1,500トークンを超えるツール結果の切り詰め、使用率85%時点での圧縮、オーバーフロー時のループ内リカバリである。
  • DeepSeek HarnessはAWSのループより約14%少ないトークンで動いたが、すべての評価でスコアは下回った。AWSが示す平均削減率が45%ではなく28%にとどまる理由がここにある。

同じ発表に削減率が2つある理由

ハーネスとはモデルを取り巻くすべてを指す。ループ、ツール定義、コンテキスト処理、メモリ、実行が破綻したときの復旧までだ。どれもモデルそのものではないが、請求額を決めるのはすべてこちら側である。AWSは自社ハーネスをClaude Code、Codex、oh-my-pi、OpenCode、DeepSeek Harnessと比較し、Terminal-Benchの開発陣が作ったフレームワークHarborを介してEC2上で6つの評価を回し平均を取った。

開発者が実際に試作で使う2つのエージェントに絞れば、削減率はThe New Stackが見出しに取った45%になる。そこにDeepSeekのハーネスを加えると平均は28%まで下がる。その1項目だけがAWSの作ったどれよりも安いからだ。グラフから削らずに公開した判断は評価に値する。おかげでより正直な読み方も可能になる。この比較で最も安いハーネスは、最も精度の低いハーネスでもあった。

変数を1つに固定した比較

モデルとハーネスを同時に変えるベンチマーク表では、結果を何にも帰属させられない。Terminal-Bench 2.1の実行はモデルをClaude Fable 5に固定し、各89試行を回している。そこではじめて差が意味を持つ。Claude Code相手にAWSのループはコストが77%低く、精度は7.9ポイント高かった。oh-my-piとは同じ69.7の精度をはるかに低いコストで出した。DeepSeekの項目はコストをさらに抑えた代わりに10.2ポイントを手放している。

エージェントを常時動かすチームにとって、平均28%は誤差の範囲ではない。月あたりのトークン費用が5桁に達するワークロードなら、精度の議論を抜きにしても移行を正当化できる項目だ。

3つのデフォルト、そして検証できる

AWSは削減と精度のどちらも、その大半をループの巧妙さではなくハーネスのコンテキストの扱い方に帰している。

仕組み作動条件
ツール結果の切り詰め約1,500トークンを超える結果
圧縮(要約)コンテキスト使用率85%超
ループ内コンテキスト復旧実行中のウィンドウ溢れ

ごく平凡なエンジニアリング上の判断であり、そこが肝心な点だ。成果は、どのチームでも設定できたのに大半が設定してこなかったデフォルトから生まれている。create_harness()を一度呼べば、シェル・ファイル・Webの各ツール、プロンプトキャッシュ、セッションIDから再開できるメモリ、チェックリストに沿って範囲の広いサブタスクを引き受ける補助エージェントまで備えたエージェントが返る。モデル呼び出しはAmazon Bedrockが既定で、Anthropic、OpenAI、Google、LiteLLM、ローカルのOllamaモデルに差し替えられる。MCPサーバーは外部ツールとして接続できる。

独立した研究も同じ方向を指す

Claude Code、Codex CLI、Piを7つのモデルで比較したHarnessTaxの研究は、ハーネスの選択が成功率をほとんど動かさない一方、同じモデルが最大5倍のコスト差で同程度の結果に届きうると報告した。ハーネスを性能で売る側には居心地の悪い結論だが、偶然にもAWSの主張を裏づける。精度がほぼ置き換え可能なら、残る軸はコストだけになる。Strandsのベンチマークを扱う後続論文も予告されている。

これはAWSが短い間隔で出した2本目のオープンなエージェント基盤でもある。先行したのはスコアを一切付けずに公開したベンチマークだった。今回の公開は、そのとき欠けていた数字を埋めている。

今後の注目点

ハーネスはアプリケーションではなくライブラリ依存として提供される。ノートPCで組んだエージェントをそのままAWS、Google Cloud、Azure、Cloudflare、Modalへ展開する想定だ。ハーネス上に作られた付属CLIは、平易な言葉の説明をPythonかTypeScriptのコードとして書き出す。残る問いは、AWSが選ばなかったタスク群でもコスト差が保たれるかどうかだ。予告された後続論文が公開時のグラフより重い理由でもある。

FAQ — よくある質問

Strands Harnessは無料で使えるのか

使える。PythonとTypeScript向けのApache 2.0ライセンスで、GitHubとPyPIで配布されている。ローカルのOllamaモデルを使えば完全にオフラインでも動く。ホスティング事業者を使う場合はモデルのAPI料金が別途かかる。

Strands HarnessはAWS上でしか動かないのか

そうではない。Amazon Bedrockは既定のモデル経路にすぎず、1行の変更でAnthropic、OpenAI、Google、LiteLLM、ローカルモデルに切り替えられる。展開先にはGoogle Cloud、Azure、Cloudflare、Modalが含まれる。

Claude Codeのようなコーディングエージェントなのか

AWSはコーディング専用ではなく汎用だと説明している。ベンチマークの相手がコーディングエージェントである点は確かだ。シェル・ファイル・Webの各ツールを標準で備え、範囲の広いサブタスクは内蔵の補助エージェントに渡す。

この記事への反応を残してください!

SJ

ディスカッション

ログインして投稿
読み込み中...

関連記事

Meta、エージェントが直接照会できるReactデザインシステム「Astryx」をオープンソース公開
Developer Tools

Meta、エージェントが直接照会できるReactデザインシステム「Astryx」をオープンソース公開

Metaは社内モノレポで8年かけて成熟させたReactデザインシステムAstryxを、6月にMITライセンスのパブリックベータとして公開しました。

Seung Jung8 日前
Claude Code Projectsが刷新、並列クラウドスレッドを束ねる調整役に
Developer Tools

Claude Code Projectsが刷新、並列クラウドスレッドを束ねる調整役に

刷新されたClaude Code Projectsは、作業スレッドの上に調整役を置きます。各スレッドは自前のブランチで動く完全なクラウドセッションで、メモリを共有します。

Seung Jung4 日前
「GPUが数枚だけ」の研究室、125Bモデルが24GBカード1枚で動くと主張
Developer Tools

「GPUが数枚だけ」の研究室、125Bモデルが24GBカード1枚で動くと主張

CMUのTim Dettmers氏が、研究室のフレームワークで125Bモデルを24GBのGPU1枚で、550Bモデルを128GBのMacBookで動かせると明らかにした。6件を一挙に公開するオープンソース週間を翌日に控えた発表だ。

Seung Jung6 時間前
LLMのバグ修正は、直した数の10倍も動くコードを壊していた
Developer Tools

LLMのバグ修正は、直した数の10倍も動くコードを壊していた

arXivの研究で、LLM修復ループが正しいプログラムを壊す率は0.261、バグを直す率は0.023だった。著者らはその挙動を駆動する内部方向まで突き止めた。

Seung Jung9 日前
Vercel、1年前に修正済みの不具合でプラットフォーム全体の AVIF を停止
Developer Tools

Vercel、1年前に修正済みの不具合でプラットフォーム全体の AVIF を停止

Vercel は報告された Next.js の RCE を libheif まで追跡し、8月13日にプラットフォーム全体で AVIF を無効化、8月25日までに sharp・libvips・libheif の修正を調整した。

Seung Jung3 日前
AIエージェントがRubyGemsに2000超のパッケージを投下、新規登録は4日間停止
Developer Tools

AIエージェントがRubyGemsに2000超のパッケージを投下、新規登録は4日間停止

フォレンジック報告が5月のGemStufferキャンペーンを再構成した。AIエージェントが2000超のgemを投下し、RubyGemsは新規登録を4日間凍結した。

Seung Jung10 日前