El equipo de Strands Agents de AWS publicó Strands Harness el 21 de septiembre bajo licencia Apache 2.0, para Python y TypeScript, con despliegue tanto en una laptop como en cualquiera de cinco nubes. Lo más llamativo no es lo que afirma el gráfico comparativo, sino lo que AWS decidió dejar en él: DeepSeek Harness, el único participante que funcionó con menos tokens que su propio desarrollo.
Claves del anuncio
- Strands Harness es una biblioteca Apache 2.0 para Python y TypeScript que se instancia con una sola llamada a
create_harness()y se conecta a Bedrock, Anthropic, OpenAI, Google, LiteLLM o un modelo local de Ollama. - AWS atribuye sus resultados a tres valores predeterminados de gestión de contexto: truncado de los resultados de herramientas por encima de unos 1.500 tokens, compactación al alcanzar el 85% de la ventana y recuperación dentro del bucle cuando esta se desborda.
- DeepSeek Harness consumió alrededor de un 14% menos de tokens que el bucle de AWS, pero obtuvo peor puntuación en todas las evaluaciones. Por eso el ahorro promedio que informa AWS queda en 28% y no en 45%.
Por qué el mismo lanzamiento trae dos cifras de ahorro
Un harness es todo lo que envuelve al modelo: el bucle, la definición de herramientas, el manejo del contexto, la memoria y la recuperación cuando una ejecución se descarrila. Nada de eso es el modelo, y todo eso decide la factura. AWS midió su versión contra Claude Code, Codex, oh-my-pi, OpenCode y DeepSeek Harness, promediando seis evaluaciones ejecutadas en EC2 a través de Harbor, el framework creado por los autores de Terminal-Bench.
Si la comparación se limita a los dos agentes con los que la mayoría de los desarrolladores prototipa, el ahorro es el 45% que The New Stack destacó en su titular. Al ampliar el campo con el harness de DeepSeek, el promedio cae a 28%, porque esa única entrada resulta más barata que cualquier cosa construida por AWS. Publicarla en lugar de recortar el gráfico es una decisión que merece señalarse, y además habilita la lectura más honesta: el harness más barato de la comparación también fue el menos preciso.
La comparación que aísla la variable
Una tabla que cambia a la vez el modelo y el harness no permite atribuir nada. La ronda de Terminal-Bench 2.1 fija el modelo —Claude Fable 5, con 89 intentos cada uno— y recién entonces las diferencias significan algo. Frente a Claude Code, el bucle de AWS resultó 77% más barato y 7,9 puntos más preciso. Frente a oh-my-pi alcanzó la misma precisión de 69,7 por bastante menos dinero. La entrada de DeepSeek ahorró más y cedió 10,2 puntos a cambio.
Para un equipo que ejecuta agentes de forma continua, un promedio de 28% no es un margen de redondeo. En una carga de trabajo que factura cinco cifras mensuales en tokens, esa línea del presupuesto justifica una migración por sí sola, al margen de cualquier discusión sobre precisión.
Tres valores predeterminados, y son auditables
AWS atribuye la mayor parte del ahorro y de la precisión a cómo el harness administra el contexto, más que a alguna astucia en el bucle.
| Mecanismo | Disparador |
|---|---|
| Truncado de resultados de herramientas | Resultados que superan unos 1.500 tokens |
| Compactación (resumen) | Uso del contexto por encima del 85% |
| Recuperación de contexto en el bucle | Desborde de la ventana durante la ejecución |
Son decisiones de ingeniería corrientes, y ese es justamente el punto: las mejoras vienen de ajustes que cualquier equipo podía haber configurado y en general no configuró. Una sola llamada a create_harness() devuelve un agente que ya trae herramientas de shell, archivos y web, caché de prompts, memoria que retoma a partir de un identificador de sesión y un agente auxiliar que absorbe subtareas abiertas siguiendo una lista de verificación. Las llamadas al modelo usan Amazon Bedrock por defecto y se redirigen a Anthropic, OpenAI, Google, LiteLLM o un modelo local de Ollama, con servidores MCP disponibles como herramientas externas.
La investigación independiente apunta en la misma dirección
El estudio HarnessTax, que comparó Claude Code, Codex CLI y Pi sobre siete modelos, encontró que la elección del harness apenas mueve las tasas de éxito, mientras que un mismo modelo puede llegar a resultados comparables con hasta cinco veces más de costo. Es un hallazgo incómodo para quien vende un harness por sus capacidades, y respalda el argumento de AWS: si la precisión es prácticamente intercambiable, el gasto es el único eje que queda. Ya se anunció un artículo de seguimiento sobre las pruebas de Strands.
Es además el segundo lanzamiento de infraestructura abierta para agentes que AWS hace en poco tiempo, después del banco de pruebas que publicó sin acompañarlo de ninguna puntuación. Esta versión aporta los números que aquella se guardó.
Qué queda por confirmar
Como el harness es una dependencia de biblioteca y no una aplicación, el agente construido en una laptop debería ser el mismo artefacto que se despliega en AWS, Google Cloud, Azure, Cloudflare o Modal. Una CLI complementaria, construida sobre el propio harness, convierte una descripción en lenguaje común en código exportable de Python o TypeScript. La incógnita es si la diferencia de costo se sostiene en conjuntos de tareas que AWS no eligió, y por eso el artículo prometido pesa más que el gráfico del lanzamiento.
Preguntas frecuentes
¿Strands Harness es gratuito?
Sí. Se distribuye con licencia Apache 2.0 para Python y TypeScript a través de GitHub y PyPI. Puede funcionar sin conexión contra un modelo local de Ollama; si se usa un proveedor alojado, los cargos por API del modelo corren aparte.
¿Strands Harness solo funciona en AWS?
No. Amazon Bedrock es la ruta de modelo por defecto y se cambia en una línea por Anthropic, OpenAI, Google, LiteLLM o un modelo local. Entre los destinos de despliegue admitidos están Google Cloud, Azure, Cloudflare y Modal.
¿Es un agente de programación como Claude Code?
AWS lo describe como de propósito general y no específico para programar, aunque sus rivales en las pruebas sean agentes de código. Llega con herramientas de shell, archivos y web, y delega las subtareas abiertas en un agente auxiliar integrado.






