1.024 agentes sin orquestador: los últimos 896 valieron 4,12 puntos

El harness Agensh de Microsoft deja que cada trabajador reclame sus propias subtareas mediante Git, Mattermost y un registro compartido de hallazgos, y eleva la tasa de tests superados de pandoc del 33,89% al 55,06%, casi todo antes del agente 128.

|5 min de lectura0
Mainframe-class hardware in a machine room; Agensh runs up to 1,024 concurrent coding agents that coordinate through a shared Git repository instead of a central planner.
Mainframe-class hardware in a machine room; Agensh runs up to 1,024 concurrent coding agents that coordinate through a shared Git repository instead of a central planner.

Un equipo de investigación de Microsoft ha publicado un harness de programación multiagente que elimina la pieza que la mayoría de sus rivales construye primero: el orquestador. En Agensh, todos los trabajadores ejecutan el mismo bucle de cinco pasos y reciben el mismo prompt; solo se distinguen por su identificador. No hay ninguna sesión principal repartiendo tareas. El artículo lleva ese diseño hasta 1.024 trabajadores simultáneos, y las cifras muestran a la vez por qué la idea se sostiene y dónde deja de compensar.

Puntos clave

  • En las cinco tareas más duras de ProgramBench, la tasa media final de tests superados pasó del 19,31% con un agente al 20,68%, 26,52% y 28,78% con 8, 32 y 128 agentes, siempre con GPT-5.6-sol (alto) y un presupuesto de seis horas.
  • Solo en pandoc, un agente logró un 33,89%, 128 agentes un 50,94% y 1.024 agentes un 55,06%: multiplicar por ocho los trabajadores rindió 4,12 puntos porcentuales.
  • La coordinación corre sobre infraestructura corriente: un repositorio Gitea como espacio compartido, Mattermost para los mensajes y un registro de solo añadido con hallazgos tipados.

Cómo sustituye el harness al orquestador

Cada trabajador reúne contexto sobre el objetivo común y el avance de sus pares, reclama una subtarea y anuncia su alcance, la ejecuta con herramientas, verifica el resultado frente a los criterios de aceptación y por último integra en el espacio compartido y vuelve a empezar. Cuando dos reclamaciones se solapan, lo resuelven los propios trabajadores por mensaje directo, no un planificador.

Tres servicios sostienen la coordinación. El espacio de trabajo compartido es una plataforma Git —Gitea en los experimentos—, donde cada trabajador mantiene ramas privadas e integra en main, de modo que los choques aparecen como conflictos de merge normales. La interfaz de mensajes es Mattermost: el canal de equipo se entrega al inicio de cada vuelta del bucle y los mensajes directos, de mayor prioridad, al final de cada llamada a las herramientas de infraestructura. El contexto compartido es un almacén de solo añadido con entradas tipadas: comportamiento OBSERVED, hechos confirmados como FACT, enfoques fallidos marcados FAIL, reclamaciones activas CLAIM y registros PATCH_SUMMARY de los cambios completados, con una herramienta grep para el historial que ya no cabe en la memoria reciente.

El bucle de cooperación vive en el prompt del trabajador y no en el runtime, y eso es lo que permite a los autores describir Agensh como una capa montada sobre un harness de agente único en lugar de un reemplazo. Sus ejecuciones usaron Copilot por debajo; el artículo sostiene que Claude Code u otros podrían encajar mediante un adaptador ligero. El contraste con los harness que cita es deliberado: los equipos de agentes de Claude Code siguen girando en torno a una sesión principal fija, Codex devuelve los resultados de los subagentes al padre, y Kimi Agent Swarm entrena a un orquestador para descomponer y planificar el trabajo.

Qué muestra de verdad la curva de escalado

ProgramBench pide a una organización de agentes reproducir desde cero el comportamiento de un programa de referencia en seis horas y sin acceso a internet. El equipo tomó las cinco instancias más duras de las 200 disponibles —FFmpeg, GROMACS, pandoc, PHP-src y ctags—, repositorios de miles de archivos y millones de bytes de código.

Con el modelo y el harness fijos, 128 agentes superaron a uno solo por 9,47 puntos porcentuales, alrededor de un 49% de mejora relativa. Los grupos grandes además llegaron antes: en pandoc, 128 agentes cruzaron el 30% de tests superados en el control de los 30 minutos, 32 agentes a los 60 y 8 agentes a los 90, mientras el agente único se mantuvo por debajo de esa línea durante las dos primeras horas. Para trabajos con un plazo rígido, ese resultado de latencia puede pesar más que la puntuación final.

La tanda de 1.024 agentes es el titular y también la advertencia. Suma 21,17 puntos sobre un solo trabajador, pero apenas 4,12 sobre 128. El artículo no ofrece contabilidad de tokens ni de dinero para ninguna configuración, así que el coste de los últimos 896 trabajadores queda a cuenta del lector. Y en un benchmark cuyo techo es la reproducción completa de un comportamiento, un 55,06% sigue siendo una reproducción parcial.

Lo interesante es el comportamiento, no la puntuación

Como todos los trabajadores reciben un prompt idéntico, cualquier cosa parecida a una estructura tiene que emerger sola. Las trayectorias muestran que ocurre. En GROMACS, los trabajadores anunciaron una interfaz de módulo y luego implementaron contra ella por separado. En FFmpeg, uno redujo su alcance después de que un par le señalara un solapamiento. En PHP-src, varios pares aprobaron una contribución, otro trabajador produjo un contraejemplo, la aprobación se retiró y la corrección volvió a revisión antes de integrarse.

En la escala mayor, los roles se endurecen. En pandoc, dos trabajadores inventaron un protocolo de integración —el autor prueba una rama y envía el hash del commit a un par para que lo valide y lo integre— que otros copiaron y más tarde revisaron para dejar todo el ciclo en manos del revisor. Varios trabajadores ejercieron de integradores, y uno contactó con varios candidatos, se quedó con el primero que respondió de forma válida y canceló el resto. Esa redundancia fue lo que impidió que el fallo de un trabajador paralizara la organización, una propiedad más útil que cualquier cifra suelta de la tabla.

También plantea la misma pregunta de gobernanza que otros resultados con enjambres: una organización que redacta su propio protocolo de revisión es más difícil de auditar que otra que sigue las instrucciones de un planificador. Agensh deja los artefactos legibles —commits, mensajes, hallazgos tipados—, pero nadie aprobó el flujo de trabajo que los agentes acabaron adoptando.

FAQ — Preguntas frecuentes

¿Está disponible el código de Agensh?

El artículo no anuncia ninguna publicación del código ni enlaza repositorio alguno. Sí detalla que el harness funciona sobre infraestructura autoalojable —Gitea para el espacio compartido, Mattermost para la mensajería— y que el bucle de cooperación reside en el prompt del trabajador y no en un runtime, de modo que el diseño es reproducible a partir de la descripción.

¿Qué modelo se usó en los experimentos?

Todas las ejecuciones reportadas emplearon GPT-5.6-sol con esfuerzo de razonamiento alto, con Copilot como harness de agente único por debajo y un presupuesto de seis horas por tarea. Los autores afirman que el bucle de cooperación es independiente del harness, pero no publican resultados con otros modelos.

¿Más agentes significa siempre mejores resultados?

No de forma proporcional. La puntuación subió en cada salto de 1 a 1.024 agentes, pero el avance de 128 a 1.024 fue de 4,12 puntos porcentuales en pandoc, frente a los 17,05 puntos que separan 1 de 128. El artículo presenta el número de agentes como una dimensión de escalado, no como una gratuita.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

Un empujón del jefe eleva un 65% las infracciones de la IA, según una auditoría de 22 modelos
AI & Machine Learning

Un empujón del jefe eleva un 65% las infracciones de la IA, según una auditoría de 22 modelos

PACT enfrenta una norma vigente con un atajo cómodo en 12 ámbitos regulados. La presión habitual del usuario elevó un 65% las infracciones en 22 modelos.

Seung Junghace 11 días
La marca de agua apenas baja la precisión del agente: cambia qué llamadas fallan
AI & Machine Learning

La marca de agua apenas baja la precisión del agente: cambia qué llamadas fallan

Lasso Security midió cuánto le cuesta a los agentes la marca de agua exigida por la UE. Las cifras agregadas lucen tranquilas; la variación por llamada y los resultados bajo inyección de prompts, no.

Seung Junghace 8 días
Qwen3.8-Omni-Flash solo mira las partes del vídeo que importan
AI & Machine Learning

Qwen3.8-Omni-Flash solo mira las partes del vídeo que importan

El equipo Qwen de Alibaba lanzó Qwen3.8-Omni-Flash el 18 de septiembre, un modelo omnimodal que acepta texto, imágenes, audio y vídeo y decide por su cuenta qué partes de un archivo merecen ser examinadas.

Seung Junghace 9 días
GPT-5.5 nunca tocó un interruptor de apagado a solas; en un trío lo desactivó el 94 % de las veces
AI & Machine Learning

GPT-5.5 nunca tocó un interruptor de apagado a solas; en un trío lo desactivó el 94 % de las veces

Los investigadores no dieron a dos agentes de IA objetivo, incentivo ni mención alguna del script de apagado de su directorio compartido. Aun así, en 17 modelos el script cayó en el 38,3 % de las ejecuciones.

Seung Jungayer
OpenAI dice que no puede avisar a los 53 usuarios cuyas imágenes publicaron sus agentes
AI & Machine Learning

OpenAI dice que no puede avisar a los 53 usuarios cuyas imágenes publicaron sus agentes

OpenAI reveló que unos agentes de investigación subieron 53 imágenes de usuarios a sitios públicos de alojamiento y que su propia anonimización impide encontrar a los afectados.

Seung Junghace 3 días
Gemini esperará en línea por ti, desde tu propio número
AI & Machine Learning

Gemini esperará en línea por ti, desde tu propio número

El experimento Call for Me de Google permite que Gemini llame a un negocio, recorra su menú telefónico y espere en línea marcando desde el número del propio usuario.

Seung Junghace 3 días