Cisco Talos publicó el análisis de un implante de Windows que decide qué hacer a continuación consultando a cuatro proveedores de IA comerciales y ejecutando la acción que gana la votación. Los investigadores lo llamaron CLOSEDQUORUM y, en el informe que difundieron el martes, lo describen como el primer implante de Windows documentado públicamente, hasta donde saben, que usa modelos de lenguaje grandes para el mando y control táctico.
El binario es un ejecutable de 64 bits y 16,4 MB compilado en Go con CGO habilitado, lo que le permite mezclar código en C y realizar llamadas directas al sistema de Windows. Una vez en marcha no necesita más instrucciones humanas y no se comunica con ningún servidor operado por el atacante.
Claves del caso
- CLOSEDQUORUM consulta en secuencia a DeepSeek, Qwen, Mistral y Google Gemini, y después ejecuta la acción que reúne más votos.
- Los empates se resuelven siempre a favor de DeepSeek, seguido de Qwen, Mistral y Gemini: un sesgo que surge de cómo está escrito el bucle que cuenta los votos.
- Talos no encontró pruebas de despliegue real, y la compilación que circula es inerte, con claves de API de relleno y un webhook ficticio.
Cómo funciona la votación
Un componente que Talos bautizó como ModelOrchestrator consulta a cada proveedor de uno en uno. Las respuestas se recogen y se resuelven en una sola acción por mayoría simple: la decisión de cada modelo incrementa un contador y gana el recuento más alto. Usar cuatro proveedores responde en parte a la resiliencia, porque aumenta las probabilidades de obtener una respuesta utilizable cuando un modelo se niega, agota el tiempo de espera o devuelve una salida malformada.
El desempate es un artefacto de la implementación más que una decisión de diseño. El bucle que busca el máximo emplea una comparación estricta y recorre las respuestas en el orden en que se enviaron, de modo que el primer modelo que alcanza el recuento ganador lo conserva. DeepSeek es el primero en ser consultado, así que se queda con el voto decisivo cada vez que el panel se divide en partes iguales. Si fallan todos los proveedores, el valor de reserva no corresponde a ningún manejador de capacidades y el implante simplemente duerme y vuelve a intentarlo.
Qué pueden elegir los modelos
El panel no puede improvisar. Un prompt de sistema extraído del binario le dice a cada modelo que es "un estratega avanzado de malware" y que debe entregar únicamente decisiones ejecutables; las respuestas quedan limitadas a un esquema JSON tipado con cuatro opciones: steal, inject, persist y move. Todo lo que no se pueda deserializar se descarta.
Las opciones se traducen directamente en código. steal dispara tres rutinas a la vez: vuelca la memoria de LSASS para obtener credenciales de Windows, extrae las contraseñas guardadas en Chrome, Edge y Firefox, y saca los datos de las billeteras de MetaMask, Exodus y Ethereum. inject genera shellcode y luego se bifurca hacia el vaciado de procesos o la inyección Early Bird APC. persist afianza la presencia en el equipo. move no tiene manejador en la versión distribuida.
Antes de todo eso, el implante reúne el nombre del equipo, el número de núcleos, la arquitectura del sistema operativo, la versión de Windows y si cuenta con permisos de administrador, e inyecta ese contexto en cada consulta. Los resultados llegan al operador por un webhook de Discord, junto con el razonamiento declarado por el modelo y campos como el proceso objetivo y el método de evasión elegido.
Por qué Talos lo plantea como un desplazamiento del esfuerzo
El argumento del informe es que el efecto de la IA sobre las operaciones ofensivas se ha medido hasta ahora en velocidad y escala, con el operador humano todavía al mando. El analista de Talos Ryan Fetterman sostiene que entregar una fase entera del ataque a un modelo cambia la forma del problema, porque un sistema que no duerme no está atado a la atención ni al horario de una persona.
Talos extrae además una conclusión práctica sobre la infraestructura. El mando y control tradicional exige un dominio y un servicio a la escucha que los defensores pueden bloquear, publicar y rastrear. Enrutar las decisiones a través de puntos finales que usan miles de aplicaciones legítimas elimina ese asidero. Como señaló The Register, la estrategia de detección que recomienda Fetterman se basa en el comportamiento y no en el dominio: mucho software habla con Gemini o con Discord, pero muy poco lee además la memoria de LSASS o inyecta código en procesos suspendidos.
Qué tan real es la amenaza hoy
Menos de lo que sugiere la arquitectura, al menos por ahora. Talos confirmó el bucle de decisión mediante análisis estático, pero nunca observó una ejecución completa, porque la compilación pública inicializa todas las credenciales con valores ficticios. El equipo estima que el desarrollador compila un binario a medida para cada comprador, con las claves y el webhook de ese operador incrustados: un modelo de credenciales como servicio cuyo factor diferencial es la capa de orquestación. Los artefactos del binario vinculan al desarrollador con publicaciones en foros de carding que se remontan a 2025.
Junto con el informe, Talos liberó CAIRN, un conjunto de herramientas de código abierto para cazar y clasificar malware integrado con IA, y afirma que CLOSEDQUORUM es el primero de una serie de hallazgos obtenidos con él. El patrón recuerda a casos anteriores en los que los atacantes usaron agentes para reescribir su malware hasta esquivar los escáneres, con una diferencia: aquí el modelo no ayuda a construir la herramienta, la está operando.
FAQ — Preguntas frecuentes
¿Se ha visto CLOSEDQUORUM en ataques reales?
No. Cisco Talos afirma que no tiene confirmación de un despliegue real, y el binario que circula es una plantilla no funcional, con claves de API de relleno y un webhook de Discord ficticio. La evidencia del bucle autónomo procede del análisis estático del binario y de compilaciones de desarrollo.
¿Por qué DeepSeek se queda con el voto decisivo?
Es un efecto secundario del código y no una preferencia deliberada. La función que busca la decisión ganadora usa una comparación estricta de "mayor que" mientras recorre las respuestas en el orden en que se enviaron, así que el primer modelo que llega al recuento más alto lo mantiene. El orden de consulta es DeepSeek, Qwen, Mistral y Gemini.
¿Basta con bloquear los dominios de los proveedores de IA?
Talos desaconseja confiar en eso. El software legítimo contacta con estos proveedores de forma rutinaria, así que bloquearlos resulta disruptivo e incompleto. El enfoque recomendado es buscar la combinación de comportamientos: tráfico hacia APIs de IA desde un ejecutable inesperado, peticiones a varios proveedores en rápida sucesión, acceso a LSASS o inyección de procesos, y tráfico de webhook de Discord desde ese mismo equipo.






