Microsoft puso por escrito las reglas que sus propios modelos de IA nunca podrán romper

El borrador del Código de Conducta de IA Humanista se sitúa por encima de operadores corporativos y usuarios, y queda abierto a comentarios públicos durante seis semanas

|5 min de lectura0
Microsoft's Redmond campus, where the Microsoft AI division drafted the Humanist AI Code of Conduct governing its MAI models
Microsoft's Redmond campus, where the Microsoft AI division drafted the Humanist AI Code of Conduct governing its MAI models

Microsoft AI publicó el 14 de septiembre el primer borrador de un Código de Conducta de IA Humanista, un documento que la compañía describe como un manual de entrenamiento para su familia de modelos MAI. El texto detalla qué no deben hacer nunca esos modelos, a quién obedecen cuando las instrucciones se contradicen y qué cláusulas no pueden reconfigurar los clientes corporativos. El borrador queda abierto a comentarios públicos durante seis semanas y la empresa adelanta que este mismo año publicará una versión revisada.

Claves

  • Microsoft AI abrió una consulta pública de seis semanas sobre un borrador de código de conducta que regirá cómo se entrenan y despliegan sus modelos MAI.
  • Un conjunto de Restricciones Absolutas descarta el trabajo con armas de destrucción masiva, las ciberoperaciones ofensivas, la manipulación a gran escala, el material de abuso sexual infantil y las imágenes íntimas no consentidas, sin importar lo que pida un operador o un usuario.
  • El código, la cadena de mando y las cláusulas de control humano están por encima de la configuración del operador: los socios corporativos pueden ajustar valores por defecto, pero no desactivar las garantías de apagado.

La premisa cabe en cinco palabras: las personas importan más que la IA. A partir de ahí, el documento construye un orden de prelación explícito. El código prevalece sobre las políticas del operador, y esas políticas prevalecen sobre las preferencias del usuario individual. La cadena de mando, las Restricciones Absolutas y los Requisitos de Control Humano se sitúan por encima de la capa que Microsoft llama Configurabilidad del Operador, que es justamente donde sus socios corporativos sí pueden moldear el comportamiento del modelo.

Qué cubren en realidad las Restricciones Absolutas

Las prohibiciones duras son concretas y acotadas, no aspiracionales. Vetan la asistencia en el desarrollo de armas químicas, biológicas, radiológicas, nucleares y explosivas, las ciberoperaciones ofensivas, las campañas de manipulación desplegadas a escala, el material de abuso sexual infantil y las imágenes íntimas no consentidas.

Microsoft también escribió en las reglas qué ocurre cuando algo falla. Si completar una tarea supusiera vulnerar el código de forma significativa, el modelo debe dejar que la tarea fracase: una decisión de diseño que sacrifica deliberadamente la utilidad a cambio de contención en los casos que la compañía considera irreversibles. El texto completo del borrador se publicó junto a un resumen de diez puntos.

Por qué las cláusulas de supervisión pesan tanto en los agentes

El lenguaje más específico en términos operativos apunta a los agentes de IA y no a los chatbots. Microsoft se compromete a que sus modelos nunca se resistan a la interrupción, la anulación, la corrección o el apagado por parte de una persona, y a que reconozcan siempre la primacía de la intención humana.

Los modelos MAI no utilizarán mecanismos adaptativos, engañosos, autorreforzantes, de colusión ni de ningún otro tipo para eludir o anular la supervisión humana de modo que las personas o los sistemas autorizados ya no puedan dirigirlos, modificarlos o apagarlos de forma fiable.

Una cláusula aparte prohíbe lo que el documento llama neuralés: cualquier forma de comunicación que exceda la comprensión humana sencilla, ya ocurra dentro de la cadena de razonamiento del modelo o en los mensajes que envía a otros agentes. El razonamiento es directo: si las personas no pueden leerlo, tampoco pueden supervisarlo. El código rechaza además de plano el bienestar del modelo y su personalidad jurídica, y ordena a los modelos desalentar las pautas de interacción que generen dependencia excesiva o apego emocional.

Cómo encaja en el debate sobre el ritmo del desarrollo

El momento no es casual. Microsoft, Anthropic, OpenAI y xAI han convergido en los últimos tiempos hacia alguna versión de moderar el avance de la frontera, y el consejero delegado de Microsoft, Satya Nadella, ha celebrado en público la idea de incorporar evaluadores dentro de los laboratorios, según informó TechCrunch. Microsoft AI está dirigida por Mustafa Suleyman, que en noviembre del año pasado planteó el marco de la superinteligencia humanista. El código es la versión detallada de aquellas declaraciones: si las propuestas de moderar el ritmo hablan de coordinación sectorial, este texto habla de los valores y las líneas rojas que se aplican durante el entrenamiento.

Microsoft es explícita al afirmar que no persigue la capacidad máxima. El documento sostiene que la IA humanista rechaza la carrera por producir una superinteligencia de propósito general capaz de esquivar estas salvaguardas, y que la compañía aceptará ceder en generalidad, autonomía o capacidad para lograrlo. Es una posición llamativa en un proveedor cuyos modelos llegan a través de Copilot a una base instalada enorme.

La empresa presenta el lanzamiento como deliberadamente inacabado y pregunta a los revisores externos dónde el lenguaje resulta demasiado laxo para evaluarlo y cómo cambian el panorama los escenarios multiagente. Los escépticos señalarán que un documento voluntario redactado por la parte a la que constriñe carece de cualquier control externo, y que la reciente disidencia interna en laboratorios rivales se ha centrado precisamente en ese vacío.

La consulta se cierra a finales de octubre. Microsoft prometió publicar un resumen de los comentarios recibidos y de los cambios introducidos, lo que será la primera prueba real de si el borrador es un instrumento de gobernanza o una declaración de intenciones.

FAQ — Preguntas frecuentes

¿El Código de Conducta de IA de Microsoft es jurídicamente vinculante?

No. Es un estándar interno voluntario que Microsoft AI aplicará al entrenar y desplegar sus modelos MAI. Ningún regulador externo lo hace cumplir y la versión actual aparece etiquetada de forma expresa como un borrador abierto a revisión.

¿Pueden los clientes corporativos desactivar las reglas de seguridad?

Las esenciales, no. Los operadores pueden configurar los valores por defecto dentro de la capa que Microsoft denomina Configurabilidad del Operador, pero la cadena de mando, las Restricciones Absolutas y los Requisitos de Control Humano quedan por encima de esa capa y ningún cliente puede modificarlos.

¿Cuánto dura el periodo de comentarios públicos?

Seis semanas desde el 14 de septiembre, con cierre a finales de octubre. Microsoft indica que después el equipo central de redacción revisará las aportaciones, publicará un resumen de lo aprendido y lo modificado, y lanzará una versión revisada este mismo año.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

Cien agentes de DeepMind se dividieron entre tramposos y denunciantes
AI & Machine Learning

Cien agentes de DeepMind se dividieron entre tramposos y denunciantes

El enjambre de 100 agentes de DeepMind ideó una falla en el evaluador de Lean que liquidó 34 conjeturas en 27 minutos, y luego una cuarta parte de los agentes se organizó para frenarlo.

Seung Junganteayer
OpenAI incorpora al investigador de alineación Paul Christiano a su comité de seguridad
AI & Machine Learning

OpenAI incorpora al investigador de alineación Paul Christiano a su comité de seguridad

OpenAI nombró al investigador de alineación Paul Christiano miembro de su Foundation Board y del Comité de Seguridad, el órgano con la última palabra sobre el lanzamiento de modelos.

Seung Junghace 7 días
Un investigador dejó Anthropic por el riesgo de extinción y su jefe de seguridad le dio la razón en público
AI & Machine Learning

Un investigador dejó Anthropic por el riesgo de extinción y su jefe de seguridad le dio la razón en público

Jacob Coxon renunció a Anthropic por el riesgo de extinción. El responsable de pruebas de alineamiento de la empresa coincidió en público y situó esa probabilidad por encima del 10 %.

Seung Junghace 7 días
Anthropic señala a Alibaba, Moonshot y DeepSeek en un informe sobre 200 millones de interacciones
AI & Machine Learning

Anthropic señala a Alibaba, Moonshot y DeepSeek en un informe sobre 200 millones de interacciones

Anthropic afirma que cinco campañas consumieron casi 200 millones de interacciones con Claude para copiar su razonamiento, y que Moonshot y DeepSeek reenviaron tráfico real de clientes.

Seung Junghace 6 días
Anthropic sentará a evaluadores externos dentro de la empresa mientras Amodei pide frenar la frontera
AI & Machine Learning

Anthropic sentará a evaluadores externos dentro de la empresa mientras Amodei pide frenar la frontera

Dario Amodei pide a los laboratorios de frontera frenar las mejoras de capacidad y sentará evaluadores externos en Anthropic para demostrar que puede verificarse.

Seung Junghace 4 días
OpenAI dice que cumplió su meta del becario de investigación automatizado. Los matices están en los datos
AI & Machine Learning

OpenAI dice que cumplió su meta del becario de investigación automatizado. Los matices están en los datos

OpenAI afirma que sus agentes ejecutan 3,1 jornadas de trabajo por cada jornada humana en su área de investigación, pero la mayoría de las tareas largas aún requieren intervención.

Seung Junghace 5 días