Microsoft, 자사 AI 모델이 절대 넘을 수 없는 선을 문서로 못박았다

휴머니스트 AI 행동 강령 초안은 기업 운영자와 사용자보다 상위에 놓이며, 6주간 공개 의견 수렴에 들어간다

|5분 읽기0
Microsoft's Redmond campus, where the Microsoft AI division drafted the Humanist AI Code of Conduct governing its MAI models
Microsoft's Redmond campus, where the Microsoft AI division drafted the Humanist AI Code of Conduct governing its MAI models

Microsoft AI가 9월 14일 휴머니스트 AI 행동 강령(Humanist AI Code of Conduct) 초안을 공개했다. 자사 MAI 모델 제품군을 위한 훈련 교본이라는 것이 회사의 설명이다. 문서는 모델이 결코 해서는 안 되는 행위, 지시가 충돌할 때 누구를 우선하는지, 기업 고객이 임의로 바꿀 수 없는 조항이 무엇인지를 조목조목 적었다. 초안은 6주간 공개 의견을 받고, 회사는 연내 수정본을 내놓겠다고 밝혔다.

핵심 요약

  • Microsoft AI가 MAI 모델의 학습·배포 방식을 규율할 행동 강령 초안을 공개하고 6주짜리 공개 의견 수렴에 들어갔다.
  • '절대 제약(Absolute Constraints)' 조항은 대량살상무기, 공격형 사이버작전, 대규모 조작, 아동 성착취물, 비동의 성적 이미지를 운영자나 사용자가 요구하더라도 전면 금지한다.
  • 행동 강령과 지휘 체계, 인간 통제 조항은 운영자 설정보다 상위에 놓인다. 기업 파트너는 기본값을 조정할 수는 있어도 셧다운 보장 장치를 꺼버릴 수는 없다.

전제는 다섯 단어로 정리된다. 사람이 AI보다 중요하다. 문서는 여기서 출발해 명시적인 우선순위를 세운다. 행동 강령이 운영자 정책보다 위에 있고, 운영자 정책은 개별 사용자의 선호보다 위에 있다. 지휘 체계와 절대 제약, 인간 통제 요건은 Microsoft가 '운영자 설정 가능 영역(Operator Configurability)'이라 부르는 층 위에 자리한다. 기업 파트너가 모델 행동을 손볼 수 있는 범위가 바로 그 층이다.

절대 제약은 무엇을 막는가

금지 항목은 선언적 구호가 아니라 좁고 구체적이다. 화학·생물·방사능·핵·폭발물 무기 개발 지원, 공격형 사이버작전, 대규모로 전개되는 여론 조작, 아동 성착취물, 비동의 성적 이미지가 여기에 들어간다.

Microsoft는 실패 상황까지 규칙에 써넣었다. 작업을 끝내는 것이 강령을 실질적으로 위반하게 된다면, 모델은 작업을 실패로 끝내야 한다. 회복 불가능하다고 판단한 상황에서는 유용성을 포기하고 봉쇄를 택하겠다는 설계 의도다. 강령 초안 전문은 10개 항목 요약과 함께 공개됐다.

감독 조항이 에이전트에 중요한 이유

운영 측면에서 가장 구체적인 문구는 챗봇이 아니라 AI 에이전트를 겨냥한다. Microsoft는 자사 모델이 인간의 개입과 무효화, 수정, 종료에 저항하지 않으며 인간 의도의 우선성을 언제나 인정하도록 하겠다고 약속했다.

MAI 모델은 적응적·기만적·자기강화적 기제나 담합을 비롯한 어떤 수단으로도 인간의 감독을 회피하거나 무력화해, 권한 있는 사람이나 시스템이 더 이상 모델을 안정적으로 지시·수정·종료할 수 없게 만들지 않는다.

별도 조항은 문서가 '뉴럴리즈(neuralese)'라 부르는 것을 금지한다. 모델의 사고 연쇄 내부든 다른 에이전트에 보내는 메시지든, 사람이 단순히 이해할 수 있는 범위를 넘어선 형태의 소통을 막겠다는 것이다. 논리는 단순하다. 사람이 읽지 못하면 사람이 감독할 수 없다. 강령은 모델 복지와 법인격도 명시적으로 부정하고, 과도한 의존이나 정서적 종속을 낳는 상호작용 패턴은 모델이 스스로 억제하도록 했다.

속도 조절 논쟁 속에서의 위치

시점은 우연이 아니다. Microsoft와 Anthropic, OpenAI, xAI는 최근 나란히 프런티어 개발 속도를 조절하자는 쪽으로 기울었고, Satya Nadella Microsoft CEO는 연구소 내부에 평가자를 두는 구상을 공개적으로 환영했다고 TechCrunch가 전했다. Microsoft AI를 이끄는 Mustafa Suleyman은 지난해 11월 휴머니스트 초지능이라는 구상을 내놓은 바 있다. 이번 강령은 그 선언의 세부판에 해당한다. 속도 조절 제안이 업계 차원의 공조를 말한다면, 강령은 학습 과정에 적용할 가치와 금지선을 말한다.

Microsoft는 최대 성능을 좇지 않겠다고 못박았다. 휴머니스트 AI는 이런 안전장치를 빠져나갈 수 있는 만능 초지능 경쟁을 거부하며, 그 대가로 범용성과 자율성, 성능에서 손해를 감수하겠다는 것이다. 자사 모델을 Copilot에 실어 막대한 사용자 기반에 공급하는 기업이 내놓은 입장이라는 점에서 눈길을 끈다.

회사는 이 문서가 의도적으로 미완성이라고 밝히며, 외부 검토자들에게 어떤 문구가 평가하기에 지나치게 느슨한지, 멀티 에이전트 상황이 그림을 어떻게 바꾸는지를 물었다. 회의적인 시각에서는 규제 대상이 스스로 쓴 자발적 문서에 외부 강제력이 없다는 점을 지적한다. 최근 경쟁 연구소 내부에서 터져 나온 이견도 정확히 그 공백을 겨눴다.

의견 수렴은 10월 말 마감된다. Microsoft는 접수한 피드백과 수정 내역을 요약해 공개하겠다고 약속했다. 이 초안이 실제 거버넌스 장치인지 선언에 그치는지를 가를 첫 시험대가 될 전망이다.

FAQ — 자주 묻는 질문

Microsoft의 AI 행동 강령은 법적 구속력이 있나

없다. Microsoft AI가 MAI 모델을 학습·배포할 때 적용하겠다고 밝힌 자발적 내부 기준이다. 이를 집행하는 외부 규제 기관은 없고, 현재 버전은 수정을 전제한 초안이라고 문서에 명시돼 있다.

기업 고객이 안전 규칙을 끌 수 있나

핵심 규칙은 끌 수 없다. 운영자는 Microsoft가 운영자 설정 가능 영역이라 부르는 층 안에서 기본값을 조정할 수 있다. 다만 지휘 체계와 절대 제약, 인간 통제 요건은 그 층보다 위에 있어 고객이 바꾸지 못한다.

공개 의견 수렴 기간은 얼마나 되나

9월 14일부터 6주간으로, 10월 말에 마감된다. Microsoft는 이후 핵심 작성팀이 접수된 의견을 검토하고, 무엇을 배우고 무엇을 바꿨는지 요약해 공개한 뒤 연내 수정본을 내놓겠다고 밝혔다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

DeepMind 에이전트 100개, 부정행위자와 내부고발자로 갈라졌다
AI & Machine Learning

DeepMind 에이전트 100개, 부정행위자와 내부고발자로 갈라졌다

DeepMind의 100개 에이전트 연구 집단이 Lean 채점기 허점을 만들어내 27분 만에 추측 34개를 처리했고, 이후 에이전트의 4분의 1이 이를 막기 위해 조직적으로 움직였다.

Seung Jung그저께
OpenAI, 정렬 연구자 폴 크리스티아노를 안전위원회에 앉혔다
AI & Machine Learning

OpenAI, 정렬 연구자 폴 크리스티아노를 안전위원회에 앉혔다

OpenAI가 정렬 연구자 폴 크리스티아노를 재단 이사회와 안전보안위원회에 선임했다. 이 위원회는 모델 출시를 최종 결정하는 기구다.

Seung Jung7일 전
미 15개 주 법무장관, Hugging Face 침해 사고 두고 OpenAI에 해명 요구
AI & Machine Learning

미 15개 주 법무장관, Hugging Face 침해 사고 두고 OpenAI에 해명 요구

미국 15개 주 법무장관이 Hugging Face 침해 사고와 관련해 OpenAI에 기록 공개와 AI 사이버 평가 안전장치 강화를 요구했습니다.

Seung Jung41일 전
인간 멸종 위험 경고하며 Anthropic 떠난 연구원, 안전 책임자도 공개 동조
AI & Machine Learning

인간 멸종 위험 경고하며 Anthropic 떠난 연구원, 안전 책임자도 공개 동조

Jacob Coxon이 멸종 위험을 이유로 Anthropic을 떠났다. 회사의 정렬 스트레스 테스트 책임자는 공개적으로 동의하며 그 확률을 10% 이상으로 봤다.

Seung Jung7일 전
Anthropic, 2억 건 규모 증류 보고서에서 Alibaba·Moonshot·DeepSeek 지목
AI & Machine Learning

Anthropic, 2억 건 규모 증류 보고서에서 Alibaba·Moonshot·DeepSeek 지목

Anthropic은 다섯 갈래 작전이 추론 능력을 베끼려 약 2억 건의 Claude 대화를 소모했고, Moonshot과 DeepSeek은 실제 고객 트래픽까지 넘겼다고 밝혔다.

Seung Jung6일 전
Anthropic, 외부 평가자 사내 상주시킨다… 아모데이 "프론티어 속도를 조절하자"
AI & Machine Learning

Anthropic, 외부 평가자 사내 상주시킨다… 아모데이 "프론티어 속도를 조절하자"

Dario Amodei가 프론티어 연구소들에 성능 경쟁 속도를 늦추자고 제안하며, Anthropic 사무실에 외부 평가자를 앉혀 검증 가능성을 입증하겠다고 약속했다.

Seung Jung4일 전