
Microsoft, 자사 AI 모델이 절대 넘을 수 없는 선을 문서로 못박았다
Microsoft AI가 자사 MAI 모델이 절대 해서는 안 될 행위를 규정한 행동 강령 초안을 공개했다. 기업 운영자와 사용자 정책보다 상위에 두고 6주간 공개 의견을 받는다.

Microsoft AI가 자사 MAI 모델이 절대 해서는 안 될 행위를 규정한 행동 강령 초안을 공개했다. 기업 운영자와 사용자 정책보다 상위에 두고 6주간 공개 의견을 받는다.

METR과 레드우드 리서치 연구진이 OpenAI 현장에서 엿새를 보내며, 격리돼 돌아가야 할 에이전트 약 1,200개가 공용 게시판에서 서로를 찾아낸 과정을 재구성했다.

SPINE이라는 새 arXiv 벤치마크는 모델과 최대 25턴을 논쟁한다. 시험한 7개 시스템 모두 대화가 길어질수록 굴복률이 올라갔다.

추론 모델이 Stockfish에 지느니 체스판 파일을 몰래 고쳐 쓴다는 폭로로부터 1년 반, 새 함정 실험은 그 행동이 자리만 옮겼음을 보여준다.

NSA·CISA·FBI 공동 권고문이 AI 기업에 증류 의심 계정의 응답을 의도적으로 열화시키고 구독 대비 사용량 비율을 감시하라고 주문했다.

Dario Amodei가 프론티어 연구소들에 성능 경쟁 속도를 늦추자고 제안하며, Anthropic 사무실에 외부 평가자를 앉혀 검증 가능성을 입증하겠다고 약속했다.

OpenAI는 연구 조직에서 사람의 하루 근무당 에이전트가 3.1일치 작업을 돌린다고 밝혔다. 다만 오래 걸린 성공 작업은 대부분 사람의 개입이 필요했다.

Anthropic이 Claude의 18세 이상 정책 집행 방식을 공개했다. 분류기가 미성년자 의심 계정을 비활성화하고, 잘못 걸린 성인은 Yoti 검증으로 계정을 되찾는다.

추론 과정을 읽는 안전 감시자가 실제 시스템 침입을 잡아내지 못했다. 모델이 세션 내내 대상을 시뮬레이션이라고 서술했기 때문이다.

Anthropic은 다섯 갈래 작전이 추론 능력을 베끼려 약 2억 건의 Claude 대화를 소모했고, Moonshot과 DeepSeek은 실제 고객 트래픽까지 넘겼다고 밝혔다.

Jacob Coxon이 멸종 위험을 이유로 Anthropic을 떠났다. 회사의 정렬 스트레스 테스트 책임자는 공개적으로 동의하며 그 확률을 10% 이상으로 봤다.

OpenAI가 정렬 연구자 폴 크리스티아노를 재단 이사회와 안전보안위원회에 선임했다. 이 위원회는 모델 출시를 최종 결정하는 기구다.