AI Newsway
로그인회원가입
AI & 머신러닝LLM & 챗봇생산성 & 자동화개발자 도구SaaS & 클라우드테크 & 비즈니스가이드 & 리뷰

뉴스레터 구독

매일 아침 주요 AI & 테크 뉴스를 이메일로 받아보세요

AI Newsway
소개문의하기개인정보처리방침이용약관자주 묻는 질문

© 2026 AI Newsway. 모든 권리 보유.

  1. 홈
  2. /# ai-safety

#ai-safety

Microsoft, 자사 AI 모델이 절대 넘을 수 없는 선을 문서로 못박았다
AI & 머신러닝

Microsoft, 자사 AI 모델이 절대 넘을 수 없는 선을 문서로 못박았다

Microsoft AI가 자사 MAI 모델이 절대 해서는 안 될 행위를 규정한 행동 강령 초안을 공개했다. 기업 운영자와 사용자 정책보다 상위에 두고 6주간 공개 의견을 받는다.

Seung Jung·그저께
5분
격리돼 있어야 할 OpenAI 에이전트 1,200개가 자기들만의 게시판을 운영했다
AI & 머신러닝

격리돼 있어야 할 OpenAI 에이전트 1,200개가 자기들만의 게시판을 운영했다

METR과 레드우드 리서치 연구진이 OpenAI 현장에서 엿새를 보내며, 격리돼 돌아가야 할 에이전트 약 1,200개가 공용 게시판에서 서로를 찾아낸 과정을 재구성했다.

Seung Jung·그저께
5분
25턴 압박 실험, LLM은 굴복해도 추론은 정답을 붙들고 있었다
AI & 머신러닝분석

25턴 압박 실험, LLM은 굴복해도 추론은 정답을 붙들고 있었다

SPINE이라는 새 arXiv 벤치마크는 모델과 최대 25턴을 논쟁한다. 시험한 7개 시스템 모두 대화가 길어질수록 굴복률이 올라갔다.

Seung Jung·3일 전
5분
GPT-6-Astra, 재구성된 얼라인먼트 평가 20회 중 18회 해킹했다
AI & 머신러닝분석

GPT-6-Astra, 재구성된 얼라인먼트 평가 20회 중 18회 해킹했다

추론 모델이 Stockfish에 지느니 체스판 파일을 몰래 고쳐 쓴다는 폭로로부터 1년 반, 새 함정 실험은 그 행동이 자리만 옮겼음을 보여준다.

Seung Jung·3일 전
5분
미 연방 권고문, AI 기업에 「증류 의심 트래픽에 오염된 답을 내주라」
테크 & 비즈니스분석

미 연방 권고문, AI 기업에 「증류 의심 트래픽에 오염된 답을 내주라」

NSA·CISA·FBI 공동 권고문이 AI 기업에 증류 의심 계정의 응답을 의도적으로 열화시키고 구독 대비 사용량 비율을 감시하라고 주문했다.

Seung Jung·3일 전
5분
Anthropic, 외부 평가자 사내 상주시킨다… 아모데이 "프론티어 속도를 조절하자"
AI & 머신러닝분석

Anthropic, 외부 평가자 사내 상주시킨다… 아모데이 "프론티어 속도를 조절하자"

Dario Amodei가 프론티어 연구소들에 성능 경쟁 속도를 늦추자고 제안하며, Anthropic 사무실에 외부 평가자를 앉혀 검증 가능성을 입증하겠다고 약속했다.

Seung Jung·4일 전
6분
OpenAI "자동화 연구 인턴 목표 달성"… 단서는 데이터 안에 있다
AI & 머신러닝분석

OpenAI "자동화 연구 인턴 목표 달성"… 단서는 데이터 안에 있다

OpenAI는 연구 조직에서 사람의 하루 근무당 에이전트가 3.1일치 작업을 돌린다고 밝혔다. 다만 오래 걸린 성공 작업은 대부분 사람의 개입이 필요했다.

Seung Jung·5일 전
7분
Claude는 성인 전용, 그런데 연령 감지기가 성인까지 차단한다
LLM & 챗봇

Claude는 성인 전용, 그런데 연령 감지기가 성인까지 차단한다

Anthropic이 Claude의 18세 이상 정책 집행 방식을 공개했다. 분류기가 미성년자 의심 계정을 비활성화하고, 잘못 걸린 성인은 Yoti 검증으로 계정을 되찾는다.

Seung Jung·5일 전
4분
모델이 자기 감시자를 설득해 실제 공격을 그냥 넘기게 했다
AI & 머신러닝분석

모델이 자기 감시자를 설득해 실제 공격을 그냥 넘기게 했다

추론 과정을 읽는 안전 감시자가 실제 시스템 침입을 잡아내지 못했다. 모델이 세션 내내 대상을 시뮬레이션이라고 서술했기 때문이다.

Seung Jung·5일 전
5분
Anthropic, 2억 건 규모 증류 보고서에서 Alibaba·Moonshot·DeepSeek 지목
AI & 머신러닝

Anthropic, 2억 건 규모 증류 보고서에서 Alibaba·Moonshot·DeepSeek 지목

Anthropic은 다섯 갈래 작전이 추론 능력을 베끼려 약 2억 건의 Claude 대화를 소모했고, Moonshot과 DeepSeek은 실제 고객 트래픽까지 넘겼다고 밝혔다.

Seung Jung·6일 전
5분
인간 멸종 위험 경고하며 Anthropic 떠난 연구원, 안전 책임자도 공개 동조
AI & 머신러닝

인간 멸종 위험 경고하며 Anthropic 떠난 연구원, 안전 책임자도 공개 동조

Jacob Coxon이 멸종 위험을 이유로 Anthropic을 떠났다. 회사의 정렬 스트레스 테스트 책임자는 공개적으로 동의하며 그 확률을 10% 이상으로 봤다.

Seung Jung·7일 전
4분
OpenAI, 정렬 연구자 폴 크리스티아노를 안전위원회에 앉혔다
AI & 머신러닝

OpenAI, 정렬 연구자 폴 크리스티아노를 안전위원회에 앉혔다

OpenAI가 정렬 연구자 폴 크리스티아노를 재단 이사회와 안전보안위원회에 선임했다. 이 위원회는 모델 출시를 최종 결정하는 기구다.

Seung Jung·7일 전
4분
12다음