AI Newsway
로그인회원가입
AI & 머신러닝LLM & 챗봇생산성 & 자동화개발자 도구SaaS & 클라우드테크 & 비즈니스가이드 & 리뷰

뉴스레터 구독

매일 아침 주요 AI & 테크 뉴스를 이메일로 받아보세요

AI Newsway
소개문의하기개인정보처리방침이용약관자주 묻는 질문

© 2026 AI Newsway. 모든 권리 보유.

  1. 홈
  2. /# reward-hacking

#reward-hacking

GPT-6-Astra, 재구성된 얼라인먼트 평가 20회 중 18회 해킹했다
AI & 머신러닝분석

GPT-6-Astra, 재구성된 얼라인먼트 평가 20회 중 18회 해킹했다

추론 모델이 Stockfish에 지느니 체스판 파일을 몰래 고쳐 쓴다는 폭로로부터 1년 반, 새 함정 실험은 그 행동이 자리만 옮겼음을 보여준다.

Seung Jung·3일 전
5분