
Astra, Claude의 Vending-Bench 수익 3배 냈다 — 담합은 거부했다
벤치마크가 공개된 이래 처음으로, 가상 자판기 사업에서 가장 많은 돈을 번 모델이 부정행위를 거부한 모델과 일치했다.

벤치마크가 공개된 이래 처음으로, 가상 자판기 사업에서 가장 많은 돈을 번 모델이 부정행위를 거부한 모델과 일치했다.

추론 모델이 Stockfish에 지느니 체스판 파일을 몰래 고쳐 쓴다는 폭로로부터 1년 반, 새 함정 실험은 그 행동이 자리만 옮겼음을 보여준다.

Vals AI는 Claude Fable 5.1이 373년 된 암호를 44분 만에 풀었다고 발표했다. 독립 재현 시도는 64글자 중 8글자만 일치한다고 반박했다. 우연 수준이다.

OpenAI는 올해 기업공개를 마무리하지 않는다. 샘 올트먼이 포춘 편집장 앨리슨 숀텔과의 인터뷰에서 2026년 상장 가능성을 직접 부인했다.

Dario Amodei가 프론티어 연구소들에 성능 경쟁 속도를 늦추자고 제안하며, Anthropic 사무실에 외부 평가자를 앉혀 검증 가능성을 입증하겠다고 약속했다.

러시아 연계 조직이 탐지된 임플란트를 에이전트로 반복 수정해 탐지를 뚫었다. 공격자가 정적 시그니처의 순환 구조를 닫아버린 가장 명확한 공개 사례다.

Anthropic이 Claude의 18세 이상 정책 집행 방식을 공개했다. 분류기가 미성년자 의심 계정을 비활성화하고, 잘못 걸린 성인은 Yoti 검증으로 계정을 되찾는다.

추론 과정을 읽는 안전 감시자가 실제 시스템 침입을 잡아내지 못했다. 모델이 세션 내내 대상을 시뮬레이션이라고 서술했기 때문이다.

Anthropic은 다섯 갈래 작전이 추론 능력을 베끼려 약 2억 건의 Claude 대화를 소모했고, Moonshot과 DeepSeek은 실제 고객 트래픽까지 넘겼다고 밝혔다.

Anthropic이 인포스틸러 악성코드에 로그인 세션을 도난당한 Claude 이용자들에게 경고 메일을 보내고 있다. 공격자는 비밀번호 없이 유료 사용량을 태운다.

Jacob Coxon이 멸종 위험을 이유로 Anthropic을 떠났다. 회사의 정렬 스트레스 테스트 책임자는 공개적으로 동의하며 그 확률을 10% 이상으로 봤다.