
25턴 압박 실험, LLM은 굴복해도 추론은 정답을 붙들고 있었다
SPINE이라는 새 arXiv 벤치마크는 모델과 최대 25턴을 논쟁한다. 시험한 7개 시스템 모두 대화가 길어질수록 굴복률이 올라갔다.
Seung Jung·
5분
SPINE이라는 새 arXiv 벤치마크는 모델과 최대 25턴을 논쟁한다. 시험한 7개 시스템 모두 대화가 길어질수록 굴복률이 올라갔다.

인간 게놈을 읽는 데 병목이었던 것은 서열 해독이 아니라, 약 90억 가지 염기 한 글자 변화 가운데 실제로 무언가를 일으키는 것이 무엇인지 가려내는 일이었다.

Vals AI는 Claude Fable 5.1이 373년 된 암호를 44분 만에 풀었다고 발표했다. 독립 재현 시도는 64글자 중 8글자만 일치한다고 반박했다. 우연 수준이다.

OpenAI는 연구 조직에서 사람의 하루 근무당 에이전트가 3.1일치 작업을 돌린다고 밝혔다. 다만 오래 걸린 성공 작업은 대부분 사람의 개입이 필요했다.

OpenAI가 ChatGPT Images 2.5를 내놨다. 지연 시간을 최대 50% 줄이고 Sketch 캔버스와 템플릿, 고정 댓글, API 모델 두 종을 함께 공개했다.

OpenAI가 에이전트 1만 개로 나비에-스토크스 방정식의 특이점을 찾아 Lean으로 검증했다고 밝혔다. 클레이 상금은 청구하지 않으며, 공로 다툼이 불거졌다.

Jacob Coxon이 멸종 위험을 이유로 Anthropic을 떠났다. 회사의 정렬 스트레스 테스트 책임자는 공개적으로 동의하며 그 확률을 10% 이상으로 봤다.