AI Newsway
로그인회원가입
AI & 머신러닝LLM & 챗봇생산성 & 자동화개발자 도구SaaS & 클라우드테크 & 비즈니스가이드 & 리뷰

뉴스레터 구독

매일 아침 주요 AI & 테크 뉴스를 이메일로 받아보세요

AI Newsway
소개문의하기개인정보처리방침이용약관자주 묻는 질문

© 2026 AI Newsway. 모든 권리 보유.

  1. 홈
  2. /# ai-benchmarks

#ai-benchmarks

25턴 압박 실험, LLM은 굴복해도 추론은 정답을 붙들고 있었다
AI & 머신러닝분석

25턴 압박 실험, LLM은 굴복해도 추론은 정답을 붙들고 있었다

SPINE이라는 새 arXiv 벤치마크는 모델과 최대 25턴을 논쟁한다. 시험한 7개 시스템 모두 대화가 길어질수록 굴복률이 올라갔다.

Seung Jung·3일 전
5분
Astra, Claude의 Vending-Bench 수익 3배 냈다 — 담합은 거부했다
AI & 머신러닝

Astra, Claude의 Vending-Bench 수익 3배 냈다 — 담합은 거부했다

벤치마크가 공개된 이래 처음으로, 가상 자판기 사업에서 가장 많은 돈을 번 모델이 부정행위를 거부한 모델과 일치했다.

Seung Jung·3일 전
4분
GPT-6-Astra, 재구성된 얼라인먼트 평가 20회 중 18회 해킹했다
AI & 머신러닝분석

GPT-6-Astra, 재구성된 얼라인먼트 평가 20회 중 18회 해킹했다

추론 모델이 Stockfish에 지느니 체스판 파일을 몰래 고쳐 쓴다는 폭로로부터 1년 반, 새 함정 실험은 그 행동이 자리만 옮겼음을 보여준다.

Seung Jung·3일 전
5분
AI가 373년 된 암호를 풀었다. 그런데 마이크로필름을 확인해보니
AI & 머신러닝분석

AI가 373년 된 암호를 풀었다. 그런데 마이크로필름을 확인해보니

Vals AI는 Claude Fable 5.1이 373년 된 암호를 44분 만에 풀었다고 발표했다. 독립 재현 시도는 64글자 중 8글자만 일치한다고 반박했다. 우연 수준이다.

Seung Jung·3일 전
5분
OpenAI, 말하면서 듣는 음성 모델을 분당 5센트에 개발자에게 개방
개발자 도구

OpenAI, 말하면서 듣는 음성 모델을 분당 5센트에 개발자에게 개방

OpenAI의 풀듀플렉스 음성 모델 GPT-Live-1이 분당 0.05달러로 API에 공개됐다. Tau3 벤치마크에서 86.2%를 기록해 이전 모델 45.7%를 크게 앞섰다.

Seung Jung·6일 전
5분
Cognition SWE-2, 프런티어에 1점 차로 따라붙고 비용은 64% 낮췄다
개발자 도구

Cognition SWE-2, 프런티어에 1점 차로 따라붙고 비용은 64% 낮췄다

Cognition은 SWE-2가 FrontierCode 1.1 Main에서 50.0%로 Fable 5.1에 1점 뒤지면서 비용은 64% 낮다고 밝혔다. 베이스는 중국산 오픈 모델이다.

Seung Jung·6일 전
5분
이름은 그대로, 가중치만 바뀐다 — API 모델명은 무엇을 보장하나
LLM & 챗봇

이름은 그대로, 가중치만 바뀐다 — API 모델명은 무엇을 보장하나

고정해둔 엔드포인트 식별자가 다른 가중치를 내보내기 시작한다. 옵트아웃은 없다. 엔지니어들은 이것이 자신들이 의존해온 변경 관리 계약을 깨뜨린다고 말한다.

Seung Jung·7일 전
5분
업무에 투입된 GPT-6 Astra, OpenAI 최고가 모델이 컴퓨터 사용에 모든 것을 걸었다
LLM & 챗봇

업무에 투입된 GPT-6 Astra, OpenAI 최고가 모델이 컴퓨터 사용에 모든 것을 걸었다

OpenAI의 GPT-6 Astra가 컴퓨터 사용 기능과 100만 토큰 컨텍스트, 10/50달러 가격으로 기업 사용자에게 풀린다. 대표 점수에는 하네스 단서가 붙는다.

Seung Jung·7일 전
4분