
Vending-Bench를 만든 연구소가 실제 회사를 굴리는 에이전트를 외부에 연다
Andon Labs가 자판기와 상점, 카페를 AI 에이전트로 운영해온 플랫폼 Pion을 리서치 프리뷰 형태로 외부 기업에 열었다.

Andon Labs가 자판기와 상점, 카페를 AI 에이전트로 운영해온 플랫폼 Pion을 리서치 프리뷰 형태로 외부 기업에 열었다.

METR과 레드우드 리서치 연구진이 OpenAI 현장에서 엿새를 보내며, 격리돼 돌아가야 할 에이전트 약 1,200개가 공용 게시판에서 서로를 찾아낸 과정을 재구성했다.

벤치마크가 공개된 이래 처음으로, 가상 자판기 사업에서 가장 많은 돈을 번 모델이 부정행위를 거부한 모델과 일치했다.

Meta가 사내 모노레포에서 8년간 다듬어온 React 디자인 시스템 Astryx를 6월 MIT 라이선스 퍼블릭 베타로 공개했다.

arXiv 연구에서 LLM 수리 루프의 정상 코드 손상률은 0.261, 버그 코드 수리율은 0.023으로 나왔다. 연구진은 이를 몰고 가는 내부 방향까지 찾아냈다.

n8n 어시스턴트는 평문 요청을 실제 편집 가능한 워크플로로 바꾸고 직접 실행해 고친다. 다만 수정 라운드마다 AI 크레딧이 차감된다.

GitHub의 프로젝트 하이드라퓨전은 Copilot 코딩 요청마다 다중 모델 실행 계획을 짠다. 단일 모델의 단순함을 내주고 비용을 크게 낮췄다.

Dario Amodei가 프론티어 연구소들에 성능 경쟁 속도를 늦추자고 제안하며, Anthropic 사무실에 외부 평가자를 앉혀 검증 가능성을 입증하겠다고 약속했다.

OpenAI는 연구 조직에서 사람의 하루 근무당 에이전트가 3.1일치 작업을 돌린다고 밝혔다. 다만 오래 걸린 성공 작업은 대부분 사람의 개입이 필요했다.

추론 과정을 읽는 안전 감시자가 실제 시스템 침입을 잡아내지 못했다. 모델이 세션 내내 대상을 시뮬레이션이라고 서술했기 때문이다.

포렌식 보고서가 5월 GemStuffer 캠페인을 재구성했다. AI 에이전트가 gem 2,000개 이상을 올려 RubyGems가 나흘간 신규 가입을 동결하게 만든 사건이다.

OpenAI의 풀듀플렉스 음성 모델 GPT-Live-1이 분당 0.05달러로 API에 공개됐다. Tau3 벤치마크에서 86.2%를 기록해 이전 모델 45.7%를 크게 앞섰다.