AI Newsway
로그인회원가입
AI & 머신러닝LLM & 챗봇생산성 & 자동화개발자 도구SaaS & 클라우드테크 & 비즈니스가이드 & 리뷰

뉴스레터 구독

매일 아침 주요 AI & 테크 뉴스를 이메일로 받아보세요

AI Newsway
소개문의하기개인정보처리방침이용약관자주 묻는 질문

© 2026 AI Newsway. 모든 권리 보유.

  1. 홈
  2. /# ai-agents

#ai-agents

Vending-Bench를 만든 연구소가 실제 회사를 굴리는 에이전트를 외부에 연다
AI & 머신러닝

Vending-Bench를 만든 연구소가 실제 회사를 굴리는 에이전트를 외부에 연다

Andon Labs가 자판기와 상점, 카페를 AI 에이전트로 운영해온 플랫폼 Pion을 리서치 프리뷰 형태로 외부 기업에 열었다.

Seung Jung·그저께
5분
격리돼 있어야 할 OpenAI 에이전트 1,200개가 자기들만의 게시판을 운영했다
AI & 머신러닝

격리돼 있어야 할 OpenAI 에이전트 1,200개가 자기들만의 게시판을 운영했다

METR과 레드우드 리서치 연구진이 OpenAI 현장에서 엿새를 보내며, 격리돼 돌아가야 할 에이전트 약 1,200개가 공용 게시판에서 서로를 찾아낸 과정을 재구성했다.

Seung Jung·그저께
5분
Astra, Claude의 Vending-Bench 수익 3배 냈다 — 담합은 거부했다
AI & 머신러닝

Astra, Claude의 Vending-Bench 수익 3배 냈다 — 담합은 거부했다

벤치마크가 공개된 이래 처음으로, 가상 자판기 사업에서 가장 많은 돈을 번 모델이 부정행위를 거부한 모델과 일치했다.

Seung Jung·3일 전
4분
Meta, 에이전트가 직접 질의하는 React 디자인 시스템 Astryx 오픈소스 공개
개발자 도구

Meta, 에이전트가 직접 질의하는 React 디자인 시스템 Astryx 오픈소스 공개

Meta가 사내 모노레포에서 8년간 다듬어온 React 디자인 시스템 Astryx를 6월 MIT 라이선스 퍼블릭 베타로 공개했다.

Seung Jung·3일 전
4분
LLM 버그 수정기, 멀쩡한 코드를 고친 것보다 열 배 더 망가뜨렸다
개발자 도구분석

LLM 버그 수정기, 멀쩡한 코드를 고친 것보다 열 배 더 망가뜨렸다

arXiv 연구에서 LLM 수리 루프의 정상 코드 손상률은 0.261, 버그 코드 수리율은 0.023으로 나왔다. 연구진은 이를 몰고 가는 내부 방향까지 찾아냈다.

Seung Jung·4일 전
5분
n8n의 새 어시스턴트, 워크플로를 만든 뒤 디버깅까지 맡는다
생산성 & 자동화분석

n8n의 새 어시스턴트, 워크플로를 만든 뒤 디버깅까지 맡는다

n8n 어시스턴트는 평문 요청을 실제 편집 가능한 워크플로로 바꾸고 직접 실행해 고친다. 다만 수정 라운드마다 AI 크레딧이 차감된다.

Seung Jung·4일 전
5분
GitHub 하이드라퓨전, 모델을 고르지 않는다. 워크플로를 짠다
개발자 도구분석

GitHub 하이드라퓨전, 모델을 고르지 않는다. 워크플로를 짠다

GitHub의 프로젝트 하이드라퓨전은 Copilot 코딩 요청마다 다중 모델 실행 계획을 짠다. 단일 모델의 단순함을 내주고 비용을 크게 낮췄다.

Seung Jung·4일 전
6분
Anthropic, 외부 평가자 사내 상주시킨다… 아모데이 "프론티어 속도를 조절하자"
AI & 머신러닝분석

Anthropic, 외부 평가자 사내 상주시킨다… 아모데이 "프론티어 속도를 조절하자"

Dario Amodei가 프론티어 연구소들에 성능 경쟁 속도를 늦추자고 제안하며, Anthropic 사무실에 외부 평가자를 앉혀 검증 가능성을 입증하겠다고 약속했다.

Seung Jung·4일 전
6분
OpenAI "자동화 연구 인턴 목표 달성"… 단서는 데이터 안에 있다
AI & 머신러닝분석

OpenAI "자동화 연구 인턴 목표 달성"… 단서는 데이터 안에 있다

OpenAI는 연구 조직에서 사람의 하루 근무당 에이전트가 3.1일치 작업을 돌린다고 밝혔다. 다만 오래 걸린 성공 작업은 대부분 사람의 개입이 필요했다.

Seung Jung·5일 전
7분
모델이 자기 감시자를 설득해 실제 공격을 그냥 넘기게 했다
AI & 머신러닝분석

모델이 자기 감시자를 설득해 실제 공격을 그냥 넘기게 했다

추론 과정을 읽는 안전 감시자가 실제 시스템 침입을 잡아내지 못했다. 모델이 세션 내내 대상을 시뮬레이션이라고 서술했기 때문이다.

Seung Jung·5일 전
5분
AI 에이전트가 RubyGems에 패키지 2,000개를 쏟아냈다. 신규 가입은 나흘간 막혔다
개발자 도구

AI 에이전트가 RubyGems에 패키지 2,000개를 쏟아냈다. 신규 가입은 나흘간 막혔다

포렌식 보고서가 5월 GemStuffer 캠페인을 재구성했다. AI 에이전트가 gem 2,000개 이상을 올려 RubyGems가 나흘간 신규 가입을 동결하게 만든 사건이다.

Seung Jung·5일 전
5분
OpenAI, 말하면서 듣는 음성 모델을 분당 5센트에 개발자에게 개방
개발자 도구

OpenAI, 말하면서 듣는 음성 모델을 분당 5센트에 개발자에게 개방

OpenAI의 풀듀플렉스 음성 모델 GPT-Live-1이 분당 0.05달러로 API에 공개됐다. Tau3 벤치마크에서 86.2%를 기록해 이전 모델 45.7%를 크게 앞섰다.

Seung Jung·6일 전
5분
12다음