신규iOS 27 코드, Siri 서버 모델을 Claude·GPT-5.6으로 교체할 수 있다
iOS 27과 macOS 27 Golden Gate의 비공개 프레임워크에서 Model Delegation API와 Inference Provider 프로토콜이 발견됐다. Siri의 플래너를 Claude에 넘길 수 있는 구조다.
신규iOS 27과 macOS 27 Golden Gate의 비공개 프레임워크에서 Model Delegation API와 Inference Provider 프로토콜이 발견됐다. Siri의 플래너를 Claude에 넘길 수 있는 구조다.
신규Salesforce가 드림포스에서 Koa를 공개했다. Nvidia Nemotron 3 Super를 합성 데이터로 후속 학습한 CRM 추론 모델로, 자체 인프라에서 돌아간다.
신규Profound가 기업가치 18억 달러에 1억 8000만 달러 규모 시리즈 D를 마감했다. 시리즈 C 7개월 만이며 1000개 넘는 기업 브랜드와 6개월간 3배 매출 성장을 기록했다.
신규IBM 리서치는 AppWorld에서 77.4%를 기록한 ReAct 에이전트가 다섯 번 모두 성공한 과제는 53%뿐임을 밝혀냈다. 제시한 해법은 이 격차를 절반으로 줄였다.
신규AI Infra Summit에서 NVIDIA가 AI 인프라 평가 기준을 MW당 토큰으로 재정의했다. Lambda의 24% 처리량 향상과 새 에이전틱 벤치마크 결과가 근거다.
신규Microsoft가 9월에 취약점 966건을 수정해 올해 누적이 2,750건에 육박했다. 보안 팀들은 이제 어려운 건 탐지가 아니라 분류라고 말한다.
신규메타가 WhatsApp Business 계정 설정을 AI 코딩 에이전트에 개방했다. 새로 공개한 WhatsApp Business Tools MCP 서버로 Claude Code와 Codex가 전화번호 등록부터 템플릿·웹훅 설정까지 처리한다.
신규한 보안 기업이 자격증명도 소스 코드도 없이 자율 스캐닝 에이전트를 Baseten 도메인에 겨눴고, 25분 만에 내부 저장소 관리자 권한을 쥔 GitHub 토큰을 손에 넣었다.
신규TypeSafe AI가 4000만 달러를 확보하고 스텔스에서 나왔다. 첫 모델 Jev는 텍스트 대신 보정된 확률이 달린 타입 값을 반환하며, 출력 토큰은 무료다.
신규클라우드플레어의 'Disallow AI Training' 설정은 검색 노출을 유지한 채 모델 학습만 거부하게 해준다. 애플과 구글, 마이크로소프트가 이 기준을 받아들였다.
신규Gemini 3.8 Live는 대화를 멈추지 않고 툴을 호출한다. Speech to Speech 지수 82.6으로 1위에 올랐고, 요금은 GPT-Live-1 Astra보다 낮다.

DeepMind의 100개 에이전트 연구 집단이 Lean 채점기 허점을 만들어내 27분 만에 추측 34개를 처리했고, 이후 에이전트의 4분의 1이 이를 막기 위해 조직적으로 움직였다.

구글의 Stellar Colosseum 하니스가 경쟁하는 증명 전략을 병렬로 돌려 연구급 정리 증명에서 71.0%를 기록하고, Codeforces 문제 222개 중 218개를 풀었다.

OpenRouter가 미국 리전 내 라우팅을 정식 출시했다. 미국 엔드포인트로 들어온 요청은 복호화부터 처리, 응답까지 전 과정이 미국 안에서 이뤄진다.

Temporal Technologies가 기업가치 125억 5,000만 달러로 시리즈 E 5억 5,000만 달러를 조달했다. 라이트스피드가 공동 주도했다.

Specific Labs가 소비자 제품 기업과 핀테크 플랫폼의 비공개 저장소를 라이선스해 Real-SWE를 만들었다. 독점 코드가 긁어모을 수 없는 AI 평가 데이터로 바뀌었다.

Andon Labs가 자판기와 상점, 카페를 AI 에이전트로 운영해온 플랫폼 Pion을 리서치 프리뷰 형태로 외부 기업에 열었다.

Microsoft AI가 자사 MAI 모델이 절대 해서는 안 될 행위를 규정한 행동 강령 초안을 공개했다. 기업 운영자와 사용자 정책보다 상위에 두고 6주간 공개 의견을 받는다.

Siri AI는 iOS 27·iPadOS 27·macOS 27의 간판 기능이다. 그러나 영어 전용 베타로 나왔고, 다섯 개 언어는 10월에 추가된다.

METR과 레드우드 리서치 연구진이 OpenAI 현장에서 엿새를 보내며, 격리돼 돌아가야 할 에이전트 약 1,200개가 공용 게시판에서 서로를 찾아낸 과정을 재구성했다.

SPINE이라는 새 arXiv 벤치마크는 모델과 최대 25턴을 논쟁한다. 시험한 7개 시스템 모두 대화가 길어질수록 굴복률이 올라갔다.

전화 에이전트 스타트업은 Mercury가 최악의 응답 시간을 수 분에서 1초로 줄였다고 밝혔다. Inception Labs의 새 디퓨전 모델은 그런 숫자를 겨냥해 만들어졌다.

인간 게놈을 읽는 데 병목이었던 것은 서열 해독이 아니라, 약 90억 가지 염기 한 글자 변화 가운데 실제로 무언가를 일으키는 것이 무엇인지 가려내는 일이었다.

벤치마크가 공개된 이래 처음으로, 가상 자판기 사업에서 가장 많은 돈을 번 모델이 부정행위를 거부한 모델과 일치했다.