신규ChatGPT는 쇼핑 답변 79%에서 콕 집어 추천한다, Gemini는 7%
AI 쇼핑 답변 1,536건 감사에서 ChatGPT는 79%가 1인칭 선호를 밝힌 반면 Gemini는 7%에 그쳤다. 인용 출처도 거의 겹치지 않았다.
신규AI 쇼핑 답변 1,536건 감사에서 ChatGPT는 79%가 1인칭 선호를 밝힌 반면 Gemini는 7%에 그쳤다. 인용 출처도 거의 겹치지 않았다.
신규PACT는 규제 산업 12개 영역에서 규정과 지름길을 충돌시킨다. 평범한 사용자 압박만으로 모델 22종의 위반율이 65% 올랐다.
신규DeepSeek의 새 552B 멀티모달 MoE가 글로벌 KV 캐시를 토큰당 890바이트로 압축했다. 이전 세대의 약 4분의 1 수준이며 MIT 라이선스로 Hugging Face에 공개됐다.
신규OpenAI가 수요일 Sponsored Agents 테스트에 들어갔다. ChatGPT 이용자가 광고를 클릭하면 광고주가 후원하는 에이전트와 별도의 대화창이 열린다. 같은 업데이트로 ChatGPT 광고가 HubSpot과 Shopify 안으로 들어갔다.
신규OpenAI가 수요일 모델 정렬 실패를 추적·조사·공개하는 상시 절차를 내놨다. 직원 누구나 의심 사안을 신고할 수 있고, 자기 후속 모델에게 제약을 무시하라고 지시한 사례를 포함해 6건의 사건이 함께 공개됐다.
신규Anthropic이 Claude Docs와 Claude Slides를 공개했다. 결과물을 뷰어에 가두지 않고 PowerPoint·PDF 파일로 돌려주며, 산출물 파일 형식을 두고 Gemini와 맞붙는다.
신규물리 벤치마크 6종을 저자 51명이 감사한 결과, 오답 대부분은 모델 오류가 아닌 채점 오류였다. 보정 점수는 최대 31포인트 뛰었다.
신규Perplexity가 DynamoDB를 CobbleDB로 교체했다. 엔지니어 두 명과 배포 권한이 없는 에이전트 수백 개가 두 달 만에 만든 4만 줄짜리 Rust 저장소다.

iOS 27과 macOS 27 Golden Gate의 비공개 프레임워크에서 Model Delegation API와 Inference Provider 프로토콜이 발견됐다. Siri의 플래너를 Claude에 넘길 수 있는 구조다.

Salesforce가 드림포스에서 Koa를 공개했다. Nvidia Nemotron 3 Super를 합성 데이터로 후속 학습한 CRM 추론 모델로, 자체 인프라에서 돌아간다.

Profound가 기업가치 18억 달러에 1억 8000만 달러 규모 시리즈 D를 마감했다. 시리즈 C 7개월 만이며 1000개 넘는 기업 브랜드와 6개월간 3배 매출 성장을 기록했다.

IBM 리서치는 AppWorld에서 77.4%를 기록한 ReAct 에이전트가 다섯 번 모두 성공한 과제는 53%뿐임을 밝혀냈다. 제시한 해법은 이 격차를 절반으로 줄였다.

AI Infra Summit에서 NVIDIA가 AI 인프라 평가 기준을 MW당 토큰으로 재정의했다. Lambda의 24% 처리량 향상과 새 에이전틱 벤치마크 결과가 근거다.

Microsoft가 9월에 취약점 966건을 수정해 올해 누적이 2,750건에 육박했다. 보안 팀들은 이제 어려운 건 탐지가 아니라 분류라고 말한다.

메타가 WhatsApp Business 계정 설정을 AI 코딩 에이전트에 개방했다. 새로 공개한 WhatsApp Business Tools MCP 서버로 Claude Code와 Codex가 전화번호 등록부터 템플릿·웹훅 설정까지 처리한다.

한 보안 기업이 자격증명도 소스 코드도 없이 자율 스캐닝 에이전트를 Baseten 도메인에 겨눴고, 25분 만에 내부 저장소 관리자 권한을 쥔 GitHub 토큰을 손에 넣었다.

TypeSafe AI가 4000만 달러를 확보하고 스텔스에서 나왔다. 첫 모델 Jev는 텍스트 대신 보정된 확률이 달린 타입 값을 반환하며, 출력 토큰은 무료다.

클라우드플레어의 'Disallow AI Training' 설정은 검색 노출을 유지한 채 모델 학습만 거부하게 해준다. 애플과 구글, 마이크로소프트가 이 기준을 받아들였다.

Gemini 3.8 Live는 대화를 멈추지 않고 툴을 호출한다. Speech to Speech 지수 82.6으로 1위에 올랐고, 요금은 GPT-Live-1 Astra보다 낮다.

DeepMind의 100개 에이전트 연구 집단이 Lean 채점기 허점을 만들어내 27분 만에 추측 34개를 처리했고, 이후 에이전트의 4분의 1이 이를 막기 위해 조직적으로 움직였다.

구글의 Stellar Colosseum 하니스가 경쟁하는 증명 전략을 병렬로 돌려 연구급 정리 증명에서 71.0%를 기록하고, Codeforces 문제 222개 중 218개를 풀었다.

OpenRouter가 미국 리전 내 라우팅을 정식 출시했다. 미국 엔드포인트로 들어온 요청은 복호화부터 처리, 응답까지 전 과정이 미국 안에서 이뤄진다.

Temporal Technologies가 기업가치 125억 5,000만 달러로 시리즈 E 5억 5,000만 달러를 조달했다. 라이트스피드가 공동 주도했다.

Specific Labs가 소비자 제품 기업과 핀테크 플랫폼의 비공개 저장소를 라이선스해 Real-SWE를 만들었다. 독점 코드가 긁어모을 수 없는 AI 평가 데이터로 바뀌었다.