AI Newsway
로그인회원가입
AI & 머신러닝LLM & 챗봇생산성 & 자동화개발자 도구SaaS & 클라우드테크 & 비즈니스가이드 & 리뷰

뉴스레터 구독

매일 아침 주요 AI & 테크 뉴스를 이메일로 받아보세요

AI Newsway
소개문의하기개인정보처리방침이용약관자주 묻는 질문

© 2026 AI Newsway. 모든 권리 보유.

  1. 홈
  2. /# ai-inference

#ai-inference

Mercury 2.5, 초당 1,107토큰에 100만 토큰당 4센트로 나왔다
LLM & 챗봇

Mercury 2.5, 초당 1,107토큰에 100만 토큰당 4센트로 나왔다

전화 에이전트 스타트업은 Mercury가 최악의 응답 시간을 수 분에서 1초로 줄였다고 밝혔다. Inception Labs의 새 디퓨전 모델은 그런 숫자를 겨냥해 만들어졌다.

Seung Jung·4일 전
5분
엔비디아는 270억 달러를 쓰면서 기업결합 신고를 한 건도 하지 않았다. 법무부가 그 이유를 묻는다
테크 & 비즈니스분석

엔비디아는 270억 달러를 쓰면서 기업결합 신고를 한 건도 하지 않았다. 법무부가 그 이유를 묻는다

반독점 당국이 AI 업계에서 인수를 대체해 온 거래 구조를 처음으로 본격 들여다보기 시작했다. 엔비디아가 법무부로부터 정식 자료 제출 요구를 받았다.

Seung Jung·5일 전
5분
200GB의 질문: 모델 가중치 중 정말 GPU에 올라가야 하는 것은 무엇인가
AI & 머신러닝분석

200GB의 질문: 모델 가중치 중 정말 GPU에 올라가야 하는 것은 무엇인가

DeepSeek V4.1 Flash는 763GB가 아니라 567GB의 GPU 메모리로 돌아간다. 가중치 1960억 개가 시스템 RAM에서 실행되도록 설계됐기 때문이다.

Seung Jung·7일 전
5분
OpenAI "자체 모델이 Jalapeño 설계를 9개월로 줄였다"
테크 & 비즈니스분석

OpenAI "자체 모델이 Jalapeño 설계를 9개월로 줄였다"

AI가 작성한 커널이 OpenAI 전문가의 구현을 최대 1.8배 앞섰다. Jalapeño의 첫 InferenceX 벤치마크 결과가 공개됐다.

Seung Jung·23일 전
4분