
Mercury 2.5, 초당 1,107토큰에 100만 토큰당 4센트로 나왔다
전화 에이전트 스타트업은 Mercury가 최악의 응답 시간을 수 분에서 1초로 줄였다고 밝혔다. Inception Labs의 새 디퓨전 모델은 그런 숫자를 겨냥해 만들어졌다.
Seung Jung·
5분
전화 에이전트 스타트업은 Mercury가 최악의 응답 시간을 수 분에서 1초로 줄였다고 밝혔다. Inception Labs의 새 디퓨전 모델은 그런 숫자를 겨냥해 만들어졌다.

반독점 당국이 AI 업계에서 인수를 대체해 온 거래 구조를 처음으로 본격 들여다보기 시작했다. 엔비디아가 법무부로부터 정식 자료 제출 요구를 받았다.

DeepSeek V4.1 Flash는 763GB가 아니라 567GB의 GPU 메모리로 돌아간다. 가중치 1960억 개가 시스템 RAM에서 실행되도록 설계됐기 때문이다.

AI가 작성한 커널이 OpenAI 전문가의 구현을 최대 1.8배 앞섰다. Jalapeño의 첫 InferenceX 벤치마크 결과가 공개됐다.