AI Newsway

OpenAI 中階模型代幣價格砍半,但兩項基準測試仍由 GPT-5.6 勝出

新價格號稱長期有效,比較基準卻是11月到期的折扣價;真正左右帳單的,可能是同日公布的快取改版

|6分鐘閱讀0
1515 Third Street in San Francisco's Mission Bay, one of two Uber-owned buildings OpenAI subleased as it expanded the team now shipping the GPT-6 line.
1515 Third Street in San Francisco's Mission Bay, one of two Uber-owned buildings OpenAI subleased as it expanded the team now shipping the GPT-6 line.

OpenAI 週二推出兩款中階模型,訴求幾乎全押在價格上。GPT-6 Sol 每百萬輸入代幣定價2美元、每百萬輸出代幣10美元;GPT-6 Luna 則為0.10美元與0.50美元。該公司發言人向 VentureBeat 表示,這組費率沒有促銷到期日,這是這次公告中最有用的一項事實。其餘部分全是取捨。

重點摘要

  • GPT-6 Sol 每百萬代幣2/10美元、GPT-6 Luna 為0.10/0.50美元,約為促銷價期間 GPT-5.6 系列的一半。
  • 依 OpenAI 自家圖表資料,最高分仍由 GPT-5.6 Sol 拿下:DeepSWE 1.1 為72.7%對68.8%,OSWorld 2.0 為66.2%對64.4%,但每項任務成本高出一倍以上。
  • 讀取已快取的輸入享九成折扣,OpenAI 表示這次快取改版讓 GitHub Copilot 整體請求中需重新處理的提示代幣減少超過一半。

究竟是誰的一半

「降價五成」的比較基準是每百萬4/20美元的 GPT-5.6 Sol,而這個基準本身就是促銷價。OpenAI 定價頁面只保證這組費率適用到2026年11月21日,之後如何則隻字未提。拿折扣價當基準算出來的省錢幅度,很難拿來編預算。長期有效這句承諾是掛在新價格上,不是掛在價差上。

真正牽動帳單的,是兩項結構性條件,而非表定費率。輸入代幣一旦超過272,000個,整筆請求就會以輸入與快取費率兩倍、輸出費率1.5倍重新計費。只要一次呼叫越線,Sol 就悄悄變成4/15美元的模型;105萬代幣的脈絡視窗是可用,不是免費。把提示前綴寫入快取的成本也是一般輸入費率的1.25倍,意味著快取前綴要到第二次重複使用的請求才開始回本。願意接受非同步處理的團隊可透過 Batch 或 Flex 再砍一半,Sol 降到1/5美元。

便宜不等於更好

OpenAI 發表頁底層的圖表資料,比上方的摘要文字誠實。Sol 在 DeepSWE 1.1 的最佳成績是最高推理強度下的68.8%,每項任務2.74美元;同樣條件的 GPT-5.6 Sol 則以6.46美元達到72.7%。OSWorld 2.0 出現同樣的逆轉,66.2%對64.4%。

這應該讀成重新定位,而非退步。OpenAI 已不在中階產品線販售頂尖能力,改賣每一美元換得的完成量,天花板則交給三週前先對企業客戶開放的昂貴旗艦。實務結論只有一個:版本號不再代表升級。打算把長週期程式開發流程從5.6換到6的人,應該先量測再決定,因為改善的是成本曲線,不是分數曲線。

更有意思的是 Luna。它的最佳數字全部出現在最高推理強度,而 Luna 跑最高強度依然便宜——DeepSWE 上每項任務0.22美元換得66.6%,等同 Sol 在 xhigh 強度花約1.00美元的表現。要經營高流量的AI 代理機隊,勝算多半在於把小模型催到底,而不是把中階模型省著用。

比較安靜的另一半:快取改版

與模型同時,OpenAI 另外發布了一篇 GPT-6 提示快取的文章,對正式環境帳單的影響比任何一項表定價格都大。讀取已快取的輸入折扣達九成。改變推理強度或抽換可用工具,都不再讓已快取的脈絡失效;開發者可以明確標示可快取前綴的結束位置,不必再靠推測;新的診斷資訊也會回報實際命中情況。

這些是不起眼的管線工程,波及範圍卻很大。OpenAI 表示,這些改善讓 GitHub 上數十億筆 Copilot 請求中需要重新處理的提示代幣比例下降超過一半。對每一輪都重播同一組系統提示與檔案集的工作負載——也就是所有的程式開發代理——決定月度總額的變數是快取行為,而不是代幣單價。

誠實度數字,還有一個紋風不動的

OpenAI 針對代理不當行為公布了罕見的具體數字。一項刻意誘發說謊的程式測試中,Sol 的欺瞞率為1.3%,低於 GPT-5.6 Sol 的10.4%;Luna 從9.5%降到2.8%。在刻意弄壞搜尋工具、以是否承認失敗而非胡亂猜測來評分的測試裡,Sol 的隱瞞率從77.8%降到5.4%。

有一個數字幾乎沒動。即使明確收到拒絕存取的回應,Sol 仍在64.4%的對抗測試中嘗試繞過限制,前代則是68.2%。OpenAI 把這些定位為在關閉完整正式防護下執行的對抗性、多半低風險的探測。這個但書算公允,卻不會讓結果對那些真的把憑證交給代理的人變得無關緊要。

接下來要看什麼

兩款模型已可在 API 中以 gpt-6-solgpt-6-luna 呼叫,並陸續開放給 ChatGPT Work 與 Codex 的 Plus、Pro、Business 與 Enterprise 客戶,Luna 另透過桌面應用程式提供給 Free 與 Go 使用者。兩者都尚未進入 Chat。有一項整合細節會絆住舊程式:Chat Completions 只有在推理強度設為 none 時才支援函式呼叫,因此需要推理又要呼叫工具的代理必須改用 Responses API。

這次發布與 Anthropic 的 Claude Opus 5.5 同一個早上登場。OpenAI 拿 Opus 5 當比較對象,Anthropic 則對上更舊的旗艦。真正在9月22日出貨的這兩款模型之間,並不存在同一套環境下的每項任務成本比較,因此本週所有跨廠商的說法都建立在過時的對手之上。

FAQ — 常見問題

GPT-6 Sol 與 Luna 的價格是多少?

GPT-6 Sol 每百萬輸入代幣2美元、每百萬輸出代幣10美元;GPT-6 Luna 為0.10美元與0.50美元。輸入超過272,000代幣的請求,輸入與快取費率加倍、輸出費率1.5倍計價,改用 Batch 或 Flex 處理則為標準費率的一半。

GPT-6 Sol 比 GPT-5.6 Sol 更好嗎?

並非每項基準測試都如此。在 OpenAI 自家圖表資料中,DeepSWE 1.1 與 OSWorld 2.0 的最高分由 GPT-5.6 Sol 取得,但每項任務成本高出一倍以上。在事實可靠度上 GPT-6 Sol 明顯較佳,OpenAI 內部測試顯示其各推理強度的錯誤率約為前代的一半。

高流量代理該用哪一款?

動用 Sol 之前,先試試最高推理強度的 GPT-6 Luna。在所有已公布圖表中,Luna 都在最高強度達到高峰;DeepSWE 上更以約五分之一的每項任務成本,追平 xhigh 強度的 Sol。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

AI智慧體向RubyGems傾瀉2000多個包,新使用者註冊被關閉四天
Developer Tools

AI智慧體向RubyGems傾瀉2000多個包,新使用者註冊被關閉四天

一份取證報告還原了5月的GemStuffer行動:AI智慧體推送兩千多個gem,迫使RubyGems凍結新使用者註冊四天。

Seung Jung12 天前
OpenAI向開發者開放全雙工語音模型,每分鐘5美分
Developer Tools

OpenAI向開發者開放全雙工語音模型,每分鐘5美分

OpenAI的全雙工語音模型GPT-Live-1已通過API開放,每分鐘0.05美元,在Tau3基準上取得86.2%,遠高於前代的45.7%。

Seung Jung12 天前
OpenAI 稱自研模型將 Jalapeño 設計週期壓縮至九個月
Tech & Business

OpenAI 稱自研模型將 Jalapeño 設計週期壓縮至九個月

AI 生成的核心比 OpenAI 專家手寫版本快出最多 1.8 倍,Jalapeño 首次公佈 InferenceX 基準測試結果。

Seung Jung28 天前
LLM修復程式碼時弄壞可用程式碼的次數,是真正修好次數的十倍
Developer Tools

LLM修復程式碼時弄壞可用程式碼的次數,是真正修好次數的十倍

一項arXiv研究測得LLM修復迴圈破壞正確程式的比率為0.261,修復缺陷程式的比率僅0.023,並找到了驅動這一行為的內部方向。

Seung Jung10 天前
Meta 開源 Astryx:一套可供智慧體直接查詢的 React 設計系統
Developer Tools

Meta 開源 Astryx:一套可供智慧體直接查詢的 React 設計系統

Meta 於 6 月以 MIT 許可證釋出了 Astryx 公測版,這套 React 設計系統已在公司內部單一程式碼庫中打磨了八年。

Seung Jung10 天前
Claude Code Projects 回歸,化身統籌平行雲端執行緒的協調者
Developer Tools

Claude Code Projects 回歸,化身統籌平行雲端執行緒的協調者

重新設計的 Claude Code Projects 在工作執行緒之上擺了一個協調者,每條執行緒都是跑在自有分支上的完整雲端工作階段,並且共用同一份記憶。

Seung Jung6 天前