AI Newsway

ChatGPT 在 79% 的購物回答中直接點名首選,Gemini 只有 7%

一份涵蓋 1,536 則回應的稽核發現,兩套助理引用的來源幾乎毫無交集,而透過 API 進行的研究看不到消費者真正看見的畫面

|5分鐘閱讀0
Online shopping illustration — the audit covered 117 real product-recommendation queries put to ChatGPT, Gemini and Google AI Overviews.
Online shopping illustration — the audit covered 117 real product-recommendation queries put to ChatGPT, Gemini and Google AI Overviews.

問它該買哪支手機,Google 的 AI Overviews 會說某款機型普遍獲得最高評價;ChatGPT 則會說,我現在的選擇是這一支。本週公布的一份稽核報告指出,這種語氣差異不是文風上的習慣,而是 AI 助理在提供商業建議時一道可量測且成系統的裂縫,而且出現在兩家公司正把廣告放進同一個介面的時間點上。

重點摘要

  • 在 1,536 則受評估的回應中,ChatGPT 在推薦商品的回答裡有 79% 以第一人稱表達偏好,Gemini 為 7%,Google AI Overviews 只有 2%。
  • 面對同一道問題,ChatGPT 與 Gemini 介面所顯示的來源網域平均僅 5.4% 相同,而且在 76.7% 的比較中完全沒有任何一個共同網域。
  • 業者 API 無法重現消費者看到的內容,與自家介面的網域重疊率在 ChatGPT 為 12.0%、Gemini 為 14.8%,這動搖了稽核這類系統的標準作法。

這份稽核怎麼做的

這項由馬斯垂克大學、烏特勒支大學與蘇黎世大學團隊發表於 arXiv 的研究,起點是一份名為 ConsumerQ 的資料集:2,528 則由真實使用者、而非研究人員撰寫的商業建議提問。團隊從中抽出 117 道真正的商品推薦問題,分別送入五個介面——ChatGPT 與 Gemini 的消費者介面、兩者的 API,以及 Google 搜尋的 AI Overviews——在固定地點蒐集了 1,755 筆觀測,且每一次介面請求都配對一次 API 請求。

配對之所以重要,是因為這篇論文最銳利的發現針對的是方法,而不是某一套助理。既有的生成式搜尋稽核研究多半基於成本與可重現性的考量,透過業者 API 送出研究人員撰寫的樣板提問。作者主張,至少在商業建議這個領域,這條捷徑量到的是消費者從未遇見的東西。

三套助理,三種答案

最明顯的落差在於表述方式。ChatGPT 在 79% 的回應中以第一人稱表態,Gemini 為 7%,AI Overviews 為 2%。把某項商品直接定性為最佳的比例,ChatGPT 是 73%,Gemini 為 43%,AI Overviews 為 48%。同一道問題於是可能以個人推薦、無可爭議的贏家,或一份選項清單的形式回來,差別只在於消費者打開了哪一個產品。

而且結果並不穩定。重複送出完全相同的請求,推薦商品會改變,連表述方式都會翻轉:在 27% 至 40% 的重複案例中,系統把先前未曾稱為最佳的商品說成了最佳。問兩次的消費者,並不等於把同一個問題問了兩次。

引用這一層幾乎沒有交集

來源的分歧比答案更大。面對相同提問,ChatGPT 與 Gemini 介面平均只共享 5.4% 的顯示網域,在 76.7% 的比較中連一個共同網域都沒有。重複請求也不會讓來源收斂成一組穩定清單,反而持續冒出新的網域。

這種分散有其商業成因。助理能引用哪些媒體取決於授權:OpenAI 與 Google 都握有 Reddit 即時資料協議,而 OpenAI 與 Axel Springer 的合作,把 Politico 與 Business Insider 納入了 OpenAI 的來源池。檢索增強這一層並不是中立的索引,而是談判的產物。

主管機關為何該在意 API 落差

真正有殺傷力的是 API 這項結果。介面與自家 API 之間的平均網域重疊率,ChatGPT 為 12.0%、Gemini 為 14.8%,而且兩者揭露的來源資訊在種類與層級上全然不同。透過 API 提問的稽核者,看的是與消費者所用不同的另一套系統。

時間點格外敏感。歐盟執委會已於 2026 年 8 月 31 日依《數位服務法》(DSA) 將 ChatGPT 指定為超大型線上搜尋引擎,隨之而來的是系統性風險義務——包含線上購物中的消費者保護——以及獨立稽核與研究人員資料取用權。論文的結論是,這類稽核無法透過 API 執行,卻仍聲稱自己描述了消費者經驗。

同一個介面上的商業壓力也在累積。OpenAI 在 8 月把 ChatGPT 的廣告擴張到 31 個歐洲市場,而依目前規模最大的公開使用量統計,商品推薦類提問已占 ChatGPT 對話的約 2%。本站曾報導 OpenAI 測試可對話式廣告格式的動向;這份稽核提供的,正是日後推薦行為若有變化時可供對照的基準線。

作者給同行的建議偏向程序而非警世:稽核消費者介面、重複每一道提問,並載明自己觀測的是哪一層來源。透過 API 取得的單次回應,無法代表人們在下單當下真正從大型語言模型那裡聽到的建議。

常見問題

這項研究是否證明 ChatGPT 收錢推薦商品?

沒有。這份稽核量測的是推薦如何被表述、是否一致,以及哪些來源會出現,並未處理任何露出是否為付費。它的貢獻在於留下一條廣告上線前的基準線,並提出一套足以偵測變化的方法,作者認為這正是主管機關與研究者目前所缺。

研究人員為什麼不能直接使用 ChatGPT 與 Gemini 的 API?

因為 API 回傳的是實質上不同的一幅畫面。與對應消費者介面的平均網域重疊率,ChatGPT 為 12.0%、Gemini 為 14.8%,而兩層揭露的來源資訊連種類都不一樣,因此不能預設 API 上的觀測能代表消費者所見。

這份提問資料集有公開嗎?

研究團隊彙整了 2,528 則由使用者撰寫的真實商業建議提問,建立 ConsumerQ,並從中抽出論文所分析的 117 道商品推薦問題。資料集與蒐集流程的完整說明收錄於 arXiv 預印本。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

ChatGPT Images 2.5生成延遲減半,新增手繪畫布
LLM & Chatbots

ChatGPT Images 2.5生成延遲減半,新增手繪畫布

OpenAI推出ChatGPT Images 2.5,延遲最多降低50%,新增Sketch繪圖畫布、模板、定點批註,並向API釋出兩款新模型。

Seung Jung6 天前
OpenAI同日推出Data智慧體與華爾街版ChatGPT
LLM & Chatbots

OpenAI同日推出Data智慧體與華爾街版ChatGPT

OpenAI在同一個星期四釋出了面向ChatGPT Work的Data智慧體,以及與Morgan Stanley、Evercore共建的ChatGPT for Financial Services。

Seung Jung6 天前
iOS 27 程式碼顯示:Siri 伺服器模型可換成 Claude 或 GPT-5.6
LLM & Chatbots

iOS 27 程式碼顯示:Siri 伺服器模型可換成 Claude 或 GPT-5.6

iOS 27 與 macOS 27 Golden Gate 的私有框架中出現 Model Delegation API 與 Inference Provider 協定,可把 Siri 的規劃器交給 Claude 接手。

Seung Jung昨天
GPT-6 Astra上崗:OpenAI最貴模型把全部籌碼押在電腦操作上
LLM & Chatbots

GPT-6 Astra上崗:OpenAI最貴模型把全部籌碼押在電腦操作上

OpenAI的GPT-6 Astra面向企業使用者開放,具備電腦操作能力、百萬token上下文和10/50美元定價,其頭條成績則附帶測試框架的註腳。

Seung Jung7 天前
Claude只對成年人開放,而它的年齡識別正在誤封成年使用者
LLM & Chatbots

Claude只對成年人開放,而它的年齡識別正在誤封成年使用者

Anthropic公開了Claude執行18歲以上政策的具體機制:分類器會停用疑似未成年人的賬號,被誤判的成年使用者可通過Yoti驗證恢復訪問。

Seung Jung5 天前
Gemini登陸Windows:一個Alt+Space快捷鍵,直撲桌面入口
LLM & Chatbots

Gemini登陸Windows:一個Alt+Space快捷鍵,直撲桌面入口

谷歌Windows版Gemini原生應用可用Alt+Space浮在任意程式之上,接入Gmail和Google Drive,面向全球Windows 10和11開放。

Seung Jung6 天前