問它該買哪支手機,Google 的 AI Overviews 會說某款機型普遍獲得最高評價;ChatGPT 則會說,我現在的選擇是這一支。本週公布的一份稽核報告指出,這種語氣差異不是文風上的習慣,而是 AI 助理在提供商業建議時一道可量測且成系統的裂縫,而且出現在兩家公司正把廣告放進同一個介面的時間點上。
重點摘要
- 在 1,536 則受評估的回應中,ChatGPT 在推薦商品的回答裡有 79% 以第一人稱表達偏好,Gemini 為 7%,Google AI Overviews 只有 2%。
- 面對同一道問題,ChatGPT 與 Gemini 介面所顯示的來源網域平均僅 5.4% 相同,而且在 76.7% 的比較中完全沒有任何一個共同網域。
- 業者 API 無法重現消費者看到的內容,與自家介面的網域重疊率在 ChatGPT 為 12.0%、Gemini 為 14.8%,這動搖了稽核這類系統的標準作法。
這份稽核怎麼做的
這項由馬斯垂克大學、烏特勒支大學與蘇黎世大學團隊發表於 arXiv 的研究,起點是一份名為 ConsumerQ 的資料集:2,528 則由真實使用者、而非研究人員撰寫的商業建議提問。團隊從中抽出 117 道真正的商品推薦問題,分別送入五個介面——ChatGPT 與 Gemini 的消費者介面、兩者的 API,以及 Google 搜尋的 AI Overviews——在固定地點蒐集了 1,755 筆觀測,且每一次介面請求都配對一次 API 請求。
配對之所以重要,是因為這篇論文最銳利的發現針對的是方法,而不是某一套助理。既有的生成式搜尋稽核研究多半基於成本與可重現性的考量,透過業者 API 送出研究人員撰寫的樣板提問。作者主張,至少在商業建議這個領域,這條捷徑量到的是消費者從未遇見的東西。
三套助理,三種答案
最明顯的落差在於表述方式。ChatGPT 在 79% 的回應中以第一人稱表態,Gemini 為 7%,AI Overviews 為 2%。把某項商品直接定性為最佳的比例,ChatGPT 是 73%,Gemini 為 43%,AI Overviews 為 48%。同一道問題於是可能以個人推薦、無可爭議的贏家,或一份選項清單的形式回來,差別只在於消費者打開了哪一個產品。
而且結果並不穩定。重複送出完全相同的請求,推薦商品會改變,連表述方式都會翻轉:在 27% 至 40% 的重複案例中,系統把先前未曾稱為最佳的商品說成了最佳。問兩次的消費者,並不等於把同一個問題問了兩次。
引用這一層幾乎沒有交集
來源的分歧比答案更大。面對相同提問,ChatGPT 與 Gemini 介面平均只共享 5.4% 的顯示網域,在 76.7% 的比較中連一個共同網域都沒有。重複請求也不會讓來源收斂成一組穩定清單,反而持續冒出新的網域。
這種分散有其商業成因。助理能引用哪些媒體取決於授權:OpenAI 與 Google 都握有 Reddit 即時資料協議,而 OpenAI 與 Axel Springer 的合作,把 Politico 與 Business Insider 納入了 OpenAI 的來源池。檢索增強這一層並不是中立的索引,而是談判的產物。
主管機關為何該在意 API 落差
真正有殺傷力的是 API 這項結果。介面與自家 API 之間的平均網域重疊率,ChatGPT 為 12.0%、Gemini 為 14.8%,而且兩者揭露的來源資訊在種類與層級上全然不同。透過 API 提問的稽核者,看的是與消費者所用不同的另一套系統。
時間點格外敏感。歐盟執委會已於 2026 年 8 月 31 日依《數位服務法》(DSA) 將 ChatGPT 指定為超大型線上搜尋引擎,隨之而來的是系統性風險義務——包含線上購物中的消費者保護——以及獨立稽核與研究人員資料取用權。論文的結論是,這類稽核無法透過 API 執行,卻仍聲稱自己描述了消費者經驗。
同一個介面上的商業壓力也在累積。OpenAI 在 8 月把 ChatGPT 的廣告擴張到 31 個歐洲市場,而依目前規模最大的公開使用量統計,商品推薦類提問已占 ChatGPT 對話的約 2%。本站曾報導 OpenAI 測試可對話式廣告格式的動向;這份稽核提供的,正是日後推薦行為若有變化時可供對照的基準線。
作者給同行的建議偏向程序而非警世:稽核消費者介面、重複每一道提問,並載明自己觀測的是哪一層來源。透過 API 取得的單次回應,無法代表人們在下單當下真正從大型語言模型那裡聽到的建議。
常見問題
這項研究是否證明 ChatGPT 收錢推薦商品?
沒有。這份稽核量測的是推薦如何被表述、是否一致,以及哪些來源會出現,並未處理任何露出是否為付費。它的貢獻在於留下一條廣告上線前的基準線,並提出一套足以偵測變化的方法,作者認為這正是主管機關與研究者目前所缺。
研究人員為什麼不能直接使用 ChatGPT 與 Gemini 的 API?
因為 API 回傳的是實質上不同的一幅畫面。與對應消費者介面的平均網域重疊率,ChatGPT 為 12.0%、Gemini 為 14.8%,而兩層揭露的來源資訊連種類都不一樣,因此不能預設 API 上的觀測能代表消費者所見。
這份提問資料集有公開嗎?
研究團隊彙整了 2,528 則由使用者撰寫的真實商業建議提問,建立 ConsumerQ,並從中抽出論文所分析的 117 道商品推薦問題。資料集與蒐集流程的完整說明收錄於 arXiv 預印本。






