어떤 스마트폰을 사야 하느냐고 묻자 Google의 AI Overviews는 특정 모델이 대체로 최고 평가를 받는다고 답한다. ChatGPT는 지금 자신이 고르는 제품은 이것이라고 말한다. 이번 주 공개된 감사 보고서는 이 어조 차이가 문체상의 습관이 아니라고 지적한다. AI 어시스턴트가 상업적 조언을 전달하는 방식에 측정 가능한 체계적 균열이 있다는 것이다. 두 회사가 바로 그 화면에 광고를 심고 있는 시점에 나온 결과다.
핵심 요약
- 평가 대상 응답 1,536건에서 ChatGPT는 제품을 추천하는 답변의 79%에서 1인칭 선호를 드러냈다. Gemini는 7%, Google AI Overviews는 2%에 그쳤다.
- 같은 질문에 대해 ChatGPT와 Gemini 인터페이스가 함께 보여준 출처 도메인은 평균 5.4%였고, 비교 사례의 76.7%에서는 겹치는 도메인이 하나도 없었다.
- 사업자 API는 소비자가 보는 화면을 재현하지 못했다. 자사 인터페이스와 도메인이 겹친 비율은 ChatGPT 12.0%, Gemini 14.8%에 불과해 이런 시스템을 감사해 온 표준 방법론의 근거가 흔들렸다.
감사는 어떻게 설계됐나
마스트리흐트대, 위트레흐트대, 취리히대 연구진이 arXiv에 올린 이 연구는 연구자가 아니라 실제 사용자가 쓴 상업적 조언 질의 2,528건을 모은 데이터셋 ConsumerQ에서 출발한다. 연구진은 이 가운데 실제 제품 추천 질문 117개를 뽑아 ChatGPT와 Gemini의 소비자 인터페이스, 두 서비스의 API, Google 검색의 AI Overviews까지 다섯 경로에 각각 입력했다. 고정된 위치에서 관측 1,755건을 수집했고, 인터페이스 요청마다 API 요청을 짝지었다.
짝을 지은 데는 이유가 있다. 이 논문의 가장 날카로운 결론은 특정 어시스턴트가 아니라 방법론을 겨눈다. 생성형 검색을 다룬 기존 감사 연구는 비용과 재현성 때문에 대부분 사업자 API에 연구자가 만든 템플릿 질의를 넣는 방식을 쓴다. 저자들은 적어도 상업적 조언 영역에서 이 지름길이 소비자가 결코 마주하지 않는 무언가를 측정하고 있다고 본다.
어시스턴트 셋, 답변의 성격도 셋
가장 눈에 띄는 결과는 표현 방식의 격차다. ChatGPT는 응답의 79%에서 1인칭으로 선호를 밝혔고 Gemini는 7%, AI Overviews는 2%였다. 특정 제품을 최고라고 규정한 비율도 ChatGPT가 73%로 Gemini 43%, AI Overviews 48%를 앞섰다. 같은 질문이 개인적 추천으로도, 이론의 여지 없는 승자로도, 선택지 목록으로도 돌아온다. 차이를 만드는 건 소비자가 어떤 앱을 열었느냐뿐이다.
결과가 고정돼 있지도 않다. 동일한 요청을 반복하면 추천 제품이 바뀌고 표현 방식까지 뒤집힌다. 앞서 최고라고 말하지 않았던 제품을 반복 요청에서 최고로 제시한 사례가 27~40%에 달했다. 두 번 물어본 소비자는 같은 질문을 두 번 한 것이 아니다.
인용 계층은 거의 겹치지 않는다
출처는 답변보다 더 벌어진다. 동일 질의에서 ChatGPT와 Gemini 인터페이스가 공유한 표시 도메인은 평균 5.4%였고, 비교 사례의 76.7%에서는 공통 도메인이 전혀 없었다. 요청을 반복해도 출처가 안정된 집합으로 수렴하지 않고 새 도메인이 계속 등장했다.
이 격차에는 상업적 배경이 있다. 어시스턴트가 어떤 매체를 끌어다 쓸 수 있는지는 라이선스가 결정한다. OpenAI와 Google은 모두 Reddit 실시간 데이터 계약을 확보했고, OpenAI가 Axel Springer와 맺은 계약은 Politico와 Business Insider를 OpenAI의 출처 풀에 넣었다. 검색 증강 계층은 중립적 색인이 아니라 협상의 산물이다.
규제 당국이 API 격차를 봐야 하는 이유
실질적 파괴력은 API 결과에 있다. 인터페이스와 자사 API 사이의 평균 도메인 중복률은 ChatGPT 12.0%, Gemini 14.8%였고, 두 경로가 노출하는 출처 정보는 종류와 계층 자체가 달랐다. API로 질의하는 감사자는 소비자가 쓰는 것과 다른 시스템을 들여다보고 있는 셈이다.
시점도 공교롭다. 유럽연합 집행위원회는 2026년 8월 31일 ChatGPT를 디지털서비스법(DSA)상 초대형 온라인 검색엔진으로 지정했다. 온라인 구매에서의 소비자 보호를 포함한 시스템 리스크 의무와 독립 감사, 연구자 데이터 접근권이 함께 따라붙는다. 논문의 결론은 그런 감사를 API로 수행하면서 소비자 경험을 설명한다고 주장할 수는 없다는 것이다.
같은 화면에 상업적 압력도 쌓이고 있다. OpenAI는 8월 ChatGPT 광고를 유럽 31개 시장으로 확대했고, 가장 큰 규모로 공개된 이용 실태 측정에 따르면 제품 추천 질의는 이미 ChatGPT 대화의 약 2%를 차지한다. 본지는 OpenAI가 대화형 광고 형식을 실험하는 정황을 보도한 바 있다. 이번 감사는 향후 추천 행태가 달라졌을 때 그 변화를 재볼 기준선을 제공한다.
저자들이 동료 연구자에게 내놓은 권고는 경고라기보다 절차에 가깝다. 소비자 인터페이스를 감사하고, 모든 질의를 반복하고, 어느 출처 계층을 관측했는지 밝히라는 것이다. API로 한 번 받아낸 응답은 구매 시점에 사람들이 대규모 언어 모델에게서 실제로 듣는 조언을 대신할 수 없다.
자주 묻는 질문
이 연구는 ChatGPT가 돈을 받고 제품을 추천한다고 밝혔나?
아니다. 이번 감사는 추천이 어떤 방식으로 표현되고 얼마나 일관되며 어떤 출처가 등장하는지를 측정했을 뿐, 특정 노출이 유료였는지는 다루지 않았다. 광고 도입 이전의 기준선을 기록으로 남기고 변화를 포착할 방법론을 제시한 것이 이 연구의 기여다. 저자들은 규제 당국과 연구자에게 지금 없는 것이 바로 그 기준선이라고 본다.
연구자들이 ChatGPT와 Gemini의 API를 그냥 쓰면 안 되는 이유는?
API가 실질적으로 다른 화면을 돌려주기 때문이다. 해당 소비자 인터페이스와의 평균 도메인 중복률은 ChatGPT 12.0%, Gemini 14.8%에 그쳤고, 두 계층이 노출하는 출처 정보는 종류부터 달랐다. API 관측치가 소비자가 보는 것을 대표한다고 전제할 수 없다.
질의 데이터셋은 공개돼 있나?
연구진은 사용자가 직접 쓴 상업적 조언 질의 2,528건을 모아 ConsumerQ를 구축했고, 논문에서 분석한 제품 추천 질문 117개를 여기서 뽑았다. 데이터셋과 수집 프로토콜의 자세한 내용은 arXiv 프리프린트에 담겨 있다.






