渥合數位文章被 ChatGPT 引用不代表被 Gemini 引用:三份研究的重疊率都不到兩成

被 ChatGPT 引用不代表被 Gemini 引用:三份研究的重疊率都不到兩成

2026年9月13日SEO/GEO/AIO 優化· Howshin Wang
深藍底橫條圖:三條長度不一的藍色長條分別標示 Writesonic 11.9%、MentionBird 12.7%、搜霸 SEOBAR 17.8%,左側標題為「被 ChatGPT 引用不代表被 Gemini 引用」

TL;DR

  • 三份獨立研究分別量到 ChatGPT 與 Gemini 的引用來源重疊率為 11.9%、12.7% 與 17.8%,樣本規模相差三個數量級,結論一致
  • 兩個引擎對同一個問題各自產生一份名單,被其中一個引用不代表會被另一個引用
  • Gemini 確實比 ChatGPT 更常去查資料,但落差集中在特定問題類型,並非全面
  • 同一個「ChatGPT 引用率」指標,用 API 量到 79.8%、用消費者介面量到個位數,兩者不能互相推論
  • 判讀任何 AI 能見度數字之前,先確認它測的是哪個引擎、哪種介面、哪一類問題

目錄

三份研究的數字:11.9%、12.7% 與 17.8%
重疊率偏低的原因:兩份名單而非一份排名
查資料的比例:Gemini 高於 ChatGPT,但看問題類型
API 與消費者介面:同一個指標的兩種答案
對經營者的三項判斷

引言

把品牌名丟進 ChatGPT,看它有沒有提到自己,這是多數人檢查 AI 能見度的方式。問題在於這個動作只測了一個引擎。

2026 年下半有三份規模與方法都不同的研究,各自測量了同一件事:ChatGPT 與 Gemini 回答同一個問題時,引用的來源有多少是重疊的。三份的答案落在同一個區間,而那個區間比多數人預期的低很多。

三份研究的數字:11.9%、12.7% 與 17.8%

研究 重疊率 樣本 取樣方式
Writesonic(2026-07) 11.9% 88,969 組提問 四個引擎,以 Jaccard 相似度計算
MentionBird(2026-09) 12.7% 517 題、17 週、70,596 則回答 使用 API 模型
搜霸 SEOBAR(2026-09) 17.8% 36 題、216 次取樣 台灣問句,未登入的消費者網頁介面

三者都以「兩個引擎都引用過的網域數,除以兩者引用過的全部網域數」計算,口徑一致。樣本規模從 216 次到近九萬組提問,相差三個數量級,結果卻收斂在 12% 到 18% 之間。

Writesonic 那份另外指出,所有被引用的網域中有 72% 到 73% 只出現在單一引擎;四個引擎都引用的比例僅 3.8%。搜霸那份的樣本較小且限定台灣問句,候選網域的母體本來就窄,重疊率偏高並不意外——台灣談 SEO 的網站數量有限,兩個引擎撞在一起的機會自然比全球樣本高。

重疊率偏低的原因:兩份名單而非一份排名

搜尋引擎時代的心智模型是一份排名:大家搶同一個位置,名次有高低,但清單是同一份。三份研究指向的結構不同——兩個引擎各自產生一份名單,彼此交集不到兩成。

Writesonic 的結論寫得直接:沒有任何一組引擎組合,能讓「在其中一個被引用」可靠地預測「在另一個也被引用」。這句話對經營者的意思是,在 ChatGPT 上查到自己被提及,並不能推論 Gemini 那邊的情況,反過來也一樣。

這與另一個已知現象疊在一起會更麻煩:AI 回答本身帶有隨機性,同一個問題連問數次,名單就會換一批。相隔 28 天重測的實測顯示,前次被推薦的店家只有約三成仍在名單上。單次、單引擎的檢查同時承受兩種變異,得到的結論相當脆弱。

查資料的比例:Gemini 高於 ChatGPT,但看問題類型

「Gemini 比較常去查資料」這個說法在三份研究裡都成立。MentionBird 量到 ChatGPT 在 79.8% 的回答中引用了頁面,Gemini 是 99.8%;每則回答的來源數是 6.21 對 11.36。

搜霸那份把問句分成三組,結果顯示落差並非全面,而是集中在特定類型:

問句類型 ChatGPT Gemini
推薦型(找可委託的對象) 96.3% 92.6%
知識型(詢問操作方式) 3.7% 59.3%
比較型(詢問差異與取捨) 3.7% 74.1%

問「有沒有推薦的公司」時兩個引擎行為幾乎一致,都會去查——使用者要的是具體名單,模型內部知識提供不了可驗證的業者資訊。問「canonical 標籤設錯會怎樣」時兩者分道揚鑣:Gemini 多半仍會列出來源,ChatGPT 多半直接以既有知識作答。

對內容配置的影響是不對稱的。教學型內容在 Gemini 有明確的引用路徑,在 ChatGPT 幾乎進不了那則回答。

API 與消費者介面:同一個指標的兩種答案

前一節的兩組數字放在一起會看到矛盾:MentionBird 說 ChatGPT 有 79.8% 的回答帶來源,搜霸說知識型問句只有 3.7%。差距二十倍。

兩邊都沒有測錯,差異來自測法。MentionBird 使用 API 模型而非消費者應用程式,題目全部是商業意圖;搜霸使用未登入的網頁介面,題目涵蓋三種類型。把搜霸的推薦型單獨拿出來看是 96.3%,與 79.8% 屬於同一個量級——真正分歧的是商業意圖以外的問題,而那類問題不在 MentionBird 的樣本裡。

這對判讀市面上的 AI 能見度數字有直接影響。多數工具透過 API 取樣,因為那是唯一能穩定大量執行的方式,但 API 與消費者看到的介面是兩條管線,系統提示、檢索管線與個人化都不相同。工具報出來的數字描述的是 API 的行為,不必然是你的客戶打開 App 時看到的東西。

要比較不同來源的數字之前,至少要先確認三件事:測的是哪個引擎、哪種介面、哪一類問題。三者任一不同,數字就不可比。

對經營者的三項判斷

能見度要分引擎記錄。 重疊率不到兩成,代表單一引擎的觀測沒有代表性。要當經營指標就至少涵蓋兩個引擎,並分開記錄,不要合併成一個總分。

要分問題類型看。 同一個引擎在不同問句類型下的行為差很多。用品牌詞查到的結果,不能推論客戶用「有沒有推薦的公司」問時會看到什麼。

看數字之前先問它怎麼測的。 樣本數、引擎、介面、問題類型、取樣次數,任何一項沒交代的數字都難以判讀。願意寫清楚方法與限制的來源,比只給結論的來源可靠。

這三件事都不需要工具就能做,只是要固定條件、記錄下來、重複執行。單次查詢得到的是一個印象,不是一個指標。

參考來源

常見問題

Q

被 ChatGPT 引用,Gemini 那邊也會引用嗎?

不一定。三份獨立研究分別量到兩者的來源重疊率為 11.9%、12.7% 與 17.8%,樣本規模相差三個數量級,結論一致。Writesonic 的研究明確指出,沒有任何一組引擎組合能讓「在其中一個被引用」可靠地預測「在另一個也被引用」。檢查 AI 能見度時,兩個引擎要分開記錄。

Q

Gemini 真的比 ChatGPT 更常引用來源嗎?

整體上是。MentionBird 量到 ChatGPT 在 79.8% 的回答中引用頁面、Gemini 是 99.8%,每則回答的來源數為 6.21 對 11.36。但落差集中在特定問題類型:問「有沒有推薦的公司」時兩者都會查(96.3% 對 92.6%),問操作方式與觀念差異時才拉開(3.7% 對 59.3%)。

Q

為什麼不同工具報出來的 AI 引用率差這麼多?

多半是測法不同。用 API 取樣與用消費者網頁介面取樣是兩條管線,系統提示、檢索管線與個人化都不相同;題目類型也會大幅影響結果。比較不同來源的數字前,先確認三件事:測的是哪個引擎、哪種介面、哪一類問題。任一項不同,數字就不可比。

Q

那實務上該怎麼追蹤自己的 AI 能見度?

至少涵蓋兩個引擎並分開記錄,不要合併成一個總分;依問題類型分開觀察,品牌詞查到的結果不能推論客戶用「有沒有推薦的公司」問時會看到什麼;同一問句重複取樣數次,因為 AI 回答帶有隨機性。固定條件、記錄下來、重複執行,單次查詢得到的是印象不是指標。

看完文章想動手實作?

不想一個個手動設 SEO / GEO?

AHHA 自助架站平台內建 Schema.org、llms.txt、hreflang、FAQPage 的自動輸出,建站當天就具備被 Google 與 AI 系統讀取的技術基礎。

  • Schema.org / llms.txt / hreflang 自動輸出,不需撰寫程式
  • FAQPage、Article、LocalBusiness 等結構化資料自動產生
  • 內建 SEO + GEO + AI SEO 健檢,可即時檢測
  • 14 天免費試用,不需信用卡
免費試用 14 天看 SEO/GEO 服務方案

SEO/GEO/AIO 優化 分類其他文章

繼續閱讀同主題的延伸內容

App 設計費用怎麼算?報價區間與六個影響變數
App 開發費用的差距,多半來自技術路線、後端範圍與上架作業是否含在報價內。本文說明六個影響費用的變數、Apple 與 Google Play 的平台規費,以及比較不同廠商報價時該逐項確認的項目。想知…
AI Overview 會吃掉網站流量嗎?181 個頁面的實測結果
AI 摘要會不會讓網站流量減少?依據自家建置與維運的兩個中文網站、181 個頁面、28 天的資料,把生成式 AI 功能的曝光與同期點擊逐頁比對:AI 曝光占比 86.8% 的工具頁點閱率仍有 13.0…
AI 推薦的店家名單會變嗎?隔 28 天重測,約七成店家已不在名單上
AI 推薦的在地店家名單多久會換一次?把七月用過的 30 條問句原封不動重測,間隔 28 天、兩期共 353 筆回答逐條比對:ChatGPT 前期推薦的 367 家店只剩 102 家仍在名單上,留存約…
GEO 生成式引擎優化:在地商家評價影響性研究
峇里島 4,776 家餐飲商家的 AI 推薦研究顯示:評論數量影響能否進入候選集,星等則較可能影響入選後的位置;官網、價格與第三方提及同樣關鍵。

留言討論

只有會員能留言(防止垃圾訊息),留言顯示於此頁。

載入中...
← 返回文章