被 ChatGPT 引用不代表被 Gemini 引用:三份研究的重疊率都不到兩成

TL;DR
- 三份獨立研究分別量到 ChatGPT 與 Gemini 的引用來源重疊率為 11.9%、12.7% 與 17.8%,樣本規模相差三個數量級,結論一致
- 兩個引擎對同一個問題各自產生一份名單,被其中一個引用不代表會被另一個引用
- Gemini 確實比 ChatGPT 更常去查資料,但落差集中在特定問題類型,並非全面
- 同一個「ChatGPT 引用率」指標,用 API 量到 79.8%、用消費者介面量到個位數,兩者不能互相推論
- 判讀任何 AI 能見度數字之前,先確認它測的是哪個引擎、哪種介面、哪一類問題
目錄
三份研究的數字:11.9%、12.7% 與 17.8%
重疊率偏低的原因:兩份名單而非一份排名
查資料的比例:Gemini 高於 ChatGPT,但看問題類型
API 與消費者介面:同一個指標的兩種答案
對經營者的三項判斷
引言
把品牌名丟進 ChatGPT,看它有沒有提到自己,這是多數人檢查 AI 能見度的方式。問題在於這個動作只測了一個引擎。
2026 年下半有三份規模與方法都不同的研究,各自測量了同一件事:ChatGPT 與 Gemini 回答同一個問題時,引用的來源有多少是重疊的。三份的答案落在同一個區間,而那個區間比多數人預期的低很多。
三份研究的數字:11.9%、12.7% 與 17.8%
| 研究 | 重疊率 | 樣本 | 取樣方式 |
|---|---|---|---|
| Writesonic(2026-07) | 11.9% | 88,969 組提問 | 四個引擎,以 Jaccard 相似度計算 |
| MentionBird(2026-09) | 12.7% | 517 題、17 週、70,596 則回答 | 使用 API 模型 |
| 搜霸 SEOBAR(2026-09) | 17.8% | 36 題、216 次取樣 | 台灣問句,未登入的消費者網頁介面 |
三者都以「兩個引擎都引用過的網域數,除以兩者引用過的全部網域數」計算,口徑一致。樣本規模從 216 次到近九萬組提問,相差三個數量級,結果卻收斂在 12% 到 18% 之間。
Writesonic 那份另外指出,所有被引用的網域中有 72% 到 73% 只出現在單一引擎;四個引擎都引用的比例僅 3.8%。搜霸那份的樣本較小且限定台灣問句,候選網域的母體本來就窄,重疊率偏高並不意外——台灣談 SEO 的網站數量有限,兩個引擎撞在一起的機會自然比全球樣本高。
重疊率偏低的原因:兩份名單而非一份排名
搜尋引擎時代的心智模型是一份排名:大家搶同一個位置,名次有高低,但清單是同一份。三份研究指向的結構不同——兩個引擎各自產生一份名單,彼此交集不到兩成。
Writesonic 的結論寫得直接:沒有任何一組引擎組合,能讓「在其中一個被引用」可靠地預測「在另一個也被引用」。這句話對經營者的意思是,在 ChatGPT 上查到自己被提及,並不能推論 Gemini 那邊的情況,反過來也一樣。
這與另一個已知現象疊在一起會更麻煩:AI 回答本身帶有隨機性,同一個問題連問數次,名單就會換一批。相隔 28 天重測的實測顯示,前次被推薦的店家只有約三成仍在名單上。單次、單引擎的檢查同時承受兩種變異,得到的結論相當脆弱。
查資料的比例:Gemini 高於 ChatGPT,但看問題類型
「Gemini 比較常去查資料」這個說法在三份研究裡都成立。MentionBird 量到 ChatGPT 在 79.8% 的回答中引用了頁面,Gemini 是 99.8%;每則回答的來源數是 6.21 對 11.36。
搜霸那份把問句分成三組,結果顯示落差並非全面,而是集中在特定類型:
| 問句類型 | ChatGPT | Gemini |
|---|---|---|
| 推薦型(找可委託的對象) | 96.3% | 92.6% |
| 知識型(詢問操作方式) | 3.7% | 59.3% |
| 比較型(詢問差異與取捨) | 3.7% | 74.1% |
問「有沒有推薦的公司」時兩個引擎行為幾乎一致,都會去查——使用者要的是具體名單,模型內部知識提供不了可驗證的業者資訊。問「canonical 標籤設錯會怎樣」時兩者分道揚鑣:Gemini 多半仍會列出來源,ChatGPT 多半直接以既有知識作答。
對內容配置的影響是不對稱的。教學型內容在 Gemini 有明確的引用路徑,在 ChatGPT 幾乎進不了那則回答。
API 與消費者介面:同一個指標的兩種答案
前一節的兩組數字放在一起會看到矛盾:MentionBird 說 ChatGPT 有 79.8% 的回答帶來源,搜霸說知識型問句只有 3.7%。差距二十倍。
兩邊都沒有測錯,差異來自測法。MentionBird 使用 API 模型而非消費者應用程式,題目全部是商業意圖;搜霸使用未登入的網頁介面,題目涵蓋三種類型。把搜霸的推薦型單獨拿出來看是 96.3%,與 79.8% 屬於同一個量級——真正分歧的是商業意圖以外的問題,而那類問題不在 MentionBird 的樣本裡。
這對判讀市面上的 AI 能見度數字有直接影響。多數工具透過 API 取樣,因為那是唯一能穩定大量執行的方式,但 API 與消費者看到的介面是兩條管線,系統提示、檢索管線與個人化都不相同。工具報出來的數字描述的是 API 的行為,不必然是你的客戶打開 App 時看到的東西。
要比較不同來源的數字之前,至少要先確認三件事:測的是哪個引擎、哪種介面、哪一類問題。三者任一不同,數字就不可比。
對經營者的三項判斷
能見度要分引擎記錄。 重疊率不到兩成,代表單一引擎的觀測沒有代表性。要當經營指標就至少涵蓋兩個引擎,並分開記錄,不要合併成一個總分。
要分問題類型看。 同一個引擎在不同問句類型下的行為差很多。用品牌詞查到的結果,不能推論客戶用「有沒有推薦的公司」問時會看到什麼。
看數字之前先問它怎麼測的。 樣本數、引擎、介面、問題類型、取樣次數,任何一項沒交代的數字都難以判讀。願意寫清楚方法與限制的來源,比只給結論的來源可靠。
這三件事都不需要工具就能做,只是要固定條件、記錄下來、重複執行。單次查詢得到的是一個印象,不是一個指標。
參考來源
- Do AI Engines Cite the Same Sources? A Study of 161,286 Prompts,Writesonic,2026 年 7 月
- ChatGPT and Gemini Overlap on 12.7% of the Domains They Cite for the Same Question,MentionBird,2026 年 9 月
- AI SEO/GEO 實測:ChatGPT 與 Gemini 引用來源重疊 17.8%,搜霸 SEOBAR,2026 年 9 月(原始資料以 CC BY 4.0 公開)
常見問題
被 ChatGPT 引用,Gemini 那邊也會引用嗎?
不一定。三份獨立研究分別量到兩者的來源重疊率為 11.9%、12.7% 與 17.8%,樣本規模相差三個數量級,結論一致。Writesonic 的研究明確指出,沒有任何一組引擎組合能讓「在其中一個被引用」可靠地預測「在另一個也被引用」。檢查 AI 能見度時,兩個引擎要分開記錄。
Gemini 真的比 ChatGPT 更常引用來源嗎?
整體上是。MentionBird 量到 ChatGPT 在 79.8% 的回答中引用頁面、Gemini 是 99.8%,每則回答的來源數為 6.21 對 11.36。但落差集中在特定問題類型:問「有沒有推薦的公司」時兩者都會查(96.3% 對 92.6%),問操作方式與觀念差異時才拉開(3.7% 對 59.3%)。
為什麼不同工具報出來的 AI 引用率差這麼多?
多半是測法不同。用 API 取樣與用消費者網頁介面取樣是兩條管線,系統提示、檢索管線與個人化都不相同;題目類型也會大幅影響結果。比較不同來源的數字前,先確認三件事:測的是哪個引擎、哪種介面、哪一類問題。任一項不同,數字就不可比。
那實務上該怎麼追蹤自己的 AI 能見度?
至少涵蓋兩個引擎並分開記錄,不要合併成一個總分;依問題類型分開觀察,品牌詞查到的結果不能推論客戶用「有沒有推薦的公司」問時會看到什麼;同一問句重複取樣數次,因為 AI 回答帶有隨機性。固定條件、記錄下來、重複執行,單次查詢得到的是印象不是指標。
不想一個個手動設 SEO / GEO?
AHHA 自助架站平台內建 Schema.org、llms.txt、hreflang、FAQPage 的自動輸出,建站當天就具備被 Google 與 AI 系統讀取的技術基礎。
- Schema.org / llms.txt / hreflang 自動輸出,不需撰寫程式
- FAQPage、Article、LocalBusiness 等結構化資料自動產生
- 內建 SEO + GEO + AI SEO 健檢,可即時檢測
- 14 天免費試用,不需信用卡
SEO/GEO/AIO 優化 分類其他文章
繼續閱讀同主題的延伸內容
留言討論
只有會員能留言(防止垃圾訊息),留言顯示於此頁。
