首頁 / 技術指南 / GPTBot 是什麼

Guide

GPTBot 是什麼?

GPTBot 是 OpenAI 用來收集模型訓練資料的爬蟲。它與 ChatGPT 搜尋是否引用你的網站沒有直接關係——那是另一支爬蟲的工作。

發布 2026-09-08更新 2026-09-08最後查核 2026-09-08topcc.me 編輯部

一句話回答

GPTBot 抓取網頁作為 OpenAI 模型的訓練資料。允許它,你的內容可能被納入未來模型的訓練;擋掉它,不影響 ChatGPT 搜尋是否能找到並引用你的網站。

識別方式

欄位內容
robots.txt 權杖GPTBot
最近觀測到的 User-AgentMozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.4; +https://openai.com/gptbot)
身分驗證OpenAI 公布 IP 網段並支援反向 DNS 正解
官方文件platform.openai.com/docs/bots
注意版本號。本站觀測期間 GPTBot 實際送出的是 GPTBot/1.4,但多數教學文章仍寫著 1.0。如果你的日誌比對規則寫死了版本號,就會漏掉。比對時應該用不含版本的字串(GPTBot)。

robots.txt 怎麼寫

允許:

User-agent: GPTBot
Allow: /

禁止:

User-agent: GPTBot
Disallow: /
robots.txt 的群組規則不會繼承。一旦你為某個 User-agent 開了獨立群組,User-agent: * 底下的規則對它就完全不適用。這代表你為 GPTBot 寫了一條 Disallow: /admin,而通用群組裡的其他 Disallow 就對 GPTBot 失效了——必須在每個群組裡寫完整。

擋掉它會發生什麼

項目擋掉 GPTBot 的影響
未來模型的訓練資料你的內容不會被納入
ChatGPT 搜尋能否找到你不受影響——那由 OAI-SearchBot 決定
使用者貼你的網址請 ChatGPT 讀取不受影響——那是 ChatGPT-User
Google 搜尋排名完全無關

換句話說,擋掉 GPTBot 是一個關於「要不要提供訓練資料」的決定,不是關於「要不要出現在 AI 答案裡」的決定。這兩件事經常被混為一談。

本站實際觀測到的行為

在 2026-06-18 至 2026-09-08 之間,兩個正式站台共觀測到 GPTBot 503 次請求,其中 65.2% 取得內容(HTTP 200),453 次通過反向 DNS 驗證

相較之下,同期間 ChatGPT-User 的取得內容比例是 91.4%——因為它抓的是使用者當下明確指定的網址,而 GPTBot 是自主探索,會碰到較多已不存在的路徑。

完整資料見AI 爬蟲目錄

常見問題

擋掉 GPTBot,ChatGPT 就找不到我的網站了嗎?

不會。ChatGPT 搜尋的索引由 OAI-SearchBot 建立,與 GPTBot 是不同的爬蟲。要讓 ChatGPT 搜尋能找到你,需要允許的是 OAI-SearchBot。

已經被訓練進去的內容,現在擋還有用嗎?

擋掉之後的抓取會停止,但已納入既有模型的資料不會因此移除。不過模型會持續改版,現在設定仍會影響未來版本。

GPTBot 會遵守 robots.txt 嗎?

OpenAI 的官方文件說明它遵守 robots.txt。本站觀測期間沒有發現違反的情況,但單一站台的觀測不足以作為通則。

資料來源