Guide
GPTBot 是什麼?
GPTBot 是 OpenAI 用來收集模型訓練資料的爬蟲。它與 ChatGPT 搜尋是否引用你的網站沒有直接關係——那是另一支爬蟲的工作。
一句話回答
GPTBot 抓取網頁作為 OpenAI 模型的訓練資料。允許它,你的內容可能被納入未來模型的訓練;擋掉它,不影響 ChatGPT 搜尋是否能找到並引用你的網站。
識別方式
| 欄位 | 內容 |
|---|---|
| robots.txt 權杖 | GPTBot |
| 最近觀測到的 User-Agent | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.4; +https://openai.com/gptbot) |
| 身分驗證 | OpenAI 公布 IP 網段並支援反向 DNS 正解 |
| 官方文件 | platform.openai.com/docs/bots |
注意版本號。本站觀測期間 GPTBot 實際送出的是
GPTBot/1.4,但多數教學文章仍寫著 1.0。如果你的日誌比對規則寫死了版本號,就會漏掉。比對時應該用不含版本的字串(GPTBot)。robots.txt 怎麼寫
允許:
User-agent: GPTBot
Allow: /
禁止:
User-agent: GPTBot
Disallow: /
robots.txt 的群組規則不會繼承。一旦你為某個 User-agent 開了獨立群組,
User-agent: * 底下的規則對它就完全不適用。這代表你為 GPTBot 寫了一條 Disallow: /admin,而通用群組裡的其他 Disallow 就對 GPTBot 失效了——必須在每個群組裡寫完整。擋掉它會發生什麼
| 項目 | 擋掉 GPTBot 的影響 |
|---|---|
| 未來模型的訓練資料 | 你的內容不會被納入 |
| ChatGPT 搜尋能否找到你 | 不受影響——那由 OAI-SearchBot 決定 |
| 使用者貼你的網址請 ChatGPT 讀取 | 不受影響——那是 ChatGPT-User |
| Google 搜尋排名 | 完全無關 |
換句話說,擋掉 GPTBot 是一個關於「要不要提供訓練資料」的決定,不是關於「要不要出現在 AI 答案裡」的決定。這兩件事經常被混為一談。
本站實際觀測到的行為
在 2026-06-18 至 2026-09-08 之間,兩個正式站台共觀測到 GPTBot 503 次請求,其中 65.2% 取得內容(HTTP 200),453 次通過反向 DNS 驗證。
相較之下,同期間 ChatGPT-User 的取得內容比例是 91.4%——因為它抓的是使用者當下明確指定的網址,而 GPTBot 是自主探索,會碰到較多已不存在的路徑。
完整資料見AI 爬蟲目錄。
常見問題
擋掉 GPTBot,ChatGPT 就找不到我的網站了嗎?
不會。ChatGPT 搜尋的索引由 OAI-SearchBot 建立,與 GPTBot 是不同的爬蟲。要讓 ChatGPT 搜尋能找到你,需要允許的是 OAI-SearchBot。
已經被訓練進去的內容,現在擋還有用嗎?
擋掉之後的抓取會停止,但已納入既有模型的資料不會因此移除。不過模型會持續改版,現在設定仍會影響未來版本。
GPTBot 會遵守 robots.txt 嗎?
OpenAI 的官方文件說明它遵守 robots.txt。本站觀測期間沒有發現違反的情況,但單一站台的觀測不足以作為通則。
資料來源
- OpenAI — Bots and crawlers
- RFC 9309 — Robots Exclusion Protocol
- 第一手觀測:兩個正式站台,2026-06-18 ~ 2026-09-08。