首頁 / AI 爬蟲目錄
Directory
AI 爬蟲目錄
16 種在實際流量中觀測到的 AI 爬蟲。每一筆的 User-Agent 都是最近一次造訪時實際送出的字串,不是抄自文件。
| 爬蟲 | 廠商 | 用途 | 觀測次數 | 取得內容比例 | 身分可驗證 |
|---|---|---|---|---|---|
| Bytespider | ByteDance | 抓取網頁供 ByteDance 的 AI 產品使用 | 4,152 | 33.2% | 廠商未提供方法 |
| Amazonbot | Amazon | 抓取網頁供 Amazon 的服務(含 Alexa 與 AI 產品)使用 | 3,971 | 52.6% | 廠商未提供方法 |
| Meta-ExternalAgent | Meta | 抓取網頁供 Meta 的 AI 產品使用 | 2,297 | 80.0% | 廠商未提供方法 |
| ClaudeBot | Anthropic | 抓取網頁作為模型訓練資料 | 2,225 | 65.3% | 廠商未提供方法 |
| ChatGPT-User | OpenAI | 使用者在對話中要求讀取特定網址時,即時抓取該頁 | 864 | 91.4% | 是(742/864 筆通過) |
| OAI-SearchBot | OpenAI | 建立 ChatGPT 搜尋的索引 | 809 | 81.0% | 是(666/809 筆通過) |
| CCBot | Common Crawl | 建立公開的網頁語料庫,多個 AI 模型以此作為訓練資料來源 | 734 | 49.7% | 廠商未提供方法 |
| Claude-User | Anthropic | 使用者在對話中要求讀取特定網址時的即時抓取 | 671 | 53.1% | 廠商未提供方法 |
| GPTBot | OpenAI | 抓取網頁作為模型訓練資料 | 503 | 65.2% | 是(453/503 筆通過) |
| Claude-SearchBot | Anthropic | 建立 Claude 網頁搜尋的索引 | 489 | 46.0% | 廠商未提供方法 |
| Google-Extended | 控制內容是否用於 Gemini 等生成式 AI 產品的訓練與接地 | 399 | 42.6% | 是(378/399 筆通過) | |
| anthropic-ai | Anthropic | 早期的 Anthropic 抓取識別字 | 369 | 35.8% | 廠商未提供方法 |
| Diffbot | Diffbot | 結構化網頁資料抽取,供其知識圖譜產品使用 | 294 | 38.1% | 廠商未提供方法 |
| PerplexityBot | Perplexity | 建立 Perplexity 搜尋的索引 | 276 | 83.7% | 是(231/276 筆通過) |
| cohere-ai | Cohere | 抓取網頁供 Cohere 的模型使用 | 27 | 0.0% | 廠商未提供方法 |
| Perplexity-User | Perplexity | 使用者在 Perplexity 中要求讀取特定網址時的即時抓取 | 17 | 35.3% | 廠商未提供方法 |
怎麼讀這張表
「取得內容比例」低不代表爬蟲有問題
這個數字多半反映的是你自己網站的路由歷史。比例低通常代表該爬蟲在抓已經不存在的舊網址——那些路徑可能來自它的既有知識、外部連結,或很久以前的抓取紀錄。要降低這個數字,做法是為仍有外部連結的舊網址建立轉址,而不是去擋爬蟲。
「身分可驗證」的兩種情況要分開
標示「是」代表該廠商公布了 IP 網段或支援反向 DNS 正解,可以確認來源確實屬於它。標示「廠商未提供方法」代表無從驗證——這不等於偽冒。
本目錄的觀測期間內,沒有任何一筆被判定為驗證失敗或疑似偽冒,因此本目錄不對任何爬蟲作這類暗示。但反過來說,無法驗證的 UA 本來就可以被任何人冒用,這是設計 robots.txt 或存取控制時必須納入的前提。
同一家廠商的多支爬蟲,用途可能完全不同
OpenAI 有三支(訓練、搜尋索引、使用者即時請求),Anthropic 也有三支。把它們當成同一件事來設定,是最常見的錯誤。詳見GPTBot 與 OAI-SearchBot 差在哪。
各爬蟲詳細資料
Bytespider
| 欄位 | 內容 |
|---|---|
| 廠商 | ByteDance |
| 用途 | 抓取網頁供 ByteDance 的 AI 產品使用。 |
| robots.txt 權杖 | Bytespider |
| User-Agent(最近觀測到的實際字串) | Mozilla/5.0 (Linux; Android 5.0) AppleWebKit/537.36 (KHTML, like Gecko) Mobile Safari/537.36 (compatible; Bytespider; spider-feedback@bytedance.com) |
| 官方文件 | (觀測期間未找到穩定的官方公開文件網址) |
| 身分驗證 | 觀測期間未見可用的反向 DNS 驗證方法 |
| 本目錄觀測期間 | 2026-06-18 ~ 2026-09-08 |
| 觀測次數 | 4,152 次(取得內容 33.2%) |
本目錄觀測到的請求量最高(4,152 次),但 200 率最低之一(33.2%)。UA 偽裝成 Android 行動瀏覽器。
Amazonbot
| 欄位 | 內容 |
|---|---|
| 廠商 | Amazon |
| 用途 | 抓取網頁供 Amazon 的服務(含 Alexa 與 AI 產品)使用。 |
| robots.txt 權杖 | Amazonbot |
| User-Agent(最近觀測到的實際字串) | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Amazonbot/0.1; +https://developer.amazon.com/support/amazonbot) |
| 官方文件 | https://developer.amazon.com/support/amazonbot |
| 身分驗證 | 觀測期間未見可用的反向 DNS 驗證方法 |
| 本目錄觀測期間 | 2026-06-20 ~ 2026-09-08 |
| 觀測次數 | 3,971 次(取得內容 52.6%) |
本目錄觀測到的請求量第二高,但 200 率僅 52.6%——它抓了大量已不存在的舊路徑。
Meta-ExternalAgent
| 欄位 | 內容 |
|---|---|
| 廠商 | Meta |
| 用途 | 抓取網頁供 Meta 的 AI 產品使用。 |
| robots.txt 權杖 | meta-externalagent |
| User-Agent(最近觀測到的實際字串) | Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/145.0.0.0 Safari/537.36 (compatible; meta-externalagent/1.1; +https://developers.facebook.com/docs/sharing/webmasters/crawler) |
| 官方文件 | https://developers.facebook.com/docs/sharing/webmasters/crawler |
| 身分驗證 | 觀測期間未見可用的反向 DNS 驗證方法 |
| 本目錄觀測期間 | 2026-06-18 ~ 2026-09-08 |
| 觀測次數 | 2,297 次(取得內容 80.0%) |
UA 字串偽裝成一般 Chrome 瀏覽器並在括號中附註身分,比對時不能只看開頭。
ClaudeBot
| 欄位 | 內容 |
|---|---|
| 廠商 | Anthropic |
| 用途 | 抓取網頁作為模型訓練資料。 |
| robots.txt 權杖 | ClaudeBot |
| User-Agent(最近觀測到的實際字串) | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com) |
| 官方文件 | https://support.anthropic.com/en/articles/8896518 |
| 身分驗證 | 觀測期間未見可用的反向 DNS 驗證方法 |
| 本目錄觀測期間 | 2026-06-18 ~ 2026-09-08 |
| 觀測次數 | 2,225 次(取得內容 65.3%) |
Anthropic 目前使用三支不同的 UA(ClaudeBot、Claude-User、Claude-SearchBot),用途不同,robots.txt 需分別設定。
ChatGPT-User
| 欄位 | 內容 |
|---|---|
| 廠商 | OpenAI |
| 用途 | 使用者在對話中要求讀取特定網址時,即時抓取該頁。 |
| robots.txt 權杖 | ChatGPT-User |
| User-Agent(最近觀測到的實際字串) | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; ChatGPT-User/1.0; +https://openai.com/bot |
| 官方文件 | https://platform.openai.com/docs/bots |
| 身分驗證 | OpenAI 公布 IP 網段並支援反向 DNS 正解 |
| 本目錄觀測期間 | 2026-06-18 ~ 2026-09-08 |
| 觀測次數 | 864 次(取得內容 91.4%) |
本目錄觀測到的 200 率最高(91.4%),因為它抓的是使用者當下明確指定的網址。擋掉它等於拒絕一個主動想了解你的使用者。
OAI-SearchBot
| 欄位 | 內容 |
|---|---|
| 廠商 | OpenAI |
| 用途 | 建立 ChatGPT 搜尋的索引。 |
| robots.txt 權杖 | OAI-SearchBot |
| User-Agent(最近觀測到的實際字串) | Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36; compatible; OAI-SearchBot/1.0; +https://openai.com/searchbot |
| 官方文件 | https://platform.openai.com/docs/bots |
| 身分驗證 | OpenAI 公布 IP 網段並支援反向 DNS 正解 |
| 本目錄觀測期間 | 2026-06-18 ~ 2026-09-08 |
| 觀測次數 | 809 次(取得內容 81.0%) |
想被 ChatGPT 搜尋引用卻擋掉這一支,是最常見也最可惜的設定錯誤。
CCBot
| 欄位 | 內容 |
|---|---|
| 廠商 | Common Crawl |
| 用途 | 建立公開的網頁語料庫,多個 AI 模型以此作為訓練資料來源。 |
| robots.txt 權杖 | CCBot |
| User-Agent(最近觀測到的實際字串) | CCBot/2.0 (https://commoncrawl.org/faq/) |
| 官方文件 | https://commoncrawl.org/faq |
| 身分驗證 | 觀測期間未見可用的反向 DNS 驗證方法 |
| 本目錄觀測期間 | 2026-06-19 ~ 2026-09-08 |
| 觀測次數 | 734 次(取得內容 49.7%) |
Common Crawl 是非營利組織,其語料被多家 AI 公司使用。擋掉它等於同時影響多個下游模型。
Claude-User
| 欄位 | 內容 |
|---|---|
| 廠商 | Anthropic |
| 用途 | 使用者在對話中要求讀取特定網址時的即時抓取。 |
| robots.txt 權杖 | Claude-User |
| User-Agent(最近觀測到的實際字串) | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Claude-User/1.0; +claudebot@anthropic.com) |
| 官方文件 | https://support.anthropic.com/en/articles/8896518 |
| 身分驗證 | 觀測期間未見可用的反向 DNS 驗證方法 |
| 本目錄觀測期間 | 2026-07-09 ~ 2026-09-08 |
| 觀測次數 | 671 次(取得內容 53.1%) |
與 ChatGPT-User 是對應角色,但本目錄觀測到的 200 率低得多(53.1% vs 91.4%)。
GPTBot
| 欄位 | 內容 |
|---|---|
| 廠商 | OpenAI |
| 用途 | 抓取網頁作為模型訓練資料。 |
| robots.txt 權杖 | GPTBot |
| User-Agent(最近觀測到的實際字串) | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.4; +https://openai.com/gptbot) |
| 官方文件 | https://platform.openai.com/docs/bots |
| 身分驗證 | OpenAI 公布 IP 網段並支援反向 DNS 正解 |
| 本目錄觀測期間 | 2026-06-19 ~ 2026-09-08 |
| 觀測次數 | 503 次(取得內容 65.2%) |
擋掉它只影響未來模型的訓練資料,不影響 ChatGPT 搜尋是否引用你的網站——那是 OAI-SearchBot 的工作。
Claude-SearchBot
| 欄位 | 內容 |
|---|---|
| 廠商 | Anthropic |
| 用途 | 建立 Claude 網頁搜尋的索引。 |
| robots.txt 權杖 | Claude-SearchBot |
| User-Agent(最近觀測到的實際字串) | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Claude-SearchBot/1.0; +claudebot@anthropic.com) |
| 官方文件 | https://support.anthropic.com/en/articles/8896518 |
| 身分驗證 | 觀測期間未見可用的反向 DNS 驗證方法 |
| 本目錄觀測期間 | 2026-07-19 ~ 2026-09-08 |
| 觀測次數 | 489 次(取得內容 46.0%) |
2026 年 7 月中旬才首次在本目錄的觀測資料中出現,比 ClaudeBot 晚約一個月。
Google-Extended
| 欄位 | 內容 |
|---|---|
| 廠商 | |
| 用途 | 控制內容是否用於 Gemini 等生成式 AI 產品的訓練與接地。 |
| robots.txt 權杖 | Google-Extended |
| User-Agent(最近觀測到的實際字串) | Mozilla/5.0 (compatible; Google-Extended/1.0; +http://www.google.com/bot.html) |
| 官方文件 | https://developers.google.com/search/docs/crawling-indexing/overview-google-crawlers |
| 身分驗證 | Google 支援反向 DNS 正解(googlebot.com / google.com) |
| 本目錄觀測期間 | 2026-06-20 ~ 2026-08-16 |
| 觀測次數 | 399 次(取得內容 42.6%) |
Google 文件將其定位為 robots.txt 的控制權杖。擋掉它不影響 Google 搜尋排名,只影響生成式 AI 的使用。本目錄自 2026-08-16 後未再觀測到它。
anthropic-ai
| 欄位 | 內容 |
|---|---|
| 廠商 | Anthropic |
| 用途 | 早期的 Anthropic 抓取識別字。 |
| robots.txt 權杖 | anthropic-ai |
| User-Agent(最近觀測到的實際字串) | anthropic-ai |
| 官方文件 | https://support.anthropic.com/en/articles/8896518 |
| 身分驗證 | 觀測期間未見可用的反向 DNS 驗證方法 |
| 本目錄觀測期間 | 2026-06-20 ~ 2026-08-02 |
| 觀測次數 | 369 次(取得內容 35.8%) |
UA 字串極短、不含網址。本目錄自 2026-08-02 後未再觀測到它,可能已被 ClaudeBot 系列取代。
Diffbot
| 欄位 | 內容 |
|---|---|
| 廠商 | Diffbot |
| 用途 | 結構化網頁資料抽取,供其知識圖譜產品使用。 |
| robots.txt 權杖 | Diffbot |
| User-Agent(最近觀測到的實際字串) | Mozilla/5.0 (compatible; Diffbot/1.0; +https://diffbot.com) |
| 官方文件 | https://docs.diffbot.com/ |
| 身分驗證 | 觀測期間未見可用的反向 DNS 驗證方法 |
| 本目錄觀測期間 | 2026-07-19 ~ 2026-07-26 |
| 觀測次數 | 294 次(取得內容 38.1%) |
觀測期間只在 7 月中下旬密集出現一週,之後未再見到——屬於間歇式抓取。
PerplexityBot
| 欄位 | 內容 |
|---|---|
| 廠商 | Perplexity |
| 用途 | 建立 Perplexity 搜尋的索引。 |
| robots.txt 權杖 | PerplexityBot |
| User-Agent(最近觀測到的實際字串) | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot) |
| 官方文件 | https://docs.perplexity.ai/guides/bots |
| 身分驗證 | Perplexity 公布 IP 網段並支援反向 DNS 正解 |
| 本目錄觀測期間 | 2026-06-20 ~ 2026-09-08 |
| 觀測次數 | 276 次(取得內容 83.7%) |
另有 Perplexity-User 負責使用者即時請求,本目錄觀測到的量少很多(17 次)。
cohere-ai
| 欄位 | 內容 |
|---|---|
| 廠商 | Cohere |
| 用途 | 抓取網頁供 Cohere 的模型使用。 |
| robots.txt 權杖 | cohere-ai |
| User-Agent(最近觀測到的實際字串) | Mozilla/5.0 (compatible; cohere-ai; +https://cohere.com/crawler) |
| 官方文件 | https://cohere.com/crawler |
| 身分驗證 | 觀測期間未見可用的反向 DNS 驗證方法 |
| 本目錄觀測期間 | 2026-09-06 ~ 2026-09-08 |
| 觀測次數 | 27 次(取得內容 0.0%) |
2026-09-06 才首次出現在本目錄的觀測資料中,且 27 次請求全部未取得內容——它抓的路徑目前都不存在。
Perplexity-User
| 欄位 | 內容 |
|---|---|
| 廠商 | Perplexity |
| 用途 | 使用者在 Perplexity 中要求讀取特定網址時的即時抓取。 |
| robots.txt 權杖 | Perplexity-User |
| User-Agent(最近觀測到的實際字串) | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; Perplexity-User/1.0; +https://perplexity.ai/perplexity-user |
| 官方文件 | https://docs.perplexity.ai/guides/bots |
| 身分驗證 | 觀測期間未見可用的反向 DNS 驗證方法 |
| 本目錄觀測期間 | 2026-06-20 ~ 2026-06-25 |
| 觀測次數 | 17 次(取得內容 35.3%) |
本目錄觀測到的量最少。使用者主動要求型的抓取本來就取決於使用者行為,量少不代表該功能未被使用。
資料來源
- OpenAI — Bots and crawlers
- Anthropic — Does Anthropic crawl data from the web?
- Google — Overview of Google crawlers and fetchers
- Perplexity — PerplexityBot
- Amazon — Amazonbot
- Common Crawl — FAQ
- 第一手觀測資料:兩個正式站台的伺服器端存取記錄,2026-06-18 ~ 2026-09-08。