首頁 / AI 爬蟲目錄

Directory

AI 爬蟲目錄

16 種在實際流量中觀測到的 AI 爬蟲。每一筆的 User-Agent 都是最近一次造訪時實際送出的字串,不是抄自文件。

發布 2026-09-08更新 2026-09-08最後查核 2026-09-08topcc.me 編輯部
資料來源:2 個正式站台的伺服器端存取記錄,2026-06-18 ~ 2026-09-08,累計 18,097 筆 AI 爬蟲請求。「取得內容比例」指該爬蟲的請求中回傳 HTTP 200 的百分比。
本目錄實際觀測到的 AI 爬蟲(2026-06-18 ~ 2026-09-08,2 個站台、18,097 筆請求)
爬蟲廠商用途觀測次數取得內容比例身分可驗證
BytespiderByteDance抓取網頁供 ByteDance 的 AI 產品使用4,15233.2%廠商未提供方法
AmazonbotAmazon抓取網頁供 Amazon 的服務(含 Alexa 與 AI 產品)使用3,97152.6%廠商未提供方法
Meta-ExternalAgentMeta抓取網頁供 Meta 的 AI 產品使用2,29780.0%廠商未提供方法
ClaudeBotAnthropic抓取網頁作為模型訓練資料2,22565.3%廠商未提供方法
ChatGPT-UserOpenAI使用者在對話中要求讀取特定網址時,即時抓取該頁86491.4%是(742/864 筆通過)
OAI-SearchBotOpenAI建立 ChatGPT 搜尋的索引80981.0%是(666/809 筆通過)
CCBotCommon Crawl建立公開的網頁語料庫,多個 AI 模型以此作為訓練資料來源73449.7%廠商未提供方法
Claude-UserAnthropic使用者在對話中要求讀取特定網址時的即時抓取67153.1%廠商未提供方法
GPTBotOpenAI抓取網頁作為模型訓練資料50365.2%是(453/503 筆通過)
Claude-SearchBotAnthropic建立 Claude 網頁搜尋的索引48946.0%廠商未提供方法
Google-ExtendedGoogle控制內容是否用於 Gemini 等生成式 AI 產品的訓練與接地39942.6%是(378/399 筆通過)
anthropic-aiAnthropic早期的 Anthropic 抓取識別字36935.8%廠商未提供方法
DiffbotDiffbot結構化網頁資料抽取,供其知識圖譜產品使用29438.1%廠商未提供方法
PerplexityBotPerplexity建立 Perplexity 搜尋的索引27683.7%是(231/276 筆通過)
cohere-aiCohere抓取網頁供 Cohere 的模型使用270.0%廠商未提供方法
Perplexity-UserPerplexity使用者在 Perplexity 中要求讀取特定網址時的即時抓取1735.3%廠商未提供方法

怎麼讀這張表

「取得內容比例」低不代表爬蟲有問題

這個數字多半反映的是你自己網站的路由歷史。比例低通常代表該爬蟲在抓已經不存在的舊網址——那些路徑可能來自它的既有知識、外部連結,或很久以前的抓取紀錄。要降低這個數字,做法是為仍有外部連結的舊網址建立轉址,而不是去擋爬蟲。

「身分可驗證」的兩種情況要分開

標示「是」代表該廠商公布了 IP 網段或支援反向 DNS 正解,可以確認來源確實屬於它。標示「廠商未提供方法」代表無從驗證——這不等於偽冒

本目錄的觀測期間內,沒有任何一筆被判定為驗證失敗或疑似偽冒,因此本目錄不對任何爬蟲作這類暗示。但反過來說,無法驗證的 UA 本來就可以被任何人冒用,這是設計 robots.txt 或存取控制時必須納入的前提。

同一家廠商的多支爬蟲,用途可能完全不同

OpenAI 有三支(訓練、搜尋索引、使用者即時請求),Anthropic 也有三支。把它們當成同一件事來設定,是最常見的錯誤。詳見GPTBot 與 OAI-SearchBot 差在哪

各爬蟲詳細資料

Bytespider

欄位內容
廠商ByteDance
用途抓取網頁供 ByteDance 的 AI 產品使用。
robots.txt 權杖Bytespider
User-Agent(最近觀測到的實際字串)Mozilla/5.0 (Linux; Android 5.0) AppleWebKit/537.36 (KHTML, like Gecko) Mobile Safari/537.36 (compatible; Bytespider; spider-feedback@bytedance.com)
官方文件(觀測期間未找到穩定的官方公開文件網址)
身分驗證觀測期間未見可用的反向 DNS 驗證方法
本目錄觀測期間2026-06-18 ~ 2026-09-08
觀測次數4,152 次(取得內容 33.2%)

本目錄觀測到的請求量最高(4,152 次),但 200 率最低之一(33.2%)。UA 偽裝成 Android 行動瀏覽器。

Amazonbot

欄位內容
廠商Amazon
用途抓取網頁供 Amazon 的服務(含 Alexa 與 AI 產品)使用。
robots.txt 權杖Amazonbot
User-Agent(最近觀測到的實際字串)Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Amazonbot/0.1; +https://developer.amazon.com/support/amazonbot)
官方文件https://developer.amazon.com/support/amazonbot
身分驗證觀測期間未見可用的反向 DNS 驗證方法
本目錄觀測期間2026-06-20 ~ 2026-09-08
觀測次數3,971 次(取得內容 52.6%)

本目錄觀測到的請求量第二高,但 200 率僅 52.6%——它抓了大量已不存在的舊路徑。

Meta-ExternalAgent

欄位內容
廠商Meta
用途抓取網頁供 Meta 的 AI 產品使用。
robots.txt 權杖meta-externalagent
User-Agent(最近觀測到的實際字串)Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/145.0.0.0 Safari/537.36 (compatible; meta-externalagent/1.1; +https://developers.facebook.com/docs/sharing/webmasters/crawler)
官方文件https://developers.facebook.com/docs/sharing/webmasters/crawler
身分驗證觀測期間未見可用的反向 DNS 驗證方法
本目錄觀測期間2026-06-18 ~ 2026-09-08
觀測次數2,297 次(取得內容 80.0%)

UA 字串偽裝成一般 Chrome 瀏覽器並在括號中附註身分,比對時不能只看開頭。

ClaudeBot

欄位內容
廠商Anthropic
用途抓取網頁作為模型訓練資料。
robots.txt 權杖ClaudeBot
User-Agent(最近觀測到的實際字串)Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
官方文件https://support.anthropic.com/en/articles/8896518
身分驗證觀測期間未見可用的反向 DNS 驗證方法
本目錄觀測期間2026-06-18 ~ 2026-09-08
觀測次數2,225 次(取得內容 65.3%)

Anthropic 目前使用三支不同的 UA(ClaudeBot、Claude-User、Claude-SearchBot),用途不同,robots.txt 需分別設定。

ChatGPT-User

欄位內容
廠商OpenAI
用途使用者在對話中要求讀取特定網址時,即時抓取該頁。
robots.txt 權杖ChatGPT-User
User-Agent(最近觀測到的實際字串)Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; ChatGPT-User/1.0; +https://openai.com/bot
官方文件https://platform.openai.com/docs/bots
身分驗證OpenAI 公布 IP 網段並支援反向 DNS 正解
本目錄觀測期間2026-06-18 ~ 2026-09-08
觀測次數864 次(取得內容 91.4%)

本目錄觀測到的 200 率最高(91.4%),因為它抓的是使用者當下明確指定的網址。擋掉它等於拒絕一個主動想了解你的使用者。

OAI-SearchBot

欄位內容
廠商OpenAI
用途建立 ChatGPT 搜尋的索引。
robots.txt 權杖OAI-SearchBot
User-Agent(最近觀測到的實際字串)Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36; compatible; OAI-SearchBot/1.0; +https://openai.com/searchbot
官方文件https://platform.openai.com/docs/bots
身分驗證OpenAI 公布 IP 網段並支援反向 DNS 正解
本目錄觀測期間2026-06-18 ~ 2026-09-08
觀測次數809 次(取得內容 81.0%)

想被 ChatGPT 搜尋引用卻擋掉這一支,是最常見也最可惜的設定錯誤。

CCBot

欄位內容
廠商Common Crawl
用途建立公開的網頁語料庫,多個 AI 模型以此作為訓練資料來源。
robots.txt 權杖CCBot
User-Agent(最近觀測到的實際字串)CCBot/2.0 (https://commoncrawl.org/faq/)
官方文件https://commoncrawl.org/faq
身分驗證觀測期間未見可用的反向 DNS 驗證方法
本目錄觀測期間2026-06-19 ~ 2026-09-08
觀測次數734 次(取得內容 49.7%)

Common Crawl 是非營利組織,其語料被多家 AI 公司使用。擋掉它等於同時影響多個下游模型。

Claude-User

欄位內容
廠商Anthropic
用途使用者在對話中要求讀取特定網址時的即時抓取。
robots.txt 權杖Claude-User
User-Agent(最近觀測到的實際字串)Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Claude-User/1.0; +claudebot@anthropic.com)
官方文件https://support.anthropic.com/en/articles/8896518
身分驗證觀測期間未見可用的反向 DNS 驗證方法
本目錄觀測期間2026-07-09 ~ 2026-09-08
觀測次數671 次(取得內容 53.1%)

與 ChatGPT-User 是對應角色,但本目錄觀測到的 200 率低得多(53.1% vs 91.4%)。

GPTBot

欄位內容
廠商OpenAI
用途抓取網頁作為模型訓練資料。
robots.txt 權杖GPTBot
User-Agent(最近觀測到的實際字串)Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.4; +https://openai.com/gptbot)
官方文件https://platform.openai.com/docs/bots
身分驗證OpenAI 公布 IP 網段並支援反向 DNS 正解
本目錄觀測期間2026-06-19 ~ 2026-09-08
觀測次數503 次(取得內容 65.2%)

擋掉它只影響未來模型的訓練資料,不影響 ChatGPT 搜尋是否引用你的網站——那是 OAI-SearchBot 的工作。

Claude-SearchBot

欄位內容
廠商Anthropic
用途建立 Claude 網頁搜尋的索引。
robots.txt 權杖Claude-SearchBot
User-Agent(最近觀測到的實際字串)Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Claude-SearchBot/1.0; +claudebot@anthropic.com)
官方文件https://support.anthropic.com/en/articles/8896518
身分驗證觀測期間未見可用的反向 DNS 驗證方法
本目錄觀測期間2026-07-19 ~ 2026-09-08
觀測次數489 次(取得內容 46.0%)

2026 年 7 月中旬才首次在本目錄的觀測資料中出現,比 ClaudeBot 晚約一個月。

Google-Extended

欄位內容
廠商Google
用途控制內容是否用於 Gemini 等生成式 AI 產品的訓練與接地。
robots.txt 權杖Google-Extended
User-Agent(最近觀測到的實際字串)Mozilla/5.0 (compatible; Google-Extended/1.0; +http://www.google.com/bot.html)
官方文件https://developers.google.com/search/docs/crawling-indexing/overview-google-crawlers
身分驗證Google 支援反向 DNS 正解(googlebot.com / google.com)
本目錄觀測期間2026-06-20 ~ 2026-08-16
觀測次數399 次(取得內容 42.6%)

Google 文件將其定位為 robots.txt 的控制權杖。擋掉它不影響 Google 搜尋排名,只影響生成式 AI 的使用。本目錄自 2026-08-16 後未再觀測到它。

anthropic-ai

欄位內容
廠商Anthropic
用途早期的 Anthropic 抓取識別字。
robots.txt 權杖anthropic-ai
User-Agent(最近觀測到的實際字串)anthropic-ai
官方文件https://support.anthropic.com/en/articles/8896518
身分驗證觀測期間未見可用的反向 DNS 驗證方法
本目錄觀測期間2026-06-20 ~ 2026-08-02
觀測次數369 次(取得內容 35.8%)

UA 字串極短、不含網址。本目錄自 2026-08-02 後未再觀測到它,可能已被 ClaudeBot 系列取代。

Diffbot

欄位內容
廠商Diffbot
用途結構化網頁資料抽取,供其知識圖譜產品使用。
robots.txt 權杖Diffbot
User-Agent(最近觀測到的實際字串)Mozilla/5.0 (compatible; Diffbot/1.0; +https://diffbot.com)
官方文件https://docs.diffbot.com/
身分驗證觀測期間未見可用的反向 DNS 驗證方法
本目錄觀測期間2026-07-19 ~ 2026-07-26
觀測次數294 次(取得內容 38.1%)

觀測期間只在 7 月中下旬密集出現一週,之後未再見到——屬於間歇式抓取。

PerplexityBot

欄位內容
廠商Perplexity
用途建立 Perplexity 搜尋的索引。
robots.txt 權杖PerplexityBot
User-Agent(最近觀測到的實際字串)Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot)
官方文件https://docs.perplexity.ai/guides/bots
身分驗證Perplexity 公布 IP 網段並支援反向 DNS 正解
本目錄觀測期間2026-06-20 ~ 2026-09-08
觀測次數276 次(取得內容 83.7%)

另有 Perplexity-User 負責使用者即時請求,本目錄觀測到的量少很多(17 次)。

cohere-ai

欄位內容
廠商Cohere
用途抓取網頁供 Cohere 的模型使用。
robots.txt 權杖cohere-ai
User-Agent(最近觀測到的實際字串)Mozilla/5.0 (compatible; cohere-ai; +https://cohere.com/crawler)
官方文件https://cohere.com/crawler
身分驗證觀測期間未見可用的反向 DNS 驗證方法
本目錄觀測期間2026-09-06 ~ 2026-09-08
觀測次數27 次(取得內容 0.0%)

2026-09-06 才首次出現在本目錄的觀測資料中,且 27 次請求全部未取得內容——它抓的路徑目前都不存在。

Perplexity-User

欄位內容
廠商Perplexity
用途使用者在 Perplexity 中要求讀取特定網址時的即時抓取。
robots.txt 權杖Perplexity-User
User-Agent(最近觀測到的實際字串)Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; Perplexity-User/1.0; +https://perplexity.ai/perplexity-user
官方文件https://docs.perplexity.ai/guides/bots
身分驗證觀測期間未見可用的反向 DNS 驗證方法
本目錄觀測期間2026-06-20 ~ 2026-06-25
觀測次數17 次(取得內容 35.3%)

本目錄觀測到的量最少。使用者主動要求型的抓取本來就取決於使用者行為,量少不代表該功能未被使用。

資料來源