Guide
怎麼從伺服器日誌辨識 AI 爬蟲?
網頁分析工具幾乎看不到 AI 爬蟲。要知道哪些 AI 系統來過,只能看伺服器端或 CDN 邊緣的存取記錄。
為什麼分析工具看不到
Google Analytics 這類工具靠瀏覽器執行 JavaScript 才會送出事件。AI 爬蟲多半只抓 HTML,不執行 JS,因此從不觸發那段程式碼。你的分析報表裡看不到它們,不代表它們沒來。
唯一可靠的來源是伺服器端或 CDN 邊緣的存取記錄——每一個 HTTP 請求都會留下,無論對方是否執行 JS。
要記錄哪些欄位
| 欄位 | 為什麼需要 |
|---|---|
| 時間戳 | 判斷抓取頻率與時段 |
| 路徑 | 知道它對哪些內容有興趣 |
| User-Agent | 判斷是哪一支爬蟲 |
| 狀態碼 | 知道它有沒有真的拿到內容——這一項最常被忽略 |
| 來源 IP | 用於反向 DNS 驗證(記錄後應考慮保存期限與個資規範) |
| Referer | 判斷是否為使用者觸發的請求 |
| 回應時間 | 判斷是否因為太慢而被放棄 |
User-Agent 的三個陷阱
一、版本號會變
GPTBot 在本站觀測期間送出的是 GPTBot/1.4,但多數教學文章仍寫著 1.0。比對規則應該用不含版本的字串。
二、有些爬蟲偽裝成一般瀏覽器
Meta-ExternalAgent 與 Bytespider 的 UA 都以正常的 Chrome 或 Android 瀏覽器字串開頭,真正的身分寫在括號裡。只比對開頭會完全漏掉它們。
# Meta-ExternalAgent 實際送出的字串(節錄)
Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36
(KHTML, like Gecko) Chrome/145.0.0.0 Safari/537.36
(compatible; meta-externalagent/1.1; +https://developers.facebook.com/...)
三、UA 可以被任何人冒用
User-Agent 是請求方自己宣告的字串,沒有任何強制力。要確認來源真的是該廠商,需要反向 DNS 正解:先用來源 IP 反查主機名,再把該主機名正解回 IP,確認與原始 IP 相符,並檢查主機名是否屬於廠商公告的網域。
| 爬蟲 | 可反查驗證 | 本站通過驗證的比例 |
|---|---|---|
GPTBot | 是 | 453 / 503 |
OAI-SearchBot | 是 | 666 / 809 |
ChatGPT-User | 是 | 742 / 864 |
Google-Extended | 是 | 378 / 399 |
PerplexityBot | 是 | 231 / 276 |
ClaudeBot | 廠商未提供方法 | — |
Bytespider | 廠商未提供方法 | — |
用 grep 快速看一眼
在標準的 nginx/Apache 存取日誌上,最簡單的起點:
# 列出 AI 爬蟲的請求數(不分版本)
grep -oiE '(GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|\
PerplexityBot|Google-Extended|meta-externalagent|Amazonbot|Bytespider|CCBot)' \
/var/log/nginx/access.log | sort | uniq -c | sort -rn
# 同時看狀態碼分布(欄位位置依你的 log_format 調整)
awk '/GPTBot/ {print $9}' /var/log/nginx/access.log | sort | uniq -c
完整的爬蟲清單與各自的 User-Agent 字串見AI 爬蟲目錄。
判讀時要分開的三件事
- 爬蟲有沒有來——存取記錄可以回答
- 它有沒有拿到內容——狀態碼可以回答
- AI 有沒有在回答中使用它——存取記錄無法回答,需要另外的引用監測
把第一項當成第三項的證據,是解讀爬蟲資料時最常見的錯誤。
常見問題
用 Cloudflare 的話要怎麼看?
Cloudflare 的邊緣日誌會記錄所有到達邊緣的請求,包含未回源的快取命中。若只看源站日誌,會漏掉被快取擋下的那部分。
爬蟲來得多,是不是代表 AEO 有效?
不是。爬蟲造訪只代表內容被取得,不代表 AI 會在回答中使用它,更不代表會提到你的品牌。這三件事需要分開量測。
記錄 IP 有沒有個資問題?
IP 在部分司法管轄區被視為個人資料。若要保存,應設定保存期限、限制存取,或在不需要驗證時只保留網段。具體要求依你所在地的法規。
資料來源
- OpenAI — Bots and crawlers
- Google — Verifying Googlebot and other crawlers
- Perplexity — Bots
- 第一手觀測:兩個正式站台,2026-06-18 ~ 2026-09-08,18,097 筆 AI 爬蟲請求。