獨立開發者 Pieter Levels 本週在 X 抱怨,Meta 對他旗下所有網站進行「非常非常非常大量」的抓取,量大到其中一台 VPS 直接跳出負載警報。資安公司 DataDome 的 Q2 報告給了規模,Meta 兩隻 AI 爬蟲單季合計發出 91 億次請求,其中負責建搜尋索引的 Meta-WebIndexer 季增 163%,6 月的月請求量首度超越訓練用爬蟲。Meta 從 2024 年就在自建搜尋索引,想擺脫對 Google 與 Bing 的依賴。
(前情提要:當 AI 爬蟲免費抓內容,《TIME》決定把業配廣告直接餵給模型)
(背景補充:Cloudflare 非人類流量首度過半!執行長喊話 L1 能扛 1 億 TPS 再找我)
重點摘要
- DataDome 統計 Meta 兩隻 AI 爬蟲 Q2 合計發出 91 億次請求,占其網路 AI 代理流量的多數
- 搜尋索引爬蟲 Meta-WebIndexer 季增 163% 至 37.5 億次,6 月首度超越訓練爬蟲
- Meta 爬得最兇卻幾乎不帶回流量,同期 ChatGPT 拿走 88% 的 AI 推薦流量
獨立開發者 Pieter Levels 本週在 X 上抱怨,Meta 這週對他旗下所有網站做了「非常非常非常大量」的抓取,而且看起來別人的網站也一樣。量大到什麼程度?他說當天有一台 VPS 直接跳出了負載平均警報。
他還注意到一個細節,Meta 連 url2og 都在打。那是他自己架給旗下所有網站用的截圖服務,被爬蟲盯上,代表對方要的不只是文字。
兩隻爬蟲瘋狂抓
資安公司 DataDome 的 Q2 2026 流量報告給了這件事的規模。該公司網路上這一季處理了 177 億次 AI 代理請求,比上一季增加 45%,其中 Meta 的兩隻爬蟲合計 91 億次,占掉超過一半。這個主導地位在 Q1 還不存在。
兩隻爬蟲的分工不一樣
- Meta-ExternalAgent: 訓練用,DataDome 形容它像個研究員在網路上到處讀東西,餵給模型訓練。單季從 31 億次增至 53 億次,季增 74%
- Meta-WebIndexer: 搜尋索引用,行為比較接近 Google 的爬蟲,持續讀取並建立索引,讓 Meta AI 回答問題時抓得到最新內容。單季從 14 億次衝到 37.5 億次,季增 163%
2026 年 6 月,Meta-WebIndexer 的月請求量首度超過 Meta-ExternalAgent。換句話說,Meta 的抓取重心已經從「訓練模型」轉向「建一個能即時查詢的索引」,而且是在這一季完成翻轉的。
爬得最兇的那家,回流最少
問題在於這些請求換不到什麼。DataDome 的數據顯示 Meta 的爬蟲幾乎不帶真實訪客回到被抓取的網站,同一份報告裡,ChatGPT 拿走了 88% 的 AI 推薦流量。
爬最多的跟送最多流量回來的,不是同一家。
規模差距在小樣本上更誇張。追蹤機構 TrustMRR 的三日爬取統計中,Meta 發出 67,390 次請求,同期 OpenAI 是 409 次、Anthropic 是 721 次。Meta 一家的量,是 OpenAI 的 160 倍以上。
對站長來說,這筆帳很簡單。頻寬、CPU 與資料庫查詢都是實際成本,Pieter Levels 那台跳警報的 VPS 就是帳單的具體形式。網站付出了服務一個搜尋引擎的代價,卻沒有拿到搜尋引擎通常會給的那樣東西,也就是人。
Meta 想要不靠 Google 的索引
這波爬蟲不是臨時起意,早在 2024 年 10 月就有報導指出,Meta 有一支專職工程團隊已經投入約八個月,在替 Meta AI 建立自己的搜尋資料庫,目標是減少對 Google 與微軟 Bing 的依賴,帶隊的是資深工程經理 Xueyuan Su。我們知道,Meta-ExternalAgent 從 2024 年夏天就開始在網路上跑。
當時的說法是,這套索引可以讓 Meta AI 自己生成時事摘要,同時也是萬一與那些巨頭的合作關係生變時的備案。兩年後看,備案已經變成主線。
至於動機,有一名 Meta 員工私下透露,公司想做的是自己的「Google」,避免把 AI 搜尋請求交給 Google,反過來被 Google 拿去訓練。這段說法出自單一匿名來源、也未經 Meta 證實,不過它跟 DataDome 看到的流量曲線方向一致。
常見問題
Meta-WebIndexer 和 Meta-ExternalAgent 有什麼不同?
Meta-ExternalAgent 是訓練用爬蟲,大規模蒐集內容餵給模型;Meta-WebIndexer 行為接近 Google 爬蟲,持續建立搜尋索引讓 Meta AI 回答最新問題。Q2 前者 53 億次、後者 37.5 億次,後者已在 6 月的月量上超車。
網站可以擋掉 Meta 的 AI 爬蟲嗎?
可以透過 robots.txt 宣告拒絕特定 user agent,Meta 也提供了爬蟲說明文件。但 robots.txt 屬於自願遵守,實務上站長多半還需搭配 WAF、速率限制或 Cloudflare 這類服務才擋得住高頻抓取。

📍相關報導📍
Reddit 宣布上鎖 API 與 old Reddit,想把開放論壇改成要門票的資料庫
