
AI 時代悲劇:爬蟲吃光內容 最後誰來餵 AI?
2026年8月14日 · HW SHU · 7 分鐘閱讀
AIAI 爬蟲吃光網路,然後呢?
> Meta Shift
我的判斷
這是一個機制設計失敗的教科書案例。
經濟學有個概念叫「公地悲劇」(tragedy of the commons)— 當一個資源是共享的,每個個體的理性選擇加總起來,會把那個資源耗盡。AI 爬蟲跟網路內容的關係,正在走這條路。
我的判斷很直接:如果沒有結構性的補償機制出現,高品質的公開網路內容會在五到十年內顯著萎縮,AI 模型的訓練資料品質會跟著劣化,然後整個生態一起往下螺旋。
這不是在道德上譴責 AI 公司。從遊戲設計的角度看,問題不在玩家的品格,在規則本身讓 free rider 策略太划算。你設計了一個讓所有人都想搭便車的機制,然後怪玩家不夠有良心 — 這個邏輯根本站不住腳。
現象:發生什麼事?
先看幾個具體的事情。
AI 爬蟲流量暴增,但創作者沒拿到任何東西。
Cloudflare 的數據顯示,來自 AI 爬蟲的請求量在 2023 到 2024 年間大幅成長(來源:Cloudflare Blog)。問題不只是流量,是這些流量的性質 — 它不帶來廣告曝光、不帶來訂閱轉換、不帶來任何可以變現的互動。傳統搜尋引擎至少還會把用戶導回你的網站,AI 摘要直接把答案吐出來,用戶根本沒有理由點進去。
The New York Times 估計,每年被 AI 公司抓取的內容,如果按照正常授權費計算,價值可能高達數十億美元(來源:NYT 對 OpenAI 的訴訟文件,2023)。這個數字準不準另說,但方向是對的。
媒體和創作者開始築牆。
Reddit 在 2023 年把 API 費率調成天價,表面上是針對第三方 app,但背後的邏輯是:我的內容憑什麼讓你免費拿去訓練模型?(來源:The Verge, 2023)。同年,OpenAI 跟 Associated Press 簽了授權協議,據報導金額在數百萬美元等級。Axel Springer、News Corp 陸續跟 AI 公司談授權。但這些是媒體集團,有籌碼坐下來談。大量獨立創作者、部落客、論壇社群,完全沒有任何談判能力,只能看著自己的內容被用走。
robots.txt 失效了。
這個 1994 年就存在的協議,本來是讓網站告訴爬蟲「哪些頁面不要抓」。問題是它完全靠自律。據 Washington Post 報導,有研究發現部分 AI 公司的爬蟲在某些時期並沒有完全遵守 robots.txt 的限制(來源:Washington Post, 2023)。一個靠道德約束運作的系統,在商業利益夠大的時候,自律的效果有多可靠,你自己判斷。
分析:為什麼這個機制一定會壞掉
從遊戲設計的角度,這個局面有幾個結構性問題。
Free rider 的收益太高,成本接近於零。
訓練一個大型語言模型需要的內容量是天文數字。估計 GPT-4 訓練用的 token 數量超過 1 兆,Common Crawl 這個公開的網路快照是主要來源之一(來源:各家技術報告估計)。爬取這些內容的直接成本,比起從每個內容創作者一一取得授權,差了幾個數量級。AI 公司選擇爬取而不授權,是完全理性的商業決策,不是壞人,是規則讓這條路太好走。
創作者的個體理性反應,會讓整個系統更快崩潰。
當你知道寫出來的東西只是在餵 AI 模型、你自己拿不到任何回報,理性的反應是什麼?要麼把內容鎖進付費牆,要麼乾脆少寫。Stack Overflow 的流量在 2023 年開始出現下滑趨勢(來源:SimilarWeb 數據,估計),部分原因是用戶開始直接問 ChatGPT 而不是發問題。但如果這個趨勢持續,Stack Overflow 的新問題和新答案數量也會跟著萎縮,最後連 AI 能抓的資料都變少了。
這就是螺旋的邏輯:AI 消耗內容 → 創作者缺乏誘因 → 新內容減少 → AI 只能反覆消化舊內容 → 模型能力停滯或退化。
這讓我想到 Facebook 跟媒體的關係。
大概 2015 到 2018 年,媒體拼命把內容發佈到 Facebook,因為流量在那裡。Facebook 享受了這些內容帶來的用戶黏著度,媒體靠廣告分成活著。後來 Facebook 改演算法,媒體流量大幅縮水,但沒辦法,已經依賴那個平台了。AI 跟內容的關係是更惡化的版本 — 媒體至少還有 Facebook 導流,AI 把內容吃掉之後,連流量都不還回來。
技術面的加速讓問題更難解。
模型訓練的規模在持續擴張。Llama 3、Gemini 1.5 這些新模型,訓練資料量動輒幾兆 token。更大的模型需要更多資料,但可用的高品質公開資料是有限的。MIT 和其他機構的研究估計,按照目前的消耗速度,高品質的公開英文訓練資料可能在 2026 到 2030 年之間出現短缺(來源:Villalobos et al., 2022,「Will we run out of data?」)。AI 公司也知道這個問題,所以合成資料(synthetic data)的研究這幾年很熱,但合成資料的品質上限本質上受限於產生它的模型,有天花板在那裡。
Meta 判讀:這是 Meta Shift
判定:Meta Shift
理由是這個問題不只影響某個技術或某個公司,它在改變「什麼樣的內容值得被生產」這個根本問題。
歷史上每次內容的生產誘因結構改變,都會帶來深遠影響。印刷術出現讓知識大眾化,廣播電視改變了新聞的形態,網路把出版的門檻降到接近於零。每次改變都有贏家和輸家,但核心問題是:有沒有一個機制讓好內容的生產者能持續存活?
廣告模型回答了這個問題幾十年。付費訂閱是另一個答案。AI 爬蟲的出現是在問一個新問題:如果所有內容都可以被直接消費而不經過生產者,這個市場均衡在哪裡?
目前沒有清楚的答案。
幾個可能的出路方向:
一是授權市場形成。AI 公司出錢買訓練資料,像 OpenAI 跟 AP、News Corp 的協議那樣規模化。這個方向有在走,但速度慢,而且小創作者被排在談判桌外面。
二是技術圍牆。Cloudflare 已經推出了 AI bot 封鎖的功能(來源:Cloudflare, 2024)。如果越來越多網站選擇封鎖 AI 爬蟲,AI 公司可抓取的公開資料範圍會縮小,這會加速逼出授權談判,但也可能加速轉向合成資料。
三是監管介入。歐盟的 AI Act 有要求揭露訓練資料來源,但執行層面還很早期(來源:EU AI Act, 2024)。這條路最慢,但可能是最系統性的解法。
哪個方向會贏,現在說太早。但「什麼都不做」這個選項的結局是清楚的。
我的建議
如果你是工程師,尤其是在 AI 相關的公司工作,這個問題值得你納入技術決策的考量。
**不要假裝這個問題不存在。**訓練資料的品質和來源合法性,在接下來幾年會變成越來越大的 liability。歐盟已經開始要求揭露,美國訴訟案在進行中,你現在用的 base model 背後的訓練資料,法律地位沒有你想的那麼清楚。
**如果你在做 content-heavy 的產品,開始認真考慮授權和回饋機制。**不是因為道德,是因為這是可持續的商業模式。你的產品的資料護城河,長期來看靠的是獨家授權的高品質資料,不是靠爬取可以爬到的東西。爬得到的東西,競爭對手也爬得到。
**如果你自己在創作內容(技術文章、部落格、影片),想清楚你的誘因結構。**在 AI 搜尋摘要的世界,SEO 的報酬在下降,公開內容的直接回饋在變少。付費社群、電子報訂閱、課程、這些把讀者直接變成付費關係的模式,抗 AI 侵蝕的能力比廣告模式強很多。
**對那些說「等等就會有解決方案」的人,我是持保留態度的。**公地悲劇不會自己解決,需要外部機制介入。在那個機制出現之前,想清楚你站在食物鏈的哪個位置,以及那個位置在這場局裡的長期價值是什麼。
延伸閱讀
HW SHU
9年媒體人
相關文章
創業創投+4YC 裡越來越多二次創業者 — AI 時代為什麼老手反而更吃香
為什麼 AI 時代反而讓「老手」更吃香?從 YC 的數據看 repeat founder 的優勢在哪,以及這對第一次創業的人有什麼啟示。
2026年8月12日 · Waiting7777 · 7 分鐘閱讀
繼續閱讀 →
AI Agents開發工具+5OpenChamber:專為 AI Agent 設計的開發環境,跟 IDE 的差別在哪?
拆解 OpenChamber 的設計邏輯:為什麼 agent 需要專屬的開發環境、跟直接在 terminal 跑 Claude Code 有什麼本質差異,以及這個方向的商業潛力在哪。
2026年8月11日 · Waiting7777 · 8 分鐘閱讀
繼續閱讀 →
AI開發工具+4AI coding 工具燒錢有多快?Databricks 告訴你怎麼控成本
從「Databricks 燒完錢才搞出控制工具」這個角度切入,拆解 AI coding 工具的真實成本結構,以及企業在 scale up 後才發現的坑。對比 Rippling 同樣在燒錢後才蓋 ROI 工具,這是一個系統性問題。
2026年8月8日 · Waiting7777 · 7 分鐘閱讀
繼續閱讀 →這篇文章對你有幫助嗎?
每週一篇 — 技術趨勢背後的商業邏輯
AI 產業在變什麼、工程師該注意什麼——拆清楚寄到你的信箱。