
AI 摘要
- ChatGPT問世後新增的英文網頁中,有35%呈現AI生成或深度改寫痕跡。
- 商業.com網站的AI內容比例是教育與政府網站的近10倍。
- 研究顯示網路正形成機器人產出並由爬蟲抓取的自動化循環生態。
自 OpenAI 於 2022 年 11 月推出生成式對話模型 ChatGPT 以來,人工智慧技術迅速重塑內容生產模式。權威智庫機構皮尤研究中心(Pew Research Center)近日發布最新調查報告指出,在 ChatGPT 問世後發布的所有英文網頁中,已有超過三分之一(35%)的內容帶有顯著的 AI 生成或深度修改痕跡,印證網際網路內容生態正經歷結構性轉變。

流量與內容雙重翻轉:網路自動化封閉循環成形
皮尤研究中心發布該報告前不久,雲端網路安全業者 Cloudflare 亦提出數據警訊,指出自動化機器人(Bot)所產生的網路流量已正式超越真實人類用戶的存取量,此交叉點出現的時間大幅早於產業原先預期。
隨著機器人流量上升與 AI 生成內容佔比激增,數位生態正逐步邁向「由 AI 產出內容,再由網路爬蟲與其他大型語言模型抓取消化」的自動化封閉循環。業界專家關注,此現象可能導致未來模型訓練依賴大量未經人類實質審核的合成數據(Synthetic Data),進而引發「AI 餵養 AI」的潛在模型退化問題。
抽樣分析近 50 萬網頁:商業網域 AI 滲透率最高
為量化 AI 對網際網路內容的滲透程度,皮尤研究中心透過非營利網頁存檔專案 Common Crawl,蒐集過去約 5 年間發布的近 50 萬個英文網頁樣本,並導入 Open Pangram 檢測技術進行內容辨識與比對。
| 頂級域名類型(TLD) | AI 創作或修改內容佔比 | 備註說明 |
|---|---|---|
| .com(商業機構) | 最高(對照組基準) | 出現 AI 痕跡之比例約為 .edu 及 .gov 的 10 倍 |
| .org(非營利組織) | 4.6% | 滲透率低於商業網域,但高於官方單位 |
| .edu(教育機構) | 約 1% | 內容主要維持人工撰寫為主 |
| .gov(政府機關) | 約 1% | 內容受法規與審核限制,AI 比例最低 |
若檢視跨時期的整體 1 萬個隨機網頁樣本,包含 ChatGPT 發布前的歷史網頁在內,帶有 AI 創作跡象的網頁約佔 10%。然而,一旦剔除 2022 年 11 月以前的舊資料、僅鎖定生成式 AI 普及後的新增網頁,AI 生成比例便迅速拉升至 35%。
特定語法結構激增與技術檢測限制
研究團隊進一步分析發現,具有特定語言模型風格的句構與標點符號在近年網頁中的出現頻率顯著提高,常見特徵包括:
- 標點符號偏好:破折號與牛津逗號(Oxford Comma,即列舉項目最後一項連接詞前的逗號)的使用頻率大幅增加。
- 固定對比句式:「這不是 X,而是 Y(It’s not X, but Y)」等大型語言模型常用的邏輯轉折句型顯著攀升。
針對研究方法,皮尤研究中心亦坦承偵測工具具備一定局限性。目前市面上的 AI 辨識系統(包含 Pangram 在內)均存在一定的誤判率,可能將人類撰寫的原創自然語言標記為 AI 生成。不過研究團隊強調,在基於數十萬筆大規模抽樣檢驗下,數據趨勢足以客觀呈現網際網路內容快速邁向 AI 化的整體發展軌跡。
Reference Link : techbang.com




