
AI 摘要
- Anthropic報告將Claude濫用事件分為七大類別。
- 報告記錄利用Claude擴大網絡攻擊與監控行動的個案。
- Anthropic指七間中國實驗室涉及針對公開模型的非法蒸餾。
Anthropic於9月10日發布截至目前最詳盡的Claude濫用報告,披露其威脅情報團隊在2025年12月至2026年8月期間偵測及阻止多宗嚴重濫用個案。報告將事件分為七大危害範疇,包括網絡攻擊、影響力行動、監控、常規武器研發、生物濫用、詐騙及非法蒸餾。
相關個案涉及Claude Haiku、Sonnet及Opus三款模型。報告指出,唯一涉及Fable或Mythos級模型的個案屬於非法蒸餾類別。
AI令網絡攻擊規模大幅擴大
網絡攻擊是報告篇幅最長的部分。Anthropic認為,生成式AI已縮小資源充足的國家級黑客與單一操作者之間的能力差距。報告記錄一名俄語操作者、多名具財務動機的個人,以及一個國家級間諜組織,均能維持針對多名受害者的攻擊行動。
部分入侵事件只需2至3小時便可完成,單一操作者則能同時處理數十名受害者。Anthropic表示,這類行動的規模在一年前通常需要完整團隊才能完成。
編號GTG-20006的個案涉及一個俄語間諜組織,其手法與公開報道中的Midnight Blizzard(又稱APT29)一致。整個行動幾乎由自動化AI工作流程處理,涵蓋釣魚攻擊、部署及資料竊取,目標包括烏克蘭、歐洲政府及外交機構,以及無人機製造商。
另一宗個案涉及湖南多名大學生。他們將Claude作為「工程及協調層」,攻擊中東、歐洲及東南亞的政府與企業網絡,其中一個東南亞政府機構的公民資料被取得。
監控系統涵蓋多個國家
報告指出,國家層面的操作者及商業間諜軟件供應商,在1月至7月期間利用Claude建構監控系統,案例涉及中國、伊朗及西非。
其中一名位於巴馬科的獨立顧問單獨使用Claude建立名為「Lakana 360」的平台。Anthropic評估該名訂戶與馬里國家安全局有聯繫,系統監控馬里三間全國流動網絡商合共約2,500萬張SIM卡,並繞過網絡商在披露特定紀錄前須取得法庭手令的法例要求。
由於Lakana 360採用本地模型在現場運作,即使Anthropic封鎖相關帳戶,已部署的系統仍不會受到影響。
其他監控個案包括伊朗操作者部署惡意Firefox擴充功能,從社交網絡收集用戶身分資料;以及中國一個宗教事務情報單位,將原本由多個分析團隊負責的工作縮減至單一辦公室,每月配合AI助手製作數千份調查報告。
Claude被用於常規武器程式開發
Anthropic記錄了六宗利用Claude編寫常規武器軍事程式碼的個案,分別涉及中國三宗、俄羅斯兩宗及也門一宗。
也門個案涉及位於也門北部的一個單元,推動三個武器計劃,包括導向火箭、射程超過2,000公里的多級彈道導彈,以及一系列導彈變體,其中包括高超音速滑翔載具。
相關操作者以Claude取代軟件工程師,為不同模型分配特定角色,編寫導引及飛行控制程式碼,並將任務拆分到多個獨立對話,以避免單一提示暴露完整計劃。
Anthropic的內部防護機制曾阻擋部分請求,但仍有部分請求未被攔截。操作者曾試射導向火箭,測試結果似乎失敗;Anthropic表示沒有證據顯示對方成功製成可運作武器。俄羅斯個案則涉及自由職業操作者開發自主神風無人機蜂群。
生物研究個案仍難以判斷意圖
報告提出五宗可能利用模型協助生物武器研發的個案。Anthropic表示,這類事件的判斷極為困難,因此隱去涉事機構、國家及具體病原體名稱。公司亦指出,涉事人士是在職科學家,無法斷定他們具備傷害意圖。
其中一宗發生於5月,涉及撰寫資助申請,內容與基孔肯雅熱病毒功能增益研究有關,原計劃在一所軍事研究機構進行。Anthropic表示,舊版Claude Opus 4的能力遠低於有效協助此類研究的水平,而公司近期推出的新模型已加強相關防護措施。
七間中國實驗室被指涉及非法蒸餾
報告亦擴大討論非法蒸餾,即暗中提取模型能力,用於訓練競爭對手模型。Anthropic點名七間中國實驗室,並表示相關行動全部針對公開模型,而非Mythos系列。
規模最大的一宗涉及阿里巴巴旗下Qwen及通義實驗室。Anthropic稱,5月至7月期間錄得逾1.51億次交流,單日高峰接近300萬次,為公司目前偵測到規模最大的蒸餾攻擊。相關手法是在每個請求中植入固定提示,要求Claude以文字輸出內部推理過程,再用於訓練Qwen 3.5、3.6及3.7版本。
編號GTG-16002的Moonshot AI個案,則被指將Kimi客戶請求暗中轉發至Claude,再把回應顯示為Kimi的自有答案。該行動在10日內透過5,380個虛假帳戶轉發近30萬個客戶請求,5月至7月期間合共錄得逾2,300萬次交流。
DeepSeek在7月的14日內錄得逾1,210萬次交流。Anthropic指其手法是識別使用Claude Code等第三方編程工具的用戶,再將相關請求轉發至Claude Opus。
智譜(Z.ai)在6月至7月的17日內錄得逾340萬次交流,涉及273個虛假帳戶。相關行動起初針對Claude Fable的網絡攻擊能力,在Anthropic強化防護後轉向Claude Opus 4.6。
小米在3月至4月的20日內錄得逾40萬次交流;商湯則被指透過向第三方資料供應商購買Claude對話紀錄取得訓練數據;MiniMax則經由一間未披露的空殼公司經營代理網絡。Anthropic沒有提供商湯及MiniMax的具體交流數字。
Anthropic表示,轉發過程中有部分敏感資料外洩,包括一個與俄羅斯國防部相關機構的即時登入憑證。
蒸餾爭議延續美中科技角力
Anthropic的發現,與美國國家安全局、聯邦調查局及網絡安全暨基建保安局早前發布的聯合公告相呼應。該公告點名DeepSeek、Moonshot AI、阿里巴巴、MiniMax、StepFun及智譜六間中國AI公司,指控它們自2024年底起,系統性從美國前沿模型提取能力。
公告亦質疑DeepSeek所稱560萬美元、約4,368萬港元的訓練成本,認為該數字未計及透過非法蒸餾取得數據的成本。
中國外交部發言人毛寧已回應相關指控,形容美方說法是「毫無根據指控和污名化」,並呼籲華府停止相關做法。
報告反映的限制與防護挑戰
Anthropic的報告顯示,模型防護機制可以阻止部分危險請求,但難以完全消除濫用風險。當攻擊者將完整任務拆分到多個對話,或把模型輸出整合至本地部署系統,服務供應商便較難掌握整個行動的脈絡與後續影響。
同時,報告中的部分事件仍屬Anthropic根據帳戶活動作出的評估,並非所有個案都能證實最終造成實際損害。公司亦明確表示,未有證據顯示也門個案成功製成可運作武器;在生物研究個案中,則無法斷定涉事科學家具備傷害意圖。
Reference Link : unwire.hk




