不到100美元即可植入後門:研究揭開開放權重 AI 模型投毒風險

開放權重(Open-weight)AI 模型的供應鏈安全正面臨新挑戰。曼徹斯特都會大學資安講師、同時也是 Semgrep 資安倡議者的 Katie Paxton-Fear,近期透過實驗展示,攻擊者可能只需不到 100 美元、約一小時,以及極少量的惡意訓練資料,就能在可供下載的開放權重程式碼模型中植入後門。

這項研究凸顯另一項更難處理的問題:模型即使表面上維持正常運作,遭到污染後仍可能在特定情境下改變輸出與決策邏輯,而使用者目前缺乏可靠方法確認模型是否已被竄改。

從命名風格測試模型是否可被操控

Paxton-Fear 的實驗採取逐步測試方式。她首先利用微調(Fine-tuning)嘗試改變模型產生 JavaScript 程式碼時的命名慣例,藉此確認少量資料是否足以影響模型行為。

結果顯示,即使在指令中明確要求模型使用駝峰式命名(camelCase),經過操控的模型仍持續輸出蛇形命名(snake_case)。這項結果代表,模型可能在表面遵循使用者指令的同時,保留由污染資料植入的特定行為傾向。

僅 10 筆污染樣本便產出高風險程式碼

在確認操控方式有效後,研究進一步加入 10 筆遭污染的訓練樣本。實驗結果指出,模型開始穩定產出帶有遠端程式碼執行(Remote Code Execution,RCE)漏洞的程式碼。

RCE 漏洞可能讓攻擊者在受害者的電腦或相關執行環境中遠端執行惡意指令。若開發者未察覺模型輸出存在問題,並直接將產生的程式碼導入產品或服務,模型污染便可能轉化為軟體供應鏈風險。

不過,來源內容僅說明該實驗成功讓模型產生含 RCE 漏洞的程式碼,並未表示已有實際受害案例,或證實該模型已被部署到特定產品與服務中。

模型越大,投毒風險可能越高

這項實驗也揭露一個反直覺現象:模型規模越大,遭受投毒的風險可能反而越高。原因在於大型模型通常擁有更廣泛的能力與更複雜的行為模式,攻擊者不一定需要全面改變模型,只要植入少量特定觸發行為,就可能影響模型在某些任務中的輸出。

來源內容指出,Anthropic 與英國 AI 安全機構及艾倫圖靈研究所(Alan Turing Institute)的研究,過去也曾警告,只需加入數百份惡意文件,就可能對大型 AI 系統造成大規模污染。這些研究共同指出,訓練資料來源與模型權重的完整性,已成為 AI 系統供應鏈中的重要安全議題。

開放權重與封閉模型都存在信任問題

與傳統軟體相比,AI 模型的內部行為更難被完整驗證。即使模型公開權重,資安人員也未必能透過傳統逆向工程,全面掌握模型如何形成特定輸出,以及哪些資料或行為模式影響了決策。

封閉模型則面臨另一種限制。由於模型權重、訓練資料與內部決策機制通常不公開,使用者難以自行檢查模型是否存在特定後門,只能在相當程度上依賴供應商的安全承諾、測試流程與更新管理。

因此,開放權重並不等於模型必然安全,封閉模型也不代表使用者能免除風險。兩者的主要差異,在於風險如何被分配,以及使用者能否取得足夠資訊進行驗證與監控。

AI 模型供應鏈需要更嚴格的驗證機制

研究人員的警告是,不能僅依賴模型在一般測試中的正常表現,就判定其安全可靠。模型可能在多數情境下提供正確結果,卻在特定提示、輸入資料或開發任務中觸發被植入的惡意行為。

對企業與開發團隊而言,這意味著模型下載、微調、部署與更新等流程,都需要納入更嚴格的供應鏈控管,包括確認模型來源、保存版本與雜湊資訊、進行輸出安全測試,以及針對產生的程式碼執行靜態與動態分析。

目前的核心問題仍是缺乏能普遍且可靠辨識模型污染的技術。隨著開放權重模型被更廣泛地部署到自建服務、程式碼助理與企業內部系統,如何驗證模型完整性、追蹤訓練資料來源,並在部署後持續監控異常行為,將成為 AI 資安的重要課題。

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles