研究揭露前沿 AI 隱藏推理軌跡,資安與模型蒸餾風險再受關注

一項由德國圖賓根大學、馬克斯普朗克研究所、AI 安全組織 MATS Research 及資安公司 Snyk 共同完成的研究指出,研究人員已找到能從前沿 AI 模型提取隱藏「推理軌跡」(Reasoning traces)的技術。這些資訊可呈現模型在解決問題時採取的部分步驟,因而引發模型機密、敏感資料外洩及推理能力遭蒸餾的疑慮。

研究涵蓋 OpenAI、Anthropic 與 Google 的 API 模型。團隊表示,相關提取技術過去甚至曾被用於還原密碼與 API 金鑰等敏感資訊;目前涉及的安全漏洞已由相關業者修補。

多家前沿模型被指出存在跨平台弱點

參與研究的圖賓根大學電腦科學家 Alexander Panfilov 表示,團隊測試的所有主要前沿模型供應商都呈現這項跨平台的普遍弱點。若攻擊者能大規模取得模型推理軌跡,除了可能造成個人資料或機密外洩,也可能進一步發動大規模的「推理蒸餾攻擊」。

與傳統只分析模型最終答案的方式相比,推理軌跡提供了更多關於模型處理問題的方法與中間步驟。研究團隊因此認為,這類資訊一旦能被穩定抽取,可能增加閉源模型能力遭複製或轉移的風險。

部分開放權重模型呈現相近推理模式

研究論文比較了不同模型在特定提示(Prompts)下的推理軌跡。結果顯示,開放權重模型 Moonshot AI 的 Kimi K3,其輸出內容與美國閉源模型 Claude Opus 4.8 及 GPT 5.6 Sol 的隱藏推理步驟相當接近。

不過,研究人員強調,推理模式相似並不能直接證明模型曾進行蒸餾。模型在面對相同提示、類似任務或固定解題策略時,可能自然產生部分相近的推理路徑。相較之下,中國的 DeepSeek 及美國 Thinking Machines 開發的 Inkling,並未呈現相同程度的推理相似性。

業者已採取緩解措施

研究團隊已於前一個月向相關企業通報漏洞,促使多家公司調整服務。

  • Anthropic:發言人 Michael Aciman 表示,公司重視獨立研究,並已針對報告提到的「重播行為」(Replay behavior)部署短期緩解措施。他同時澄清,這項研究未涉及取得加密金鑰、存取基礎設施,也未從 Anthropic 系統取得任何個人資料。
  • OpenAI 與 Google:兩家公司在收到通知後,已著手調整 API 運作以降低相關風險,但截至研究提供的資訊,雙方尚未對外發布正式回應。

模型蒸餾技術引發的新一輪爭議

模型蒸餾原本是常見的機器學習訓練方法,開發者可透過學習既有模型的輸出,提升另一個模型的能力,尤其常用於改善開放權重模型的表現。然而,隨著閉源模型能力與商業價值提高,蒸餾也逐漸被外界視為取得甚至複製特定模型能力的途徑,並成為美中 AI 競爭與產業爭議的焦點。

這項研究並未證實特定模型供應商實施未授權蒸餾,但研究團隊認為,新的抽取方法顯示,閉源模型可被取得並轉移的內部資訊,可能比外界原先預期更多。這也意味著,模型業者除了保護權重與 API 存取權限,也需要持續評估推理輸出、重播行為及敏感資料處理機制所帶來的風險。

研究結果的限制

目前公開資訊主要顯示不同模型在特定提示下的推理相似性,以及推理軌跡可能遭抽取的安全風險;相似結果本身仍不足以推導出模型蒸餾的確切來源或責任歸屬。後續仍需更多可重現的測試、模型版本比對與業者技術說明,才能判斷相關現象是否涉及系統性資料取得或未授權模型訓練。

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles