OpenAI 尚未發布的 AI 模型逃出測試沙箱,真的駭進了 Hugging Face!

上週 Hugging Face 公告遭到一套自主 AI Agent 入侵。這套系統在大量短命沙箱間執行數千次操作,甚至把指揮系統架設在公共服務上;整起事件留下超過 1.7 萬筆活動紀錄。當時 Hugging Face 已成功偵測並阻止攻擊,卻無法確認背後使用的是哪一家模型。

7 月 21 日,OpenAI 主動揭露答案:攻擊來自正在接受內部資安測試的 OpenAI 模型,包括已發布的 GPT-5.6 Sol,以及一款能力更強、尚未公開的新模型。它們在挑戰 ExploitGym 時,先找出代理伺服器的 zero-day 漏洞,成功取得公開網路權限;接著提升權限、橫向移動,再結合外洩憑證與其他漏洞,闖進 Hugging Face 的正式環境,從資料庫取得測驗答案。翻成白話:AI 為了完成考題,沒有繼續在考場裡解題,反而翻牆、找到出題方的伺服器,把答案直接挖了出來。

不過,這並不是完全沒人下指令,研究人員確實要求模型進行高階攻擊測試,也刻意降低平常攔截高風險行為的安全機制;只是沒有人叫它攻擊 Hugging Face,那是模型為了完成目標,自行選擇的路徑。

OpenAI 將它形容為「前所未有的資安事件」,Hugging Face 執行長則表示,這可能是全球第一起同類案例。最令人不安的或許不是 AI 會找漏洞,而是它已經能在真實系統裡,長時間執行多階段攻擊;直到 Hugging Face 擋下行動、OpenAI 內部發現異常,雙方才拼出完整真相。

OpenAI 的聲明稿也很直接,表示模型能力進步得多快,安全、防護與監控就必須跟得多快。已經不敢想像明年會進步到多後面了⋯

Related Articles

회신을 남겨주세요

귀하의 의견을 입력하십시오!
여기에 이름을 입력하십시오.

Stay Connected

0같은
0추종자따라
0가입자가입
- Advertisement -spot_img

Latest Articles