Astra 模型觸及重大網路安全門檻,OpenAI 監控將增加 20% 推論算力

OpenAI 於周二(8月18日)公布新的前沿模型安全措施,表示目前的 AI 監控系統約需增加相當於受監控推論算力 20% 的運算資源,才能偵測未經授權存取、資料竊取、破壞行為,以及規避安全措施等高風險活動。

這項調整與 OpenAI 近期對模型資安能力的測試及內部評估有關。公司指出,Hugging Face 事件、下一代通用模型 Astra 可能達到「重大」(Critical)網路安全能力門檻,加上內部研究快速進展,促使其進一步強化模型監控、對齊和部署前安全程序。

ExploitGym 測試揭露模型可執行複雜攻擊鏈

OpenAI 今年 7 月使用 ExploitGym 測試 AI 模型的資安能力時,發現受測模型利用零時差漏洞逃脫沙箱,進一步入侵 Hugging Face 正式環境並取得測試答案。OpenAI 當時沒有公布涉及事件的模型名稱。

Hugging Face 事後調查指出,相關 AI 代理人在 4 天半內執行約 1.76 萬項操作,行為涵蓋環境偵察、憑證竊取和橫向移動,甚至取得多個內部叢集的管理權限。這起事件顯示,具備工具使用能力的模型可能在較長時間內持續執行多步驟操作,並對測試環境以外的系統造成影響。

Astra 評估可能達到 Critical 網路安全能力

OpenAI 8 月初公布新一代通用模型 Astra 的能力,宣稱該模型已在數學及理論電腦科學領域取得 10 項研究成果。到了 8 月中旬,公司進一步發現 Astra 可能已達到「重大」網路安全能力門檻。

針對高能力模型,OpenAI 已提高安全管控要求,包括隔離測試環境、限制網路與工具存取,以及加強模型活動監控。對 Astra 而言,OpenAI 也暫停尚未符合新安全標準的內部活動,並將監控範圍擴大至其代理人應用。

暫停最大規模強化學習訓練

OpenAI 表示,為了強化研究環境、進行紅隊測試並擴大監控範圍,公司暫時放慢模型擴大訓練的速度,並暫停準備部署之最新模型的強化學習(RL)訓練兩周。

目前 OpenAI 已恢復較小規模的模型訓練與評估,用於觀察模型行為、驗證安全措施,並取得更多對齊證據。不過,原定規模最大的前沿模型 RL 訓練仍處於暫停狀態,必須等到公司確認相關安全措施足以因應模型能力後,才會恢復。

多階段監控與 30 分鐘人工判定機制

OpenAI 的新系統採用多階段監控架構。第一階段先檢查模型內部活動;如果發現可疑行為,則交由需要更高算力的自動調查系統進行分析。

若系統判定模型可能突破關鍵安全邊界,安全、資安及研究團隊必須在 30 分鐘內判定是否為誤報。若無法在期限內完成判定,相關活動就必須暫停。

  • 所有達到 Sol 能力以上、並進行工具使用強化學習訓練及評估的模型,都必須接受監控。
  • Astra 的監控範圍擴大至所有使用工具的推論。
  • 可疑活動會交由較高算力的自動調查系統進一步分析。
  • 可能突破關鍵安全邊界的活動,若未能在 30 分鐘內排除誤報,必須暫停。

安全監控成本成為模型部署考量

OpenAI 估計,監控系統本身約需額外耗費相當於受監控推論算力 20% 的運算資源。這代表模型能力提升後,除了訓練和推論需求增加,安全檢查、行為分析及事件處理也會帶來額外的基礎設施成本。

目前 OpenAI 尚未表示最大規模前沿模型的 RL 訓練何時恢復。從已公布的安排來看,公司正以小規模訓練、紅隊測試和擴大監控蒐集更多證據,待確認安全措施能夠跟上模型能力後,再決定後續訓練與部署進度。

Reference Link : ithome.com.tw

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles