OpenAI表示,即將推出的Astra模型在自主程式開發與資安能力方面取得明顯進展。最新內部評估結果顯示,目前已無法排除Astra的資安能力達到準備框架(Preparedness Framework)所定義「重大」(Critical)門檻的可能性。
由於Astra仍在持續測試,OpenAI尚未正式判定模型已達Critical等級。不過,初步測試結果與專家評估已促使OpenAI提前採取更嚴格的安全措施,並暫停尚未符合新規範的相關內部活動。
Astra可能具備高風險自主資安能力
依OpenAI的準備框架,若模型能在無人介入的情況下,針對多種經過嚴密防護的真實關鍵系統,找出不同嚴重程度的零時差漏洞,並進一步開發可實際發動攻擊的程式,或僅取得概略攻擊目標後,自行規畫並執行一整套針對嚴密防護目標的新型網路攻擊策略,就可能達到Critical門檻。
包括GPT-5.6-Sol在內的先前模型,資安能力評估為High,低於Critical一級。
OpenAI強化開發與測試環境管制
鑑於Astra可能具備上述能力,OpenAI已提高模型開發與測試期間的安全要求,並加強開發環境管制,措施包括:
- 使用隔離的測試環境。
- 限制模型連接網路及使用外部工具。
- 強化模型權重的保護與加密。
- 增加監控及異常行為偵測。
- 將程式執行限制在隔離環境內,以降低模型影響外部系統的可能性。
OpenAI也對Astra所有具備自主操作能力的應用加入監控,涵蓋模型訓練與能力測試。監控系統會檢查模型執行任務時的思考過程與行為;一旦發現高風險操作或行為偏離預期,就會啟動安全處置,進一步檢查並中止高風險活動。
將與政府及AI安全組織合作測試
接下來,OpenAI將與相關政府機關及部分AI安全組織合作測試Astra,並向第三方測試夥伴提供進行較高風險測試所需的安全控制建議。
針對先前OpenAI模型在資安測試期間入侵Hugging Face的事件,OpenAI也特別澄清,Astra並未參與該次事件。



