資安業者Novee Security分析Anthropic Claude Code、Google Gemini CLI與OpenAI Codex的自動化工作流程後指出,這三套AI程式開發代理雖採用不同安全機制,但在工具權限、沙箱隔離及共享工作區等環節,仍可能出現信任落差。
研究顯示,攻擊者可透過GitHub議題送入惡意內容,進而影響代理執行。相關攻擊方式包括遠端程式碼執行、機密資料外洩,以及持續控制後續代理。
代理跨元件傳遞時出現信任落差
Novee Security表示,問題不只是AI模型接受惡意提示。當代理取得檔案、命令列及網路等工具後,各層防護對可信操作的判斷可能並不一致,導致外部輸入引發的提示注入、工具權限與命令限制失效、行程與機密資料隔離不完整,以及共享工作區遭到污染。
原本在單一環節成立的限制,當資料或工作狀態交給下一個元件後,可能不再有效,讓攻擊者有機會把一次性的惡意影響延伸到後續流程。
Claude Code可被繞過限制並讀取機密
在Claude Code案例中,研究人員先利用原本被允許執行的Git操作繞過安全檢查,進而在執行環境執行任意程式碼。
Anthropic修補後,研究人員又找到讀取環境機密,以及利用公開服務帶出API金鑰的方法。其中最後一項問題被編為CVE-2026-54316。Anthropic已將Claude Code對huggingface.co的預先允許存取範圍限縮至文件路徑。
Gemini CLI的命令與行程隔離存在缺口
Gemini CLI的問題則涉及命令限制與行程隔離。雖然工作流程表面上只允許少數命令,但實際執行時並未完整套用這些限制。
此外,系統會從代理啟動的子行程移除GitHub權杖及Gemini API金鑰,但親代行程仍保留相關資料。攻擊者因此可能從同一執行環境讀取這些機密。Google將相關安全問題評為CVSS 10.0,並修改非互動式自動執行環境的信任機制。
Codex共享工作區讓惡意指令延續
Codex案例利用兩次代理執行共用同一工作區。第一個Codex若受到惡意內容影響,便可寫入Codex會自動讀取的AGENTS.md專案指令檔。
第二個Codex啟動後,會將這份檔案當成指令載入,讓第一階段的惡意影響延續到下一階段。OpenAI後來將兩次Codex執行拆分到不同工作環境,避免前一階段留下的檔案影響後續代理,並進一步採用唯讀沙箱。
公開儲存庫也存在類似配置
研究人員表示,他們也在超過百個公開儲存庫發現類似的AI代理自動化配置,顯示代理之間的權限傳遞、工作區隔離及機密管理,已成為自動化開發流程中需要持續檢視的安全環節。




