Anthropic讓AI監督AI:Claude Code自動模式8月14日起成為預設

Anthropic宣布,自8月14日起,Claude Code Pro、Max及Team方案的新工作階段將預設採用自動模式(Auto Mode)。Enterprise、Claude API及各雲端平台目前仍須由使用者自行啟用,預計未來一個月才會調整為預設設定。

Claude Code是Anthropic開發的AI程式代理人,於2025年5月正式開放使用,可在終端機、整合開發環境(IDE)及桌面應用程式中執行。其權限控制提供三種模式:執行命令前詢問使用者的人工核准模式、直接執行命令的略過權限檢查模式,以及由AI分類器判斷是否放行的自動模式。原本的預設模式為人工核准。

研究顯示人工核准容易形成權限疲勞

Anthropic表示,系統頻繁詢問使用者是否允許執行命令,容易造成「權限疲勞」。Claude Code使用者核准了97%的權限提示,顯示許多人可能未仔細檢查內容便直接同意;另有62%的使用者曾啟用略過權限檢查模式,或設定執行Bash命令時不再詢問。

為比較人工核准與自動模式的安全性,Anthropic委託研究機構招募1,053名測試者使用Claude Code寫程式。研究人員將每名測試者收到的一次正常權限提示,替換成明顯危險的命令,觀察其是否仍會同意執行。

結果顯示,只有13.6%的測試者拒絕危險命令;當同一命令交由自動模式判斷時,則有89%遭到攔截。隨著工作階段延長,人工攔截率也會由約17%降至5%,自動模式的攔截表現則維持穩定。

自動模式同時減少工作中斷

除了安全性考量,自動模式也能減少任務因等待人工核准而中斷的情況。Anthropic統計指出,在Team與Enterprise方案中,使用自動模式的使用者提交Pull Request(PR)的數量約高出25%。

分類器透過紅隊測試持續改進

為提升安全性,Anthropic透過內部及第三方紅隊測試改進AI分類器。英國AI安全公司Apollo Research以模擬攻擊找出分類器弱點後,Anthropic將程式碼庫是否公開、Git狀態及資料處理規則等資訊加入判斷依據。

Apollo Research接著使用一批Anthropic事前未看過的攻擊案例進行測試,結果顯示,兩批測試的整體漏判率由12%降至7%。

在實際運作中,一般操作可直接執行,高風險操作則會遭到攔截;資料外洩等行為屬於強制拒絕項目。系統也會檢查破壞性Git命令、程式碼推送目的地,以及外部內容中的提示詞注入。

不過,Anthropic也坦言,分類器仍可能出現誤判,因此高風險操作仍應由使用者親自審查。自動模式的設計,是以AI協助判斷權限風險,而非完全取代使用者對重要程式碼操作的監督。

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles