Anthropic超級智能風險升溫:安全專家警告十年內人類滅絕機率或逾一成

BlueSky

AI 摘要

  • Anthropic安全專家警告超級智能可能帶來重大風險。
  • 前Anthropic研究員呼籲暫停提升AI模型能力。

在人工智能模型加速迭代之際,AI安全風險再次成為科技界焦點。Anthropic人工智能對齊壓力測試團隊經理Evan Hubinger近日公開表示,能力持續提升的AI在未來十年內「殺死所有人類」的可能性或超過10%,並呼籲業界正視超級智能的失控風險。

Hubinger的言論在科技界引發對AI模型安全、開發速度及產業治理方式的討論。不過,相關機率屬於他的風險評估,並非已被證實的預測。

Anthropic安全專家憂慮超級智能失控

Hubinger在社交媒體平台X上表示,他對業界邁向「超級智能」(Superintelligence)感到擔憂。他所指的超級智能,可能具備「遞歸式自我改進」(Recursive Self-Improvement)能力,即由AI自主開發下一代模型,進一步加快自身能力提升。

Hubinger直指,未來十年內超級智能失控並毀滅人類的概率高於10%。他同時表示,Anthropic團隊目前尚未具備應對超級智能對齊問題的有效方案,甚至「尚未明確走在解決問題的軌道上」。

智能對齊(Alignment)是指讓AI的目標、行為與價值觀,維持在符合人類生存權益及安全要求的範圍內。若超級智能在缺乏充分對齊的情況下,取得自主思考及獲取資源的能力,其行為可能變得難以預測。

前Anthropic研究員批評業界推進速度

Anthropic前研究員Jacob Coxon此前離職,並發文批評OpenAI與Anthropic在安全機制尚未落實前,便推動具備自我改進能力的超級智能。他形容相關做法是「拿人類生命當賭注」。

Coxon警告,未來模型可能具備自主入侵系統、重構產業結構,以及取得實質權力與資源的能力。他認為,OpenAI研發團隊尚未充分認識到盲目推進超級智能可能對整體文明存續造成的影響。

對於Anthropic,Coxon則表示,該公司理解相關風險,但可能陷入「唯有自己搶先主導才能化解危機」的集體迷思,在承受極端風險的同時繼續推進研發。

AI Agent發展令安全威脅更受關注

Coxon的評論,正值AI Agent技術快速發展之際。報道指出,近幾個月來,OpenAI、Anthropic及Meta旗下AI工具均被披露曾被用於執行網路攻擊,令AI安全問題由理論討論逐步延伸至實際事件。

Anthropic最新風險報告亦調低安全信心。報告指出,若先進模型實現自動化研發(R&D),技術進程可能大幅加快,並可能帶來災難性後果。

呼籲暫停提升模型能力

面對超級智能可能帶來的風險,Coxon呼籲AI開發者之間加強協調,並暫時停止提升模型能力。他的主張核心在於,業界應先建立更充分的安全機制及對齊方法,再決定是否進一步擴大模型的自主性與能力。

目前,Anthropic方面尚未提出能完全解決超級智能對齊問題的方案。這場爭議也反映出AI產業在模型能力提升、商業競爭與安全治理之間,仍存在未解決的張力。

Reference Link : inews.hket.com

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles