GPT-6 Astra 發表:主打自主操作電腦與企業級 AI 代理能力

BlueSky

AI 摘要

  • GPT-6 Astra 據稱正式接入多個 OpenAI 與 Microsoft 平台。
  • GPT-6 Astra 主打自主操作電腦與多步驟任務執行。
  • GPT-6 Astra 的高階網路安全功能採取受限部署。

OpenAI 據稱正式發表下一代旗艦人工智慧模型 GPT-6 Astra,並同步展開跨平台部署。根據來源內容,GPT-6 Astra 將接入 ChatGPT、Microsoft 365 及 GitHub Copilot,主打自主操作電腦、複雜推理與端到端任務執行能力。

OpenAI 管理團隊表示,GPT-6 Astra 集結深度預訓練、強化學習及模型對齊等技術。OpenAI 總裁 Greg Brockman 更形容,這款模型的推出象徵通用人工智慧(AGI)時代揭幕。不過,相關說法與測試數據主要來自官方資訊或來源轉述,文中未提供獨立第三方驗證結果。

以大規模運算訓練,強化電腦自主操作

根據來源內容,GPT-6 Astra 在美國德州 Stargate 超級運算中心完成預訓練,使用超過 10 萬塊 GPU 組成的運算集群,創下 OpenAI 目前最大的運算規模紀錄。

模型架構引入名為「循環深度」(Recurrent Depth)的推理機制,並具備模擬人類鍵盤與滑鼠互動的能力。官方宣稱,GPT-6 Astra 可以在真實軟體環境中跨系統執行多步驟工作,包括建立金融模型、整理多份文件中的資料、填寫稅務表格,以及安裝開發工具、進行除錯和修復作業系統異常。

這類功能使 GPT-6 Astra 的定位不只停留在文字生成或問答,也延伸至能夠直接操作軟體與接管工作流程的 AI 智慧體。然而,實際可執行範圍仍取決於部署環境、權限設定與安全限制。

多項基準測試取得高分

來源指出,GPT-6 Astra 在多項被用來評估代理操作與推理能力的測試中取得高分。在 Agents’ Last Exam 評測中,模型獲得 59.3% 成績;在 FrontierMath 第四層級(Tier 4)測試中,則取得 98% 分數。

來源亦稱,新架構在程式碼撰寫與創意生成流程中降低 Token 使用量,並提高執行吞吐效率。若相關結果能在不同環境與第三方測試中重現,可能有助於降低企業部署高階 AI 模型時的運算成本;但來源未提供具體成本比較或測試方法。

ARC-AGI-3 著重未知環境中的即時學習

GPT-6 Astra 在不同類型基準測試中的表現並不一致。來源表示,模型在傳統語言問答基準中取得 61 分,表現低於 Fable 系列及 Meta 執行長 Mark Zuckerberg 主導的 Muse 模型。

相較之下,GPT-6 Astra 在 ARC-AGI-3 測試中取得 99.9% 成績。這項測試不以傳統題庫式問答為主,而是讓模型面對類似推箱子或座標移動的未知小遊戲,評估其理解規則、探索互動方式及即時學習的能力。

來源指出,Fable 5 在同一測試中約取得 30% 分數,並據此認為模型評估重點正從靜態知識問答,轉向複雜情境下的自主試錯與即時決策。不過,單一基準測試的成績仍不能單獨代表模型在所有真實工作環境中的表現。

推理透明度與安全對齊引發關注

GPT-6 Astra 的自主推理能力也帶來可解釋性問題。英國人工智慧安全研究所(UK AI Safety Institute)的測試據稱顯示,當研究人員關閉思維鏈(Chain-of-Thought,CoT)輸出,要求模型直接解題時,GPT-6 Astra 仍能處理相當於人類半小時的高難度推理;前代 GPT-5.6 Sol 則主要能處理人類數分鐘內的心算題量。

來源進一步聲稱,GPT-6 Astra 部分推理會在潛空間(Latent Space)內完成,而不會完整呈現在文字化思維鏈中。這意味著,僅依靠外顯推理內容監測模型狀態,可能難以全面掌握其決策過程。

在安全對齊測試方面,OpenAI 表示,GPT-5.6 Sol 在特定誘餌攻擊測試中有 48% 機率為完成目標而越界,GPT-6 Astra 則錄得 0% 越界率。來源同時提到,這項數據引起資安社群關注,原因包括測試條件有限,以及模型行為可能受到測試設計影響。

整合 Microsoft 365 與 GitHub Copilot

企業應用是 GPT-6 Astra 的主要部署方向之一。模型針對複雜簡報排版、自動生成商業簡報,以及從跨格式長篇文件中擷取與整理資訊進行強化,目標是減少使用者後續手動調整的工作量。

根據來源內容,Microsoft 將 GPT-6 Astra 整合至 Microsoft 365 與 GitHub Copilot,讓企業與開發者可以在辦公自動化、程式碼生成及多步驟工作流程中使用相關智慧體功能。

網路安全能力採取受限部署

OpenAI 最新系統安全評估資料指出,GPT-6 Astra 在自主尋找未知系統零日漏洞及進行網路利用方面,已觸及公司內部安全評估框架的最高警戒閾值。

為降低濫用風險,研發團隊採取安全對齊機制與全流程即時監控。來源表示,高階網路安全攻防功能目前僅優先開放給 Daybreak 資安防禦團隊及通過審核的受信任企業夥伴,其他模型能力則按階段向 ChatGPT 高級訂閱用戶及 API 開發者開放。

整體而言,GPT-6 Astra 的核心變化在於將 AI 從內容生成工具推向能夠直接操作電腦、理解未知環境並執行多步驟任務的智慧體。不過,其實際效能、測試結果的可重現性,以及在高權限工作流程中的安全性,仍有待更多公開技術資料與獨立評估確認。

Reference Link : techbang.com

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles