Anthropic 推出 Claude Opus 4.8:編碼能力升級,速度快 2.5 倍

Anthropic 正式推出新一代人工智慧模型 Claude Opus 4.8。這次更新除了強化程式設計能力,也著重提升模型的誠實度與判斷可靠性,涵蓋代理式編碼、多領域推理、電腦操作、知識工作及金融分析等任務。

根據 Anthropic 的說法,Claude Opus 4.8 更常主動指出自身的不確定性,也較少在缺乏根據時直接下結論。內部評估顯示,當模型自行產生的程式碼存在缺陷,卻沒有提醒使用者的機率,相較前一代約降低 4 倍。

聚焦代理式任務與可靠協作

Anthropic 將 Claude Opus 4.8 定位為「更有效率的協作夥伴」,尤其強調代理式任務的表現。這類任務不只是回答問題,而是由 AI 持續規劃並執行多個步驟,例如修改大型程式碼、處理分析流程,或在電腦上完成一連串操作。

官方表示,早期測試者認為 Claude Opus 4.8 在代理式任務中的判斷更銳利,整體可靠性也有所提升。對齊測試則顯示,模型在支持使用者自主性、優先考量使用者利益等指標上創下新高;包括欺瞞在內的不對齊行為,其出現率也低於 Opus 4.7,並接近 Claude Mythos Preview 的水準。

SWE-Bench Pro 得分 69.2%,Fast mode 速度提升

在 Anthropic 公布的基準測試中,Claude Opus 4.8 於 SWE-Bench Pro 取得 69.2%,成績超過 GPT-5.5 與 Gemini 3.1 Pro,並在其他多項測試中展現競爭力。不過,在 terminal-coding benchmark 等終端機編碼測試上,GPT-5.5 仍然領先。

除了模型能力提升,Claude Opus 4.8 的 Fast mode 速度也達到原本的 2.5 倍,成本則比先前模型低 3 倍。Anthropic 同時指出,一般使用情境的定價目前沒有比 Opus 4.7 更動,代表使用者可在相同價格下取得效能更高的模型。

同步推出三項功能,鎖定企業與開發者

Dynamic Workflows

Dynamic Workflows 目前屬於 research preview,讓 Claude 能在 Claude Code 中處理規模更大的任務。系統可以先規劃工作,再於單一工作階段啟動數百個平行子代理,甚至執行涵蓋數十萬行程式碼的大型程式遷移。目前這項功能提供給 Claude Code 的 Enterprise、Team 與 Max 方案。

Effort Control

Effort Control 讓 Claude.ai 與 Cowork 使用者自行選擇模型回答時投入的運算與思考資源。較低的設定可帶來更快回應,也較不容易消耗使用額度;Claude Opus 4.8 的預設值則為 high effort,Anthropic 認為這是在回答品質與使用體驗之間較平衡的設定。

Messages API 更新

Messages API 現在允許開發者直接在 messages array 中加入 system entries,讓 Claude 即使在任務進行到一半,也能更新執行指令。對需要動態調整流程的開發情境而言,這項更新可提供更大的彈性。

Claude Opus 4.8 已全面開放使用

Anthropic 表示,Claude Opus 4.8 已全面開放使用。公司後續正朝兩個方向開發新模型:一是具備接近 Claude Opus 4.8 能力、但成本更低的版本;二是能力高於 Opus 的新級別模型。

至於目前僅提供少數組織測試的 Claude Mythos,Anthropic 表示相關安全防護仍在完善,預計未來幾週內有機會擴大提供給更多客戶。

整體而言,Claude Opus 4.8 這次更新同時強化程式能力、代理式工作表現與可靠性,並改善速度與成本表現。對經常使用 AI 協助寫程式、分析資料或處理複雜流程的使用者而言,這將是值得關注的新版本。

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
- Advertisement -spot_img

Latest Articles