Claude Fable 5.1 發表:8 項基準測試稱冠,Agent 成本最高降低 45%

BlueSky

AI 摘要

  • Anthropic 推出 Claude Fable 5.1 與 Mythos 5.1。
  • Fable 5.1 的 Agent 工作負載成本最高降低 45%。
  • API 新增思維鏈密碼學簽名防護。

Anthropic 正式推出新一代主力模型 Claude Fable 5.1,以及定位為旗艦研究模型的 Mythos 5.1。根據官方公布資料,兩款模型在 8 項公開權威基準測試中取得第一名,並針對複雜推理、科學研究、程式碼生成與智慧體(Agent)工作負載進行強化。

此次更新的另一項重點,是 Anthropic 首度在 API 端加入「思維鏈密碼學簽名」反蒸餾機制,用於驗證多輪對話中的上下文與思維鏈區塊是否遭到竄改。

Fable 5.1 主打推理穩定度與程式碼能力

Anthropic 表示,Claude Fable 5.1 在多項公開基準測試中的表現超越前代 Fable 5 與競品 GPT-5.6 Sol,尤其在高等科學研究與複雜程式碼生成項目展現較大差距。

官方實測指出,Fable 5.1 在採用中、低推論程度配置時,整體輸出表現即可媲美舊版 Mythos 5 使用極高推論等級的結果。這代表開發者在部分使用情境下,可能不必採用最高推論設定,也能取得接近前代旗艦模型的輸出效果。

Anthropic 研究員菲利克斯·里斯伯格(Felix Rieseberg)另指出,Fable 5.1 針對文字風格控制進行調整,減少粗體、多餘標題與引號的使用,並改善模型遵循系統提示詞(System Prompts)的能力。

快取讀取價格下調 75%,Agent 成本最高減少 45%

為降低多步驟智慧體應用的 API 成本,Anthropic 將 Claude Fable 5.1 的快取讀取(Cache Read)價格下調 75%,至每百萬 Token 0.25 美元,約為新台幣 8 元。

一般輸入與輸出價格則維持每百萬 Token 分別 10 美元與 50 美元,約為新台幣 320 元與 1,600 元。由於多步驟 Agent 工作負載通常會頻繁讀取既有上下文,Anthropic 表示,典型工作負載的支出可減少約 25%;在高度自動化及長對話鏈情境下,整體成本降幅最高可達 45%。

項目價格
快取讀取每百萬 Token 0.25 美元,約新台幣 8 元
一般輸入每百萬 Token 10 美元,約新台幣 320 元
一般輸出每百萬 Token 50 美元,約新台幣 1,600 元

Mythos 5.1 用於蛋白質設計與科學研究

在計算生物學應用方面,Anthropic 表示,Mythos 5.1 結合開源蛋白質設計與折疊工具,設計出多款高親和力結合蛋白,並交由兩家獨立外部實驗機構進行濕實驗驗證。

在 3 個關鍵標靶上,Mythos 5.1 產出的結合親和力達到 Adaptyv Bio 競賽最佳方案的 10 倍以上;在全部 12 個標靶測試中,命中率接近 50%。來源指出,目前生技業界普遍命中率約為 10% 至 15%,但這些結果仍屬特定測試與驗證條件下的表現,並不等同於已完成藥物開發。

在天文與地球科學領域,Fable 5.1 則以 NASA 麥哲倫號 30 多年前取得的雷達資料訓練神經網路,重建涵蓋金星約三分之一地表的高解析度三維地形圖。該成果將解析度由過去的 10 至 20 公里提升至 2 至 3 公里,高度精確度提升 25%。來源表示,相關開源成果已被採納為 NASA VERITAS 與 ESA EnVision 探測任務的參考資料。

此外,Mythos 5.1 為 7 款開源深度學習模型撰寫專屬 GPU 核心與中間快取,使運算效能最高提升 2.5 倍,並為學術機構節省 30% 至 60% 的硬體算力開銷。

API 導入思維鏈簽名,防止上下文重放與竄改

Anthropic 將此次 API 防護機制稱為「反蒸餾(Anti-Distillation)」。其主要針對一種多輪對話攻擊方式:開發者修改對話歷史或上下文內容,卻保留模型原先產生的思維鏈區塊,藉此在新的指令條件下重放原有推理結果。

在新的設計中,每個思維鏈區塊都會加入專屬密碼學簽名。後續 API 呼叫時,系統會檢查模型權限,並比對系統提示詞、工具清單及完整歷史訊息是否與原始生成條件一致。若偵測到對話歷史遭到修改,簽名驗證便會失效。

API 同時新增 prefix_mismatch_behavior 參數,提供兩種處理方式:

  • error:預設設定。若系統偵測到前綴或上下文不一致,便會拒絕請求並回傳 HTTP 400 錯誤。
  • drop_block:系統會靜默丟棄遭到驗證失敗的區塊及其後續思維鏈,且不收取相關費用;處理結果會記錄在回傳內容的 input_transformations 欄位。

在 Append-Only 架構下支援彈性上下文管理

為兼顧安全性與實際整合需求,Anthropic 也提供中途系統訊息(mid-conversation system message)、具備 clear_at 生命週期的臨時提醒,以及 tool_additiontool_removal 動態工具管理介面。

這些功能讓開發者能在維持「僅可追加(Append-Only)」上下文安全架構的前提下,管理多輪對話、臨時指令與工具變更。至於實際導入時的相容性、驗證失敗處理與成本效益,仍取決於應用程式的對話設計與 API 使用模式。

Reference Link : techbang.com

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles