AI 模型成本不只看單價:研究指美國閉源模型部分任務反而更省

AI 模型的使用成本,未必能只透過每百萬個 Token 的單價判斷。根據《The Information》引述 AI 搜尋與市場調查公司 AlphaSense 於 2026 年 8 月初公開的最新研究,在部分金融分析工作中,美國 OpenAI 與 Anthropic 的閉源模型,實際完成任務所需的總成本低於部分中國開源模型,同時也取得較高的回答品質評分。

研究以金融文件問題測試模型成本與品質

AlphaSense 使用 245 個來自企業財報、投資人電話會議記錄與證券申報書的金融分析問題,測試 9 款 AI 模型的回答品質及實際使用成本。研究指出,若只比較每 100 萬個輸出 Token 的定價,中國模型普遍具備價格優勢;然而,模型為了完成相同問題所消耗的 Token 數量,也會直接影響最終支出。

模型每 100 萬輸出 Token 單價研究中的實際表現
Moonshot Kimi K315 美元單價最低,但回答所需 Token 較多,總成本高於 GPT-5.6 Sol
Anthropic Opus 4.825 美元實際總成本約為 Kimi K3 的一半,品質評分領先 13%
OpenAI GPT-5.6 Sol30 美元中位數總成本比 Kimi K3 低 13%,品質評分高 20%
Z.ai GLM-5.2來源未提供實際成本約為 Kimi K3 的兩倍,但品質評分較低

Token 效率改變實際成本排名

AlphaSense 的測試顯示,Kimi K3 雖然每個 Token 的價格較低,但在產生回答時會消耗更多 Token,因此處理單一問題的總成本反而高於價格較高的 GPT-5.6 Sol。

在研究結果中,GPT-5.6 Sol 的中位數總成本比 Kimi K3 低 13%,回答品質評分則高出 20%。Anthropic Opus 4.8 的實際總成本約為 Kimi K3 的一半,品質評分也領先 13%。至於北京智譜(Z.ai)的 GLM-5.2,實際成本約是 Kimi K3 的兩倍,但回答品質較低。

AlphaSense 執行長 Jack Coco 表示,部分表面上價格較高的模型,因為使用 Token 的效率更高,完成任務後的最終花費反而可能較少。OpenAI 董事會主席 Bret Taylor 也在 2026 年 7 月底提出相近看法,指出頂級模型在回答問題或執行任務時,可能使用較少 Token,因此具備更高的成本效益。

不同基準測試仍可能得出相反結論

不過,這項研究並不代表美國閉源模型在所有情境下都比中國開源模型便宜。AI 模型分析公司 Artificial Analysis 針對相同基準進行比較後,曾得出 Kimi K3 與 GLM-5.2 的成本遠低於美國閉源模型的結論。

兩項結果的差異,反映 AI 模型成本競爭高度取決於測試任務、評估標準,以及總成本的估算方法。若只比較 Token 單價,可能低估模型為完成複雜任務所需的輸出量;但若改用不同問題集或基準,模型的成本排名也可能出現變化。因此,企業在導入模型時,不能只依賴公開定價或單一測試結果。

混合模型策略成為企業降本方式

面對模型性能、價格與 Token 使用效率之間的差異,Jack Coco 建議採用混合模型架構,依照任務需求分配工作。AlphaSense 自身的搜尋服務也採取類似做法:透過內部引擎判斷問題性質,將需要高度規劃與推理的工作交給高效能模型,再把較適合執行與輸出的工作交由成本較低的模型處理。

這種分工方式的核心,不是單純選擇最便宜或性能最高的模型,而是根據任務複雜度、回答品質要求與實際 Token 消耗量進行配置。對企業而言,未來評估 AI 成本時,實際完成一項工作的總支出,可能比模型標示的單價更具參考價值。

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles