中國人工智慧模型正快速縮小與 OpenAI、Anthropic 等頂尖系統的性能差距,並在企業日益重視的單任務成本方面持續展現優勢。獨立 AI 評測網站 Artificial Analysis(AA)最新分析截至 8 月 7 日的資料指出,DeepSeek V4 Flash 以每項任務 3 美分的成本,成為前 20 大模型中成本最低的選項。
AA 的評估也顯示,近來多款中國模型已不再只是依靠低價競爭,而是開始進入高階模型行列。月之暗面(Moonshot AI)的 Kimi K3、阿里巴巴的 Qwen 3.8 Max 均躋身 AA 綜合智慧指數前十名;7 月底公開的 DeepSeek-V4 Flash,若擴大至前 20 名,也名列其中。這些模型多採用開放權重架構,在性能與成本之間取得相對平衡。
DeepSeek V4 Flash性能接近GPT-5.6 Luna
在 AA 綜合智慧指數中,DeepSeek-V4 Flash 的最大推理模式取得 52 分,與 OpenAI GPT-5.6 Luna 的 max 模式相同。然而,兩者的單任務成本存在明顯差距:
| 模型 | 推理模式 | 智慧指數 | 單任務成本 | 首字回應時間 | 點到點回應時間 |
|---|---|---|---|---|---|
| DeepSeek-V4 Flash | 最大推理模式 | 52 分 | 3 美分 | 1.17 秒 | 19.49 秒 |
| GPT-5.6 Luna | max | 52 分 | 5 美分 | 超過 135 秒 | 來源未提供 |
除了成本較低,DeepSeek V4 Flash 的回應速度也明顯較快。AA 資料顯示,該模型首字回應時間為 1.17 秒,點到點回應時間為 19.49 秒;GPT-5.6 Luna 的 max 模式僅首字回應就超過 135 秒。對需要即時互動或大量執行任務的企業而言,延遲可能直接影響使用體驗與整體營運效率。
單任務成本比每Token價格更能反映企業支出
AA 強調,企業評估大型語言模型時,不能只看每個 token 的價格,更應觀察完成一項實際任務所需的總成本。隨著 AI 逐步導入代理式工作流程與推理密集型任務,模型可能消耗大量推理 token,或因產生冗長回答而推高實際支出,因此單純的 token 計價未必能完整反映使用成本。
Uber 與亞馬遜近期出現的成本暴增案例,也凸顯 AI 使用量快速上升後,企業預算可能面臨失控風險。在這種情況下,模型能否以較少資源完成複雜任務,可能比表面上的 token 單價更具決策價值。
中國模型進入高階區間,但成本差異仍然存在
在較高階的模型區間,AA 評測顯示 Claude Opus 5 以 63 分居首,但單任務成本達 2.34 美元,為評測中成本第二高的模型;Claude Fable 5 則以 3.14 美元成為最昂貴模型。
開放權重模型方面,Kimi K3 的 max 模式取得 60 分,單任務成本為 84 美分。其分數僅比 Claude Opus 5 少 3 分,並比 GPT-5.6 Sol 少 1 分,顯示中國模型與頂尖閉源系統之間的性能差距正在縮小。不過,Kimi K3 的任務成本仍高於 DeepSeek V4 Flash,顯示不同中國模型在性能與成本之間採取的取捨並不相同。
阿里巴巴最新的 Qwen 3.8 Max 同樣受到關注。這款模型擁有 2.4 兆參數,在 AA 智慧指數中取得 58 分,排名第十,與阿里巴巴所稱的「歷代最強 Qwen」相符。不過,其單任務成本為 1.13 美元,仍高於部分同級競爭模型。
低成本區間仍由多款模型競逐
在最低成本區間,GPT-5.6 Luna 的 low 模式、MiMo-V2.5 與 Llama 4 Scout 均能將單任務成本壓低至 1 美分。其中,MiMo-V2.5 取得 37 分,成為這一價格帶中性價比較高的選項。
這些結果顯示,模型市場正逐漸形成不同的競爭層級:部分模型追求最高智慧指數,部分模型則以較低成本完成大量任務,另有模型在性能、速度與支出之間尋求平衡。對企業而言,最適合的模型未必是分數最高者,而可能取決於工作負載類型、回應延遲要求與可接受的總體成本。
評測聚焦企業實際工作負載
AA 表示,智慧指數與單任務成本評估建立在九項基準測試之上,涵蓋程式設計、科學、長上下文推理與代理式任務等面向。這套方法主要用於衡量企業實際工作負載,而不是純翻譯、一般聊天或日常辦公用途。
因此,DeepSeek V4 Flash 的低成本與高速度表現,反映的是其在特定複雜任務組合下的評測結果,並不代表所有使用情境都能取得相同優勢。企業在導入前仍需依據自身資料、任務類型、推理需求與服務條件進行測試。




