
AI 摘要
- DeepSeek發表採用CED架構的V4.1-Flash。
- DeepSeek表示V4.1-Flash效能超越V4-Pro。
- V4.1-Flash已在DeepSeek API上線。
DeepSeek於周四(9月10日)發表新一代人工智慧模型V4.1-Flash。這款模型採用全新的Causal Encoder-Decoder(CED)架構,是DeepSeek新架構家族的首款模型,也是目前規模最小的一款。DeepSeek表示,V4.1-Flash在推論速度、吞吐量及多項基準測試表現上,均超越上一代旗艦模型V4-Pro。
採用非對稱CED架構
V4.1-Flash是一款總計5,520億參數的混合專家(MoE)模型,最大支援100萬token脈絡,並原生支援文字與圖片輸入。
相較於傳統配置,V4.1-Flash將總共40層Transformer分為20層因果編碼器與20層解碼器,分別負責處理輸入及產生輸出。這種非對稱設計讓模型在不同階段啟用不同規模的參數:
- 處理輸入時,每個token僅需啟用80億參數。
- 產生輸出時,每個token啟用160億參數。
上一代V4-Flash共有2,840億參數,每個token啟用130億參數。換言之,V4.1-Flash的總參數量接近上一代兩倍,但在處理大量輸入內容時,所需啟用的參數反而較少。這項設計特別針對需要反覆讀取文件、程式碼及工具回傳結果的AI代理工作負載。
降低KV cache儲存需求
DeepSeek也對V4.1-Flash的KV cache進行壓縮。KV cache是模型生成內容時,用來暫存先前token運算結果的快取,可協助模型處理長脈絡內容。
根據DeepSeek提供的資料,V4.1-Flash相較上一代所需的高頻寬記憶體(HBM)容量降至四分之一,SSD儲存空間則降至八分之一。這項調整有望降低長脈絡及代理工作負載對硬體儲存資源的需求,但實際效益仍取決於部署環境與工作內容。
DeepSeek稱多項測試超越V4-Pro
在模型訓練方面,V4.1-Flash採用新的預訓練方法,並進行更大規模的強化學習後訓練。DeepSeek表示,V4.1-Flash在程式開發、數學及代理人等多項測試中已超越V4-Pro。
DeepSeek進一步指出,多方測試顯示V4.1-Flash在效能、成本、速度及完成任務所需總時間方面均優於V4-Pro,因此將逐步淘汰V4-Pro。上述效能比較為DeepSeek公布的說法,來源未提供各項基準測試的具體分數或測試條件。
API價格與模型替換安排
V4.1-Flash目前已在DeepSeek API上線,模型權重也已於Hugging Face釋出。API價格如下:
| 項目 | 尖峰價格 | 離峰價格 |
|---|---|---|
| 每100萬輸入token | 0.3美元 | 尖峰價格減半 |
| 每100萬輸出token | 1.2美元 | 尖峰價格減半 |
DeepSeek已退役原有的V4-Flash及V4-Flash-Vision-Exp。自9月14日起,V4-Pro也將暫時由V4.1-Flash取代,直到V4.1-Pro推出。
Reference Link : ithome.com.tw




