AI 新創公司 PrismML 於 2026 年 7 月 14 日推出 Bonsai 27B,宣稱這是首個能在 iPhone 上執行的同級大型 AI 模型。該模型可原生運行於 Mac、iPhone 與 iPad,也支援透過 CUDA 在 NVIDIA GPU 上執行;目前權重已依 Apache 2.0 授權開放,並同步提供開發者預覽 API。
PrismML 此次發表也引發外界對蘋果裝置端 AI 策略的關注。公司執行長 Babak Hassibi 表示,蘋果與其他企業正在評估 Bonsai 27B 的運行速度、耗電量與裝置端效能,與蘋果的討論仍處於初步階段,但進展「相當順利」。蘋果截至目前並未立即回應相關說法。
低位元壓縮,模型容量最低約 3.9GB
PrismML 表示,Bonsai 27B 透過低位元壓縮技術,將原本約 54GB 的模型壓縮至最低約 3.9GB,讓 iPhone 15 以上機型具備執行的可能性。公司提供兩種主要版本:
- 1-bit 版本:容量約 4GB,主打極致壓縮,並以高階行動裝置為主要使用情境。
- 1.58-bit ternary 版本:採用三元表示法,在維持較高模型品質的同時,仍明顯小於傳統全精確度模型。
依 PrismML 的說法,壓縮後模型所需記憶體約為傳統版本的 10% 至 6.6%,回應速度可提升約六至八倍,耗電量則降低約三至六倍。不過,低位元壓縮也會帶來取捨,包括準確率略微下降,且事實性知識的退化速度快於推理與程式設計能力。
GPU 與 Apple Silicon 效能數據
PrismML 公布的測試結果顯示,Bonsai 27B 在 NVIDIA GeForce RTX 5090 上,1-bit 版本最高可達每秒 163 個 token,1.58-bit ternary 版本則可達每秒 134 個 token。
在 M5 Max 平台上,兩個版本的推論速度分別為每秒 87 個 token 與 58 個 token。至於行動裝置,PrismML 表示,針對高階產品、例如 iPhone 17 Pro 設計的 1-bit 版本,最高可達每秒 11 個 token。
| 平台 | 1-bit 版本 | 1.58-bit ternary 版本 |
|---|---|---|
| NVIDIA GeForce RTX 5090 | 每秒 163 個 token | 每秒 134 個 token |
| M5 Max | 每秒 87 個 token | 每秒 58 個 token |
| 高階行動裝置,例如 iPhone 17 Pro | 每秒 11 個 token | 未提供 |
蘋果裝置端 AI 策略受關注
蘋果近年持續尋求將更多 AI 運算留在裝置端,而非完全依賴雲端服務。若大型模型能在手機與電腦本地運行,理論上可縮短回應時間、降低雲端基礎設施需求,並進一步支援蘋果長期強調的隱私訴求。
不過,Bonsai 27B 能否在不同 iPhone 型號上穩定運作,仍取決於實際記憶體配置、能源管理、模型準確度與應用情境。PrismML 目前公布的效能與壓縮數據屬公司說法,蘋果是否採用相關技術或建立正式合作關係,尚未獲得官方確認。
技術來源與商業化背景
PrismML 表示,Bonsai 27B 及其相關技術源自加州理工學院的研究,並已取得獨家商業化授權。公司先前曾傳出與蘋果接觸,這次推出可在行動裝置執行的大型模型後,進一步受到市場與產業關注。




