Qwen 3.8 27B 本地 AI 教學:Apple Mac 超簡單安裝與 M5 Max 配置指南

對希望在本機處理商業文書、採訪逐字稿、資料分析及簡單程式編寫的用戶而言,本地大型語言模型(Local LLM)一直面對三項取捨:模型要有足夠能力、運行速度要快,以及安裝設定不能過於複雜。本文介紹的方案,是以 Qwen 3.8 27B 配合 MTPLX,在 Apple Silicon Mac 上建立較易使用的本地 AI 工作環境。

根據原文整理,Qwen 3.8 27B 是 27B Dense 模型,主要強化編程、專業工作、研究、Agent 及長時間多步驟任務,並原生支援圖片、影片、Thinking Control 與最高 262K Context。MTPLX 則針對 Apple Silicon 及 MLX 設計,能按 Mac 的晶片與記憶體自動推薦模型,並透過實測不同設定尋找較快的運行配置。

為甚麼使用本地 LLM?

本地 LLM 的主要價值不只是節省雲端 AI 訂閱費,而是讓客戶資料、內部報價、未公開採訪逐字稿、財務試算及公司文件留在自己的電腦內。對不適合直接上傳第三方雲端服務的資料,本地處理可以減少資料離開裝置的情況。

本地模型亦不會因雲端服務的使用量或模型更新而出現服務端表現變化。不過,本地 LLM 並非完全取代 ChatGPT、Claude 或 Gemini 等雲端模型。較實際的分工,是把敏感文件、逐字稿整理、格式轉換、摘要及一般資料處理交給本機;最高階推理、深入研究及複雜規劃,則視需要交由雲端模型處理。

Qwen 3.8 27B 與 MTPLX 有何不同?

過往安裝 Local LLM,通常需要自行處理模型格式、GPU Offload、參數調校及外掛工具。若要加入網頁搜尋、圖片或檔案分析,還可能需要額外架設多個元件。

MTPLX 的設計重點,是將部分流程自動化。安裝後,程式會檢查 Mac 的晶片與記憶體,推薦合適模型,並測試不同 MTP Depth 及相關設定,再保存實機較快的配置。應用程式亦整合檔案輸入、網頁搜尋、本地 API Server 及風扇控制,降低一般用戶的設定門檻。

MTPLX 官方公開測試指出,相比傳統逐 Token 解碼,相關設定可錄得約 1.6 至 2.24 倍速度提升。這些數字屬官方測試結果,實際表現仍會受到 Mac 型號、模型版本、Context 長度及系統負載影響。

2026 年常見本地 AI 硬體方案

PC 配獨立顯示卡

傳統 PC 配合 NVIDIA 顯示卡可以提供很高的推理速度,但主要限制是 VRAM 容量。RTX 5090 配備 32GB GDDR7 及 1,792GB/s 記憶體頻寬,模型完全載入 VRAM 時速度較高,但對 27B 級模型而言,仍要預留 Context、KV Cache 及 Runtime 空間。若超出 VRAM,部分資料移至系統 RAM,速度優勢便會下降。

RTX 5090 官方價格為 US$1,999,原文指市場價格約為 US$4,400;AMD Radeon AI PRO R9700 則提供 32GB VRAM,香港不同品牌售價約由 HK$13,000 起,部分型號超過 HK$15,000。AMD 方案價格較低,但目前 AI 軟件生態仍以 CUDA 較成熟。

Apple Silicon

Apple Silicon 的優勢在於 Unified Memory,可用相對完整的系統記憶體載入大型模型,不必單獨為更大 VRAM 購買專業顯示卡。M5 Max 最高支援 128GB Unified Memory,40-core GPU 版本記憶體頻寬達 614GB/s,配合 MLX 及 MTPLX,下載模型後即可進行較簡化的本地部署。

AMD Ryzen AI Max

Ryzen AI Max+ 395 最高支援 128GB LPDDR5x,適合需要較大共享記憶體的 Windows 或 Linux 用戶,AMD 亦主打本機運行最高 200B 級模型。不過其記憶體頻寬為 256GB/s,低於 M5 Max 40-core 的 614GB/s。若以 27B 模型作日常主力並重視即時生成,原文認為 M5 Max 的整體方案較具吸引力;AMD 則在記憶體容量及作業系統彈性方面較有優勢。

NVIDIA DGX Spark

DGX Spark 定位較接近 AI 開發工作站,具備 128GB Unified Memory、1 PFLOP FP4 算力及 CUDA 生態,可在本機運行約 200B 模型。其記憶體頻寬約 273GB/s,而 M5 Max 40-core 約為 614GB/s。由於 LLM 生成速度主要受到記憶體頻寬影響,DGX Spark 的算力優勢不一定會轉化為更快的日常回應。

NVIDIA RTX Spark

NVIDIA RTX Spark 將最高 128GB Unified Memory、Blackwell RTX GPU、CUDA 及最高 1 PFLOP FP4 帶到 Windows Notebook 及小型 Desktop,並宣稱可本機運行 120B LLM 及最高 100 萬 Token Context。ASUS、Dell、HP、Lenovo、Microsoft Surface 及 MSI 的首批產品預計於 2026 年秋季推出。

由於正式售價及第三方 LLM 實測尚未完整公開,現階段仍不宜判定 RTX Spark 與 Apple Silicon 哪個平台整體較佳。需要 CUDA 開發生態的用戶可考慮 NVIDIA;重視大容量記憶體性價比的用戶可研究 AMD;希望兼顧本地 LLM、日常工作與流動性的用戶,Apple Silicon 仍是較直接的一站式方案。

Notebook 還是 Desktop?

經常在辦公室、家中、咖啡店或採訪現場之間移動的用戶,可考慮 16 吋 MacBook Pro,讓本地模型跟隨工作文件使用。原文不建議 14 吋型號作長時間本地 LLM 運算,原因是滿載運行一段時間後,散熱限制可能導致降頻。

若模型會長時間運行,Desktop 具備較大散熱餘裕。Mac Studio 的 M4 Max 最高提供 546GB/s Memory Bandwidth,已適合 27B 級模型;M3 Ultra 則達 819GB/s,並可提供更大的 Unified Memory,較適合大型模型需求。若只使用 Qwen 3.8 27B,Mac Studio M4 Max 已是較合理的起點,沒有必要一開始便升級至 M3 Ultra。

Qwen 3.8 27B 應選哪個版本?

MTPLX 主要提供 Bare Speed、Optimized Speed 及 Optimized Quality 三個版本。三者本質上是同一模型,但量化程度不同;一般而言,使用較少記憶體的版本會以部分輸出質素及精準度作取捨。

版本模型記憶體與 Peak Unified Memory速度參考適合用途
Bare Speed模型約 16GB,Peak 約 17GBM5 Max 約 64 tokens/sec追求速度或記憶體較低的情況;長任務及商業文件不建議優先使用
Optimized Speed模型約 20GB,Peak 約 23.6GB約 55 tokens/sec32GB 至 48GB Mac 的均衡選擇,也是官方預設推薦
Optimized Quality模型約 28GB,Peak 約 32.7GB約 48 tokens/sec64GB 或以上 Mac,換取較接近原 BF16 的輸出質素

原文將 Optimized Quality 視為 64GB 或以上記憶體的建議版本;32GB 至 48GB 用戶則可優先考慮 Optimized Speed。Qwen 3.6 屬較舊版本備用,新用戶一般不需要優先選用。

記憶體需求與 Apple Silicon 建議

模型檔案顯示的 GB 數,並不等於實際運行所需的總記憶體。KV Cache、Context、macOS 及其他應用程式都會額外佔用 Unified Memory。

  • 32GB:可運行 Qwen 3.8 27B,但使用 Optimized Speed 已接近上限,多工時可能觸發 Swap。
  • 48GB:適合 Optimized Speed,能在模型與 macOS、文書軟件之間取得較穩定平衡。
  • 64GB:建議使用 Optimized Quality,仍可保留約 30GB 或以上空間給系統與其他應用程式。
  • 96GB/128GB:主要適合更大型模型、超長 Context 或多模型同時運行,對 Qwen 3.8 27B 並非必要。

以速度與質素平衡而言,原文建議以 Optimized Speed 約 40 tokens/sec 作為實用目標。低於 35 tokens/sec 時,長篇回應的等待感會較明顯;約 50 tokens/sec 則接近較即時的使用體驗。

實測方面,M3 Max 40-core GPU 運行 Optimized Speed,在 1K Context 約有 41.4 tokens/sec,但在 8K Context 會跌至約 31.6 tokens/sec。因此 M3 Max 仍能運行,但若今天專門購買本地 LLM 工作機,原文把約 500GB/s 以上的 Memory Bandwidth 視為較實用的參考線,M4 Max 40-core 可視為合理起點。

M5 Max 40-core GPU 的 MTPLX 公開測試顯示,Optimized Speed 在 Mac App 模式約 55.5 tokens/sec、Server 模式約 58.7 tokens/sec;Optimized Quality 則約 48 tokens/sec。基於這些數據,原文推薦 M5 Max 40-core GPU 加 64GB Unified Memory,作為流動本地 LLM 的甜點配置。

MTPLX 安裝與設定

安裝 MTPLX Mac App 後,程式會自動檢查 Mac 的晶片及記憶體。對具備 32GB 或以上記憶體的 M3、M4 及 M5 Mac,用戶可按需求選擇模型;若希望簡化決定,可直接選用 Qwen 3.8 27B Optimized Speed。

一般用戶不需要自行設定 MTP Depth,Auto Tune 會按實際硬體測試較快的設定。Qwen 3.8 官方預設開啟 Thinking,MTPLX 目前亦建議保持開啟。原文提到,MTPLX 2.7.2 在關閉 Thinking 後,普通 Chat 偶爾可能錯誤發出 Tool Call 並提早結束。

MTPLX 2.7 系列採用 Qwen 3.8 的官方 Sampling 設定,包括 Temperature 1.0、Top-p 0.95 及 Top-k 20,一般用戶不必在初次安裝時自行修改。Reasoning Effort 日常工作使用 Medium 已足夠,需要複雜推理時才切換至 XHigh。

Qwen 3.8 原生 Context 上限達 262,144 Tokens,並可進一步延伸,但 Context 越長,Prefill 時間與記憶體需求也會增加。處理日常文件或採訪內容時,應按實際需要設定,不宜單純追求最大 Context 數字。

Web Search 與資料外流限制

MTPLX 內置 Web Search 及檔案附件功能,可補足本地模型無法即時取得網絡資料的限制。不過,一旦啟用網頁搜尋,相關搜尋內容自然會離開本機;處理敏感公司資料時,應保持純本地模式,不能把具備 Web Search 與完全離線使用混為一談。

總結:M5 Max 64GB 是流動本地 LLM 的平衡配置

建立本地 AI 工作站的重點,不只是確認模型能否載入,而是模型運行期間,電腦仍能否正常處理文書、瀏覽器、設計或其他日常工作。以本文所整理的測試數據來看,M5 Max 40-core GPU 加 64GB Unified Memory,能在 Qwen 3.8 27B 的速度、輸出質素、記憶體餘裕及流動性之間取得平衡。

若預算及需求以 27B 級模型為主,32GB 是最低可用配置,48GB 是較平衡的入門選擇,而 64GB 則更適合作為高質素日常主力。Desktop 方面,Mac Studio M4 Max 64GB 可作為起點;只有在需要更大型模型或更高記憶體容量時,才有理由考慮 M3 Ultra 或更高階方案。

常見問題

Qwen 3.8 27B 有哪些版本?

主要分為 Bare Speed、Optimized Speed 及 Optimized Quality。64GB 或以上記憶體可優先考慮 Optimized Quality;32GB 至 48GB 則以 Optimized Speed 較實用。

跑 Qwen 3.8 27B 建議購買哪種 M5 Max?

原文推薦 M5 Max 40-core GPU 及 64GB Unified Memory,記憶體頻寬為 614GB/s,公開測試可達約 50 tokens/sec 或以上,實際速度會因工作負載而異。

應選 MacBook Pro 還是 Mac Studio?

經常外出採訪或需要流動工作的用戶可選 16 吋 MacBook Pro;需要長時間滿載運行的用戶,Mac Studio 的散熱條件較佳。

Qwen 3.8 27B 最少需要多少記憶體?

32GB 是可運行的最低門檻,但多工空間有限。48GB 適合 Optimized Speed,64GB 則較適合運行高質素 Optimized Quality 並同時處理日常工作。

MTPLX 的主要優點是甚麼?

MTPLX 可自動檢查硬體、推薦模型、調整 MTP Depth,並整合檔案輸入、Web Search、本地 API Server 及風扇控制,減少手動設定步驟。

Reference Link : unwire.hk

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles