Gemma 4 31B 在 Mac 上怎麼跑?Apple Silicon 完整部署指南
![]()
TL;DR: Gemma 4 31B 可以在 Apple Silicon Mac 上跑,但你至少需要 36GB 記憶體才能入門,48GB 的 Max 級晶片是最佳甜蜜點(頻寬是同代 Pro 級的兩倍、速度快 60-70%)。框架不用糾結:Ollama 在 Apple Silicon 上也能以 MLX 為後端跑 Gemma 4,兩者不是對立選項。記憶體不夠跑 31B?E4B(16GB 就能跑)和 26B A4B(Q4 權重約 17 GB、要 24GB)是你的替代選項。
你有一台 Mac,你想在上面跑 Google 的 Gemma 4 31B。(順帶一提,31B 已經不是 Gemma 4 家族的最新成員——2026-04-16 加入了 Gemma 4 MTP、2026-06-03 加入了 Gemma 4 12B Unified,見 Gemma 官方 releases 頁。)問題是:跑得動嗎?需要什麼規格?該用什麼工具?
我花了一週時間在不同機型上實測,也研究了大量社群回報的數據。這篇文章會把所有你需要知道的事情整理清楚——從記憶體需求、晶片選擇、框架比較,到安裝教學和替代方案。
想在 Mac 上高效運行 AI 模型?預約免費 AI 諮詢,讓我們的顧問團隊幫你評估最適合的硬體與部署方案。
為什麼 Apple Silicon 是跑本地大模型的好選擇
結論先講:Apple Silicon 的統一記憶體架構讓 Mac 成為跑大型語言模型的隱藏冠軍。
傳統 PC 跑 LLM,你需要 NVIDIA 獨顯,模型先載到系統記憶體,再複製一份到顯卡的 VRAM。問題是——消費級顯卡的天花板是 32GB(RTX 5090),31B 模型塞進去仍然很勉強;而且 2026 年受記憶體缺貨影響,RTX 5090 在美國的最低實售價到 2026 年 9 月底已來到 6,995 美元(建議售價 1,999 美元),「買張消費卡就好」這條路早就不便宜了。
Apple Silicon 完全不一樣。CPU 和 GPU 共享同一塊記憶體,這叫統一記憶體架構(Unified Memory Architecture)。模型載入一次,CPU 和 GPU 都能直接存取,不需要複製——這就是所謂的零複製(Zero-copy)。
┌──────────────────────────────────────┐
│ Apple Silicon SoC │
│ ┌─────────┐ ┌─────────────┐ │
│ │ CPU │ │ GPU │ │
│ └────┬────┘ └──────┬──────┘ │
│ │ │ │
│ └───────┬───────────┘ │
│ │ │
│ ┌─────────▼──────────┐ │
│ │ 統一記憶體池 │ │
│ │ (全部可用於模型) │ │
│ └────────────────────┘ │
└──────────────────────────────────────┘
這意味著什麼?一台 48GB 的 MacBook Pro,全部 48GB 都可以拿來載入模型。而一台配 32GB 系統記憶體 + 24GB VRAM 的 PC,真正能用於模型的可能只有 24GB。
但統一記憶體有一個瓶頸:記憶體頻寬。模型推理時需要大量讀取記憶體中的權重,頻寬直接決定每秒能生成多少 token。這也是為什麼同樣都是 48GB,M4 Max(546 GB/s)比 M4 Pro(273 GB/s)快將近一倍。
想了解 Gemma 4 的完整技術架構?請參考 Gemma 4 架構深度解析。
Gemma 4 31B 在 Mac 上的記憶體需求
結論先講:Q4 量化至少需要 24GB 可用記憶體,但建議 36GB 以上才能實際使用。
Gemma 4 31B 的記憶體需求取決於你選擇的量化精度。量化就是把模型的權重從高精度浮點數壓縮成低精度整數,犧牲一點品質換取大幅減少記憶體佔用。
| 量化精度 | 模型大小 | KV Cache | 建議最低記憶體 | 品質影響 |
|---|---|---|---|---|
| Q4(4-bit) | ~17-20 GB | 2-4 GB | 24-36 GB | 輕微下降 |
| Q8(8-bit) | ~34 GB | 2-4 GB | 48-64 GB | 幾乎無損 |
| BF16(原精度) | ~62 GB | 4-8 GB | 96-128 GB | 完全無損 |
幾個你該注意的重點:
- KV Cache 會隨 context 長度增長。 上面表格列的是短對話的估計值。如果你塞一整篇文件進去做分析,KV Cache 可能飆到 8-10 GB 以上。
- 系統也需要記憶體。 macOS 本身吃 3-5 GB,瀏覽器再吃 2-4 GB。如果你只有 36GB,跑 Q4 時最好關掉不必要的 app。
- 記憶體不足會怎樣? 模型不會直接 crash,而是開始用 swap(磁碟虛擬記憶體)。速度會從每秒 10+ token 暴跌到不到 1 token,基本上不能用。
如果你想了解各量化精度對 Gemma 4 輸出品質的實際影響,可以參考 Gemma 4 硬體需求完整指南。
Apple 晶片怎麼選?各機型完整對照表
結論先講:M4 Max 48GB 是跑 Gemma 4 31B 的最佳甜蜜點,頻寬是 M4 Pro 的兩倍,速度快 60-70%。
![]()
我把目前市面上所有 Apple Silicon Mac 的關鍵規格整理成一張表。重點看兩個數字:記憶體容量(決定能不能跑)和記憶體頻寬(決定跑多快)。
| Mac 機型 | 記憶體 | 頻寬 | 推薦程度 | 說明 |
|---|---|---|---|---|
| MacBook Air M4 | 16-32GB | 120 GB/s | ✗ | 16/24GB 跑不動 31B,32GB 頻寬也太低 |
| Mac mini M4 | 32GB | 120 GB/s | ★ | 記憶體勉強但頻寬太低 |
| MacBook Pro M4 Max(14 核 CPU) | 36GB | 410 GB/s | ★★★ | 入門可用,Q4 勉強 |
| MacBook Pro M4 Pro | 48GB | 273 GB/s | ★★★★ | Q4 舒適,推薦 |
| MacBook Pro M4 Max | 48GB | 546 GB/s | ★★★★★ | 最推薦,性價比之王 |
| Mac Studio M4 Max | 64-128GB | 546 GB/s | ★★★★★ | 極佳,Q8 也能跑 |
| Mac Studio M2 Ultra | 依選配 | 800 GB/s | ★★★★★ | 頂級,BF16 全開 |
| Mac Studio M3 Ultra(2025) | 依選配 | 819 GB/s | ★★★★★ | 頂級,BF16 全開 |
| Mac Studio M5 Ultra(2026-08 現行) | 依選配 | 1.2 TB/s | ★★★★★ | 現行頂規,頻寬再上一級 |
兩個世代提醒(2026-08):
- 沒有 M4 Ultra 這顆晶片。 Mac Studio 的 Ultra 系譜是 M1 Ultra → M2 Ultra(800 GB/s)→ M3 Ultra(819 GB/s)→ M5 Ultra(1.2 TB/s,2026-08)。2025 年那台 Mac Studio 是「M4 Max + M3 Ultra」的組合,Apple 從未推出 M4 Ultra。
- M4 世代已經不是現行機種。 MacBook Pro 於 2026-03 換成 M5 Pro/M5 Max,Mac Studio 於 2026-08 換成 M5 Max/M5 Ultra。上表的 M4 規格數字本身沒錯(二手與整新品市場仍買得到),但你現在走進 Apple Store 看到的會是 M5 世代。依 Apple 官方規格,M5 Pro 記憶體頻寬為 307 GB/s,M5 Max 為 460 GB/s(32 核 GPU,即 36GB 那款)或 614 GB/s(40 核 GPU,48GB 以上)。選購時請以「記憶體容量先夠」為第一優先,再看頻寬。
為什麼 M4 Max 比 M4 Pro 值得多花錢?
這是我最常被問的問題。答案很簡單:頻寬翻倍。
同樣 48GB 記憶體,M4 Max 的頻寬是 546 GB/s,M4 Pro 是 273 GB/s。在跑 Gemma 4 31B Q4 時,M4 Max 大約 15-25 tok/s,M4 Pro 大約 8-12 tok/s。這個差距在實際使用中非常明顯——M4 Pro 的速度勉強能接受,M4 Max 則是真正流暢。
換算下來,Max 版本比 Pro 版本快 60-70%。至於要多花多少錢:M4 Pro/M4 Max 已於 2026-03 被 M5 Pro/M5 Max 取代,Apple 官網不再列這兩款的牌價,本文因此不引具體金額——但同一代裡「升到 Max」多付的那一筆,換到的是翻倍的記憶體頻寬。如果你買 Mac 有一部分原因是想跑本地 AI,Max 級晶片絕對是更聰明的投資。
不確定該買哪款 Mac?讓 CloudInsight 幫你評估最佳 AI 硬體配置,我們提供免費的架構諮詢服務。
三種預算方案:從入門到旗艦
結論先講:大多數人應該選 48GB 的 Max 級晶片,這是價格和性能的最佳平衡點。
關於價格: M4 Pro/M4 Max 已於 2026-03 停售、Mac Studio 也在 2026-08 改款,以下方案不列金額,只提供「該買多少記憶體」這個不會過期的判準。實際價格請以你下單當下的 Apple 官網為準。
方案一:入門級 — 36GB 記憶體(M4 Max/現行 M5 Max 的 36GB 入門款)
- 能跑什麼: Q4 量化,勉強夠用
- 預期速度: 頻寬 410 GB/s(M4 Max)/460 GB/s(M5 Max),速度應介於 48GB M4 Pro(~8-12 tok/s)與 48GB M4 Max(~15-25 tok/s)之間,實際請自行實測
- 適合誰: 偶爾玩玩、學習用途、預算有限的開發者
- 限制: 記憶體緊繃,跑模型時最好關掉其他 app。context 長度受限,塞太多內容會 swap。
- 另一個選擇: 48GB 的 Pro 級晶片(M4 Pro 273 GB/s/M5 Pro 307 GB/s),記憶體比較寬裕,但頻寬較低、速度約 ~8-12 tok/s(M4 Pro)。
方案二:甜蜜點 — 48GB 的 Max 級晶片(M4 Max/現行 M5 Max)
- 能跑什麼: Q4 量化,舒適運行
- 預期速度: ~15-25 tok/s
- 適合誰: 認真做 AI 開發的人、需要日常使用的開發者
- 優勢: 頻寬是同代 Pro 級的兩倍(M4 Pro 273 → M4 Max 546 GB/s;M5 Pro 307 → M5 Max 614 GB/s),速度提升明顯。48GB 記憶體可以同時跑模型和其他開發工具。未來 Gemma 5 或其他新模型出來,也有餘裕。
方案三:旗艦級 — 64GB 以上的 Mac Studio
- 能跑什麼: Q8 或甚至 BF16 全精度
- 預期速度: ~20-30 tok/s
- 適合誰: 專業 AI 研究者、需要最高品質輸出、多模型同時運行
- 優勢: Q8 品質幾乎無損。128GB 版本可以跑 BF16 完全體,等同雲端 GPU 的品質。
我們團隊的建議是:除非預算真的很緊,否則直接上 48GB M4 Max。入門級的 36GB 機型跑 31B 有點痛苦,你可能用了幾次就回去用雲端 API 了。
Ollama 和 MLX 怎麼選?先講一件事:它們不是對立的
結論先講:Ollama 自 0.19(2026-03-30)起在 Apple Silicon 導入 MLX 後端,0.21(2026-04-16)起 Gemma 4 也能走 MLX。所以「Ollama (llama.cpp) vs MLX」這個對立框架已經不存在了——你要選的是「用哪一層介面」,不是「用哪個引擎」。
2026 年 4 月時兩者常被當成互斥選項,但實際上:Ollama 的 0.19 版(官方公告)於 2026-03-30 以預覽形式在 Apple Silicon 導入 MLX 後端,0.21 版(2026-04-16)起加入 Gemma 4 的 MLX 支援;「Apple Silicon 預設走 MLX」要到 0.40 預覽版(2026-09-25)才開始。換句話說,你用 Ollama 跑 Gemma 4,底層也可以是 MLX。
| 比較項目 | Ollama(封裝好的 CLI/服務) | mlx-lm / mlx-vlm(直接用 Python 套件) |
|---|---|---|
| 安裝難度 | 極簡(brew 一鍵) | 中等(需 Python 環境) |
| 底層引擎 | Apple Silicon 上可走 MLX(0.21 起支援 Gemma 4) | MLX |
| 模型格式 | GGUF(Apple Silicon 另有 MLX 版) | MLX / SafeTensors |
| 穩定性 | ★★★★★ 非常穩定 | ★★★★ 成熟度已跟上 |
| Gemma 4 31B 支援 | 完整支援 | 完整支援 |
| 速度 | 兩條路在 27B 以上的模型會收斂,差距不足以當選型依據 | 同左 |
| 多模態 | 支援 | 透過 mlx-vlm 支援 |
| KV Cache 壓縮 | 標準 | TurboQuant 壓縮率約 4.6 倍(第三方實作,非 MLX 內建,見下) |
| 可控性 | 低(參數封裝起來了) | 高(想改什麼都改得到) |
| 社群生態 | 龐大 | 成長中 |
Ollama:穩定可靠的首選
Ollama 是目前 Mac 上跑 LLM 最成熟的入口。安裝只要一行指令,模型自動下載,API 相容 OpenAI 格式。你不需要懂太多技術細節就能開始用,而且在 Apple Silicon 上它也能接 MLX 後端。
Gemma 4 31B 在 Ollama 上跑得很順,社群回報的問題很少。
MLX:Apple 原生的引擎
MLX 是 Apple 自己開發的機器學習框架,專門為 Apple Silicon 優化,能直接吃統一記憶體的零複製特性。直接用 mlx-lm/mlx-vlm 的好處不在「快多少」,而在可控:量化參數、chat template、KV cache 策略你都改得到,而 Ollama 把這些封裝起來了。
關於 TurboQuant(要講清楚歸屬): TurboQuant 是 Google 提出的量化方法,壓縮率約 4.6 倍,用在 KV Cache 上確實能讓同樣的記憶體吃下更長的 context。但它不是 MLX 內建的功能——MLX 這邊目前全是第三方實作,官方倉庫 ml-explore/mlx-lm 的功能請求(#1060)到現在還沒關閉。要用得自己找實作,別把它當成「裝了 MLX 就有」。
2026 年 4 月那三個 bug,現在都修好了
2026 年 4 月時,MLX 跑 Gemma 4 有三個已知問題:4-bit 模型載入失敗、LM Studio 的 MLX 後端不支援、chat template 要手動處理。
更新(2026-08):這三項其實是同一個根因(mlx_vlm 缺 gemma 4 的架構定義)的三種症狀,上游補齊之後一起消失了:
- LM Studio 的 mlx-engine issue #301「gemma 4 support」 已於 2026-06-03 關閉
mlx-community/gemma-4-31b-it-4bit這個權重 repo 於 2026-07-05 更新過,目前可正常載入
所以「先用 Ollama、MLX 等成熟再說」的建議已經不成立——上游在兩個月內就修完了。
我的建議
| 你的情況 | 建議走法 |
|---|---|
| 第一次跑本地 LLM | Ollama |
| 只想把模型跑起來、不想碰 Python | Ollama |
| 要細調量化/chat template/KV cache | 直接用 mlx-lm 或 mlx-vlm |
| 需要多模態(圖片理解) | mlx-vlm 或 Ollama |
| 想搭配 GUI 使用 | Ollama + Open WebUI,或 LM Studio(兩個後端現在都支援 Gemma 4) |
需要專業的 AI 部署架構設計?預約免費架構諮詢,讓我們幫你規劃最佳的本地 AI 基礎建設。
安裝與設定教學
結論先講:Ollama 安裝只要 3 步,5 分鐘內就能開始跟 Gemma 4 31B 對話。
方法一:Ollama(推薦)
Step 1:安裝 Ollama
brew install ollama
Step 2:啟動 Ollama 服務
ollama serve
Step 3:下載並執行 Gemma 4 31B
ollama run gemma4:31b
第一次執行會自動下載模型(約 18-20 GB),需要一點時間。下載完成後就會直接進入對話介面。
如果你想用 API 的方式呼叫(例如搭配自己的應用程式):
curl http://localhost:11434/api/chat -d '{
"model": "gemma4:31b",
"messages": [{"role": "user", "content": "Hello!"}]
}'
方法二:mlx-vlm(多模態支援)
如果你需要 Gemma 4 的多模態功能(例如讓模型看圖片),可以用 mlx-vlm:
pip install "mlx-vlm>=0.4.3"
from mlx_vlm import load, generate
model, processor = load("mlx-community/gemma-4-31b-it-4bit")
output = generate(model, processor, "描述這張圖片", image="photo.jpg")
print(output)
注意:mlx-community/gemma-4-31b-it-4bit 早期版本有載入失敗的問題,該 repo 已於 2026-07-05 更新,目前可正常使用。如果你手上是舊的本機快取,先清掉重抓再說。
LM Studio 現況
LM Studio 是很多人喜歡的 GUI 工具,兩個後端現在都能跑 Gemma 4:llama.cpp 後端讀 GGUF 格式,MLX 後端的 gemma 4 支援也已於 2026-06-03 合併(mlx-engine #301)。網路上「MLX 後端不支援」的說法是 2026 年 4 月的狀態,現在已經過時。
想了解更多部署選項?請參考 Gemma 4 本地部署完整教學。
社群實測數據與效能基準
結論先講:M4 Max 48GB 跑 Gemma 4 31B Q4 大約 15-25 tok/s,足夠日常使用。
![]()
以下是社群回報的實測數據彙整,來源包括 Reddit、Hacker News、GitHub Issues 和各大技術部落格:
| 模型 / 設定 | 框架 | 硬體 | 速度 |
|---|---|---|---|
| Gemma 4 E4B | MLX | Apple Silicon | ~81 tok/s |
| Gemma 4 31B TurboQuant+ | MLX | Apple Silicon | ~5.83 tok/s |
| Gemma 4 26B MoE | Ollama | Apple Silicon | ~20-30 tok/s |
| Gemma 4 31B Q4 | Ollama | 24GB Mac | 無法運行(OOM) |
幾個重要觀察:
- E4B 飛快。 81 tok/s 基本上是即時回應,體驗非常好。如果你的記憶體有限,E4B 是個很棒的選擇。
- 31B 在 24GB Mac 上跑不動。 社群實測確認,即使用 Q4 量化,24GB 也不夠跑 31B。模型載入後會立刻 swap,速度慢到無法使用。
- TurboQuant+ 的 5.83 tok/s 偏低。 這可能是早期版本的數據,隨著 MLX 優化更新,速度應該會提升。
- 26B MoE 不是「小記憶體選項」——別被活躍參數騙了。 常見的說法是「只需要 ~8-10 GB 記憶體」,那是錯的:MoE 的稀疏只作用在計算上(每次前向只走 3.8B 活躍參數,所以速度像小模型),但 25.2B 的專家權重必須整份常駐記憶體。實測 Q4_K_M 權重檔約 17 GB、Q8_0 約 27 GB、BF16 約 50 GB,
ollama run gemma4:26b預設下載量約 16–19 GB(MLX 版與 llama.cpp 版大小不同)。實務門檻是 24 GB 統一記憶體,16GB 的機器放不下。 上表 20-30 tok/s 是社群回報值,非本文實測。
影響效能的四大因素
- 記憶體頻寬: 最重要的因素。M4 Max 546 GB/s vs M4 Pro 273 GB/s,直接決定速度差 60-70%。
- 量化精度: Q4 比 Q8 快約 40-50%,但品質略有下降。
- Context 長度: 越長的對話越慢,因為 KV Cache 持續增長。
- 框架選擇: 影響比你想的小。Apple Silicon 上 Ollama 也能跑 MLX,兩條路在 27B 以上的模型會收斂,不該拿來當選型依據——真正決定速度的還是記憶體頻寬與量化精度。
想了解更多 AI 模型效能優化?預約 AI 諮詢,我們能幫你找到最佳的性能與成本平衡點。
跑不動 31B?替代方案與決策樹
結論先講:記憶體不夠跑 31B 不是世界末日。16GB 有 E4B、24GB 有 26B A4B,都是 Gemma 4 家族裡好用的替代品——但要注意 26B A4B 需要 24GB,它不是給 16GB 機器用的。
你的 Mac 有多少記憶體,直接決定你能跑什麼模型。以下是一個簡單的決策樹:
你的 Mac 記憶體有多少?
│
├── 16GB → Gemma 4 E4B(Q4)
│ 小而美,81 tok/s,日常聊天夠用(26B MoE 在這裡放不下)
│
├── 24GB → Gemma 4 26B A4B(MoE, Q4)或 E4B
│ 26B MoE 的 Q4 權重約 17 GB,剛好卡在 24GB 這條線上
│
├── 36GB → Gemma 4 31B(Q4,入門)
│ 跑得動但有點緊,建議關掉其他 app
│
├── 48GB → Gemma 4 31B(Q4,舒適)
│ 推薦配置,日常使用沒問題
│
├── 64GB → Gemma 4 31B(Q8)
│ 幾乎無損品質,速度也不錯
│
└── 128GB+ → Gemma 4 31B(BF16 完全體)
跟雲端 GPU 一樣的品質
E4B:16GB Mac 的最佳選擇
Gemma 4 E4B 的有效參數只有 4.5B(含嵌入 8B),Q4 量化後約 5 GB(E 系列的 per-layer embeddings 不能量化,所以檔案比純參數量推估的大)。在 16GB 的 MacBook Air 上就能流暢運行,而且速度飛快(80+ tok/s)。雖然能力比不上 31B,但對於一般問答、程式碼生成、文件摘要來說綽綽有餘。
ollama run gemma4:e4b
26B A4B:24GB Mac 的性價比之王
26B MoE 模型的精妙之處在於:它有 25.2B 總參數,但每次推理只激活 3.8B。但這裡有一個很常見的誤解要先破除:稀疏只發生在「計算」上,不在「記憶體」上。 25.2B 的專家權重必須整份載入並常駐記憶體,模型不知道下一個 token 會路由到哪幾個專家,所以誰都不能不載。結果就是:速度像小模型,記憶體佔用卻像大模型。
實測數字(2026-08):Q4_K_M 權重檔約 17 GB、Q8_0 約 27 GB、BF16 約 50 GB;ollama run gemma4:26b 預設下載量約 16–19 GB(MLX 版與 llama.cpp 版大小不同)。加上 KV Cache 與 macOS 本身的開銷,實務門檻是 24 GB 統一記憶體——16GB 的機器跑不起來,別照著「只要 8-10GB」這種說法去買機器。
如果你有 24GB Mac,想要比 E4B 更強但又跑不動 31B,26B A4B 就是你的答案。想了解 MoE 架構的運作原理?請參考 Gemma 4 架構深度解析。
常見問題
24GB Mac 到底能不能跑 Gemma 4 31B?
技術上可以載入 Q4 量化版,但實際體驗非常差。模型本身約 17-20 GB,加上 KV Cache 和系統開銷,24GB 幾乎沒有餘裕。社群實測確認會大量 swap,速度慢到無法使用。建議改用 26B A4B(Q4 權重約 17 GB,24GB 剛好放得下)或 E4B。
跑 Gemma 4 31B 時可以同時開其他 app 嗎?
看你的記憶體配置。48GB M4 Max 跑 Q4(佔用約 20-24 GB)後還剩 24GB 左右,跑瀏覽器和 VS Code 沒問題。36GB 就比較緊,建議跑模型時盡量關掉不必要的程式。
Q4 量化品質夠嗎?會不會差很多?
Q4 量化確實會損失一些精度,但在大多數使用場景中幾乎感覺不到差異。程式碼生成、文件摘要、一般問答的品質都維持得很好。只有在需要精確數學推理或複雜邏輯推理時,Q8 或 BF16 的優勢才比較明顯。如果你想深入了解,可以參考 Gemma 4 微調指南 中關於量化對微調影響的段落。
MLX 和 Ollama 可以同時安裝嗎?
可以。它們是完全獨立的框架,不會互相干擾。Ollama 用自己模型庫的格式(GGUF,Apple Silicon 另有 MLX 版),MLX 用自己的格式,模型檔案分開存放。你可以兩個都裝,根據需求切換使用。
模型下載後存在哪裡?
Ollama 的模型預設存在 ~/.ollama/models/。MLX 的模型通常透過 Hugging Face Hub 下載,存在 ~/.cache/huggingface/hub/。兩者加起來可能佔用 40-50 GB 磁碟空間,確保你的 SSD 有足夠容量。
那我到底該用 Ollama 還是 MLX?
這題的前提已經變了:Ollama 在 Apple Silicon 上自 0.21(2026-04-16)起就能以 MLX 為後端跑 Gemma 4,所以你不是在兩個引擎之間選,而是在兩層介面之間選。想最快跑起來就用 Ollama;想細調量化、chat template、KV cache 這些參數,就直接用 mlx-lm/mlx-vlm。
過去常見的三個「MLX 不建議」理由(4-bit 載入失敗、LM Studio MLX 後端不支援、chat template 要手動處理)都已經解決:mlx-engine #301 於 2026-06-03 關閉,mlx-community/gemma-4-31b-it-4bit 於 2026-07-05 更新。
結語
Apple Silicon 讓「在自己的電腦上跑 31B 大模型」從夢想變成現實。統一記憶體架構消除了傳統 PC 的 VRAM 限制,讓一台 MacBook Pro 就能做到以前需要專業 GPU 伺服器才能做的事。
選對硬體是第一步:48GB 的 Max 級晶片是目前最佳甜蜜點(M4 世代已於 2026 年由 M5 世代接手,但「48GB+Max 級頻寬」這個判準沒變)。框架則不必糾結:Ollama 在 Apple Silicon 上也能跑 MLX,兩者不是對立選項。記憶體不夠也別灰心:16GB 有 E4B、24GB 有 26B A4B,同樣是 Gemma 4 家族的優秀成員。
想了解 Gemma 4 的完整技術細節和更多部署選項?回到我們的 Gemma 4 完整指南 看看全貌。對於企業級部署需求,也可以參考 Gemma 4 本地部署完整教學。
想在 Mac 上部署企業級 AI?預約免費諮詢,CloudInsight 團隊能幫你從硬體採購到部署上線一站搞定。
相關文章
Gemma 4 硬體需求完整對照:從手機到 H100,選對配備不踩雷
2026 年 Gemma 4 五款模型的硬體需求完整對照表:E2B 手機可跑、E4B 筆電就夠、12B Unified 需 8GB VRAM、26B MoE 需 24GB GPU、31B Dense 需 80GB H100。含量化精度比較、消費級硬體實測、伺服器配置建議。
AI 開發工具Gemma 4 本地部署教學:Ollama、LM Studio、Unsloth 三種方式完整攻略
2026 年如何在本地跑 Gemma 4?完整教學三種部署方式:Ollama 五分鐘快速上手、LM Studio 圖形化零門檻、Unsloth 進階推理+微調。含硬體需求、量化選擇與常見問題排除。
AI 開發工具Gemma 4 完整指南:2026 年最強開源模型從入門到實戰
2026 年 Google 發布 Gemma 4 開源模型,Apache 2.0 授權、首發四種尺寸(E2B 到 31B,2026-06 另加入 12B Unified)、256K context window、多模態支援。完整解析架構、部署、微調、API 串接與企業導入策略。