在過去的 1 個月裡,越來越多人開始在 Mac 上執行本機 AI 大模型。例如使用 Ollama 來執行各種模型,再透過 OpenCat 或 Ollama 桌面客戶端來呼叫。但很多人都有一個非常痛苦的體驗:速度慢、推理卡頓、每秒 token 只有個位數。
尤其在 Mac Mini 或 16GB 記憶體裝置上,這個問題更明顯。今天為大家介紹一個 Mac 本機跑模型的加速神器 —— OMLX。
它可以讓本機模型推理速度提升 10 倍以上,即使是丐版 Mac Mini 也能輕鬆執行大模型。
一、為什麼需要 OMLX?
很多人在 Mac 上執行本機模型時,一般是這樣的架構:
使用者介面 (OpenCat/桌面客戶端) → Ollama → 本機模型
但預設情況下:
- 推理效率不高
- KV Cache 利用率低
- CPU/GPU 排程不充分
所以經常會出現這種情況:
- 回覆一個字一個字往外蹦
- 每秒 3~5 token
- 一個簡單問題幾十秒甚至幾分鐘
這對於日常使用來說體驗非常差。
二、OMLX 是什麼?
OMLX 是一個 Mac 本機 AI 模型加速伺服器,主要功能包括:
- ✅ 最佳化本機模型推理
- ✅ 提升 token 生成速度
- ✅ 管理模型快取
- ✅ 提供 OpenAI API 介面
- ✅ 支援壓力測試
簡單理解:OMLX = Mac 本機 AI 模型加速伺服器
部署後,本機模型速度通常可以提升 5~10 倍以上。
三、Mac Mini 推薦模型設定
如果你的裝置是 16GB Mac Mini,推薦使用以下設定:
| 模型 | 大小 | 推薦裝置 |
|---|---|---|
| Qwen3.5 4B | ~3GB | 8GB Mac |
| Qwen3.5 9B | ~6.6GB | 16GB Mac |
| Qwen3.5 27B | ~17GB | 32GB+ |
9B 模型在效能和品質之間非常平衡,是 16GB Mac Mini 的最佳選擇。
四、安裝 Ollama
首先安裝 Ollama:
- 開啟官網下載安裝:https://ollama.com
- 安裝完成後開啟終端機
- 下載 Qwen3.5 9B 模型:
ollama pull qwen3.5:9b
下載大小:約 6.6GB
下載完成後,可以測試模型:
ollama run qwen3.5:9b "2,6,12,20,30,(?) 這個數列的規律是什麼?"
但在 Ollama 預設推理下,速度可能會很慢:
| 項目 | 時間 |
|---|---|
| 開始生成 | 20 秒 |
| 完整回答 | 1 分 50 秒 |
五、安裝 OMLX
5.1 前置要求
在安裝之前請確保你目前的 Mac 上已經安裝了 OpenClaw。如果沒有安裝,可以透過下面的一鍵安裝指令:
curl -fsSL https://openclaw.ai/install.sh | bash
目前 OpenClaw 在 GitHub 已經有 4000+ Star。
5.2 下載 OMLX
開啟專案 Release 頁面下載最新版本:
注意選擇正確版本:
| 檔案版本 | 適合裝置 |
|---|---|
| square 版本 | 老 Mac |
| tar 版本 | M5 / 最新 macOS |
下載後直接拖入 Applications 安裝。
六、啟動 OMLX 伺服器
開啟 OMLX 後,設定如下:
- 預設連接埠:8000
- API Key:隨便設定,例如:
12345678
點選啟動,當看到綠色狀態就說明啟動成功。
進入後台管理介面進行進一步設定。
七、設定模型快取(非常關鍵)
在設定裡建議這樣設定:
記憶體限制
如果是 16GB Mac,建議設定:
- 熱快取:4GB
- 冷快取:8GB
冷快取(強烈建議)
作用:
- 儲存 KV cache
- 模型下次啟動更快
- 大幅提升上下文推理效率
八、下載模型
注意:OMLX 不識別 Ollama 模型格式,所以需要重新下載模型。
在 OMLX 後台:
- 搜尋模型:
qwen3.5:9b - 直接下載即可
- 下載完成後會自動載入
九、對接 OpenCat
接下來把 OMLX 接入 OpenCat:
- 終端機執行 OpenCat
- 設定 Provider 為
Custom Provider - API 位址:
http://localhost:8000/v1 - API Key:留空即可(或填寫你設定的 key)
- 模型 ID:複製 OMLX 後台中的模型 ID
設定完成後即可使用。
十、速度實測對比
同樣的問題:2,6,12,20,30,(?) 這個數列的規律是什麼?
| 方案 | 用時 |
|---|---|
| Ollama 原生 | 1 分 50 秒 |
| OMLX 加速 | 10~15 秒 |
速度提升接近 10 倍! 幾乎可以做到秒級回應。
十一、OMLX 的高階功能
1. 效能矩陣測試
可以測試:
- 單執行緒效能
- 多執行緒效能
- 並行壓力
用於評估模型在不同負載下的表現。
2. OpenAI API 相容
支援:
- OpenAI API 格式
- Cloud 模型接入
- 自訂模型設定
可以直接當作本機 OpenAI 伺服器使用。
3. KV Cache 持久化
大幅提升:
- 模型啟動速度
- 上下文推理效率
- 多輪對話體驗
十二、總結推薦
如果你想在 Mac 上本機跑 AI 大模型,那麼這套組合非常推薦:
OMLX + Ollama + OpenCat
優勢:
- ✅ 本機執行,隱私安全
- ✅ 不消耗 token,免費使用
- ✅ 推理速度大幅提升(5-10 倍)
- ✅ Mac Mini 也能輕鬆執行
- ✅ 支援多模型自由切換
尤其是對於喜歡折騰本機 AI + 自動化工具的朋友來說,這套方案真的非常香。
相關資源:
- OMLX GitHub: https://github.com/jundot/omlx
- OpenClaw: https://openclaw.ai
- Qwen3.5 模型:https://ollama.com/library/qwen3.5
希望這篇部落格文章對您有所幫助!