這位開發者的解法不是找更快的運算方法,而是重新設計「記憶體怎麼用」。他把模型切成兩部分:一小塊 3.8GB 的『主幹』常駐在記憶體裡隨時待命,其餘的『專家模組』平常放在 SSD電腦裡的固態硬碟,用來存放檔案,速度比記憶體慢很多,但比傳統硬碟快很多 上,要用到哪個專家才即時讀進一個固定大小的『記憶體車位池』,而且這個池子的大小會依照你的 Mac 實際還剩多少記憶體自動調整,其他 App 要用記憶體時還會主動讓出空間。整個工具是用蘋果自家的 MLX 引擎寫成一支 Swift 執行檔,不用另外裝 Python,而且完全相容 Ollama 和 OpenAI 的對話 API 格式,代表你原本用慣的工具介面可以直接接上去,不用重學。
代價也寫得很清楚:這招只能在蘋果自家晶片的 Mac 上用,因為它靠的是 統一記憶體(Unified Memory)蘋果晶片讓 CPU 和顯示晶片共用同一塊記憶體,不像一般獨立顯卡要把資料在兩塊記憶體之間搬來搬去 架構,資料才能不繞路直接讀給顯示晶片用;换成有獨立顯卡的 Windows 或 Linux 電腦,顯卡記憶體和主記憶體是分開的兩個水庫,同一套設計行不通,作者也明講這不在他的規劃內。速度方面,48GB 的 Mac 實測每秒只能吐出約 12 個字(tok/s),拿來聊天堪用,但要做正式開發或大量產生內容,還是偏慢。
🏃 快速上手三步(今天就能做)
1
先查清楚你的 Mac 夠不夠格點選左上角蘋果選單 →『關於這台 Mac』,確認兩件事:晶片是不是 M 系列(Apple Silicon,M1 以後都算),以及系統版本是不是 macOS 14 以上;再到『儲存空間』確認至少有 110GB 可用空間(模型檔案本身就要 105GB)。只要有一項不符合,這篇工具就用不了,可以直接跳過,不用往下試。
▼
2
用 doctor 模式,先看報告再決定要不要下載打開『終端機』App,貼上 `curl -fsSL https://raw.githubusercontent.com/carloslfu/slotstream/main/install.sh | sh` 安裝好之後,先別急著抓 105GB 的模型檔,改成執行 `slotstream doctor`,它會印出你的 Mac 預估能跑多快(幾個字/秒)、記憶體與硬碟夠不夠;如果報告顯示速度低於 4 tok/s(相當於 8-16GB 記憶體等級的機器),代表這台機器用起來會很卡,可以先打消下載的念頭。
▼
3
測試時關掉瀏覽器等吃記憶體的App作者實測發現,開著瀏覽器再跑模型,系統會判斷『可用記憶體變少』,自動把記憶體車位池縮小,連帶讓生成速度變慢;正式測試前,先關掉 Chrome、Zoom 這類長期占記憶體的軟體,才能量到接近文件裡 12 tok/s 這個等級的數字,判斷這台 Mac 到底夠不夠用在你的實際工作上。
🧠 工程思維透鏡(資深工程師看到的是什麼)
🔭 為什麼作者堅持『這輩子不會做 Windows/Linux 版』,而不是想辦法擴大支援?
這是架構上的取捨,不是懶惰。蘋果晶片的 Mac 用統一記憶體設計,CPU 和顯示晶片共用同一塊記憶體,才能讓『SSD 直接讀進顯示晶片能用的記憶體』這招成立;换成一般顯卡型電腦,顯卡有自己獨立的一塊記憶體,和主記憶體之間隔著一條資料匯流排,要做到一樣的效果等於要多蓋一層快取和搬運機制,幾乎是重寫一顆引擎,不是換個水管接頭而已。理解這種取捨,你才能判斷一個開源工具『不支援某平台』,到底是還沒做,還是根本不值得做。