🚨 AI-LECTURER 快訊速報|2026-09-03|5 分鐘速讀

🚨 你的 Mac 記憶體不夠跑大模型?有人靠「SSD 當外掛記憶體」硬是跑起來了

取材:Show HN: Running 104GB Qwen3.8-Flash-Next on 48GB Mac with at ~12 tok/s(Hacker News(AI 高人氣))|完整課同日跟進,見書架
📍 真實場景
在小型接案工作室做網頁與AI整合的自由工程師

案主要求用 AI 幫忙處理內部程式碼與文件,但合約明訂機密資料不能上傳到 OpenAI、Google 這類雲端 API

😖 卡住的地方:想在自己的 Mac 上本地跑大型模型,但一般做法需要 100GB 以上的記憶體,而你的 MacBook 只有 48GB,買一台記憶體更大的機器又是好幾萬元的額外支出
💡 讀完你會知道:記憶體不夠不代表模型跑不動,而且有免費工具能先幫你算出你的 Mac 到底能跑多快,再決定要不要花時間下載

⚡ 一句話講清楚

你可能聽過『大型語言模型』(LLM)這種能跟你對話、幫你寫程式的AI,但它們通常大到嚇人——這次的主角 Qwen3.8-Flash-Next,壓縮過後光是模型檔案就有 105 GB,超過一般筆電硬碟的四分之一空間。這種模型用的是 MoE 混合專家模型一種把模型拆成很多「小專家」模組的設計,每次只需要叫醒其中幾個專家來回答,不用整顆模型一次全部運轉 架構,理論上比較省資源,但傳統做法要把它整個塞進記憶體,還是得準備 100GB 以上——一般 Mac 頂多 48GB,直接硬跑會讓電腦瘋狂動用 虛擬記憶體(Swap)當實體記憶體不夠用時,電腦會拿硬碟空間暫代記憶體,但硬碟比記憶體慢很多,一旦大量使用就會嚴重卡頓,作者形容第一個字都還沒吐出來,電腦就已經灌爆 48GB 的替代空間了。

這位開發者的解法不是找更快的運算方法,而是重新設計「記憶體怎麼用」。他把模型切成兩部分:一小塊 3.8GB 的『主幹』常駐在記憶體裡隨時待命,其餘的『專家模組』平常放在 SSD電腦裡的固態硬碟,用來存放檔案,速度比記憶體慢很多,但比傳統硬碟快很多 上,要用到哪個專家才即時讀進一個固定大小的『記憶體車位池』,而且這個池子的大小會依照你的 Mac 實際還剩多少記憶體自動調整,其他 App 要用記憶體時還會主動讓出空間。整個工具是用蘋果自家的 MLX 引擎寫成一支 Swift 執行檔,不用另外裝 Python,而且完全相容 Ollama 和 OpenAI 的對話 API 格式,代表你原本用慣的工具介面可以直接接上去,不用重學。

代價也寫得很清楚:這招只能在蘋果自家晶片的 Mac 上用,因為它靠的是 統一記憶體(Unified Memory)蘋果晶片讓 CPU 和顯示晶片共用同一塊記憶體,不像一般獨立顯卡要把資料在兩塊記憶體之間搬來搬去 架構,資料才能不繞路直接讀給顯示晶片用;换成有獨立顯卡的 Windows 或 Linux 電腦,顯卡記憶體和主記憶體是分開的兩個水庫,同一套設計行不通,作者也明講這不在他的規劃內。速度方面,48GB 的 Mac 實測每秒只能吐出約 12 個字(tok/s),拿來聊天堪用,但要做正式開發或大量產生內容,還是偏慢。

🏃 快速上手三步(今天就能做)

1
先查清楚你的 Mac 夠不夠格點選左上角蘋果選單 →『關於這台 Mac』,確認兩件事:晶片是不是 M 系列(Apple Silicon,M1 以後都算),以及系統版本是不是 macOS 14 以上;再到『儲存空間』確認至少有 110GB 可用空間(模型檔案本身就要 105GB)。只要有一項不符合,這篇工具就用不了,可以直接跳過,不用往下試。
2
用 doctor 模式,先看報告再決定要不要下載打開『終端機』App,貼上 `curl -fsSL https://raw.githubusercontent.com/carloslfu/slotstream/main/install.sh | sh` 安裝好之後,先別急著抓 105GB 的模型檔,改成執行 `slotstream doctor`,它會印出你的 Mac 預估能跑多快(幾個字/秒)、記憶體與硬碟夠不夠;如果報告顯示速度低於 4 tok/s(相當於 8-16GB 記憶體等級的機器),代表這台機器用起來會很卡,可以先打消下載的念頭。
3
測試時關掉瀏覽器等吃記憶體的App作者實測發現,開著瀏覽器再跑模型,系統會判斷『可用記憶體變少』,自動把記憶體車位池縮小,連帶讓生成速度變慢;正式測試前,先關掉 Chrome、Zoom 這類長期占記憶體的軟體,才能量到接近文件裡 12 tok/s 這個等級的數字,判斷這台 Mac 到底夠不夠用在你的實際工作上。

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 為什麼作者堅持『這輩子不會做 Windows/Linux 版』,而不是想辦法擴大支援?
這是架構上的取捨,不是懶惰。蘋果晶片的 Mac 用統一記憶體設計,CPU 和顯示晶片共用同一塊記憶體,才能讓『SSD 直接讀進顯示晶片能用的記憶體』這招成立;换成一般顯卡型電腦,顯卡有自己獨立的一塊記憶體,和主記憶體之間隔著一條資料匯流排,要做到一樣的效果等於要多蓋一層快取和搬運機制,幾乎是重寫一顆引擎,不是換個水管接頭而已。理解這種取捨,你才能判斷一個開源工具『不支援某平台』,到底是還沒做,還是根本不值得做。
🔭 作者連失敗的實驗都寫進 MEASUREMENTS.md,這對你評估要不要用這個工具有什麼幫助?
大多數專案的 README 只秀最漂亮的那組數字,這篇文章反而把『哪些做法試了沒用』也攤開來,代表你可以真的照著他的方法重現這些效能數字,而不是被行銷式的 benchmark 唬住,這是判斷一個開源專案是否『紮實』的重要訊號。但同時也要看清楚:12 tok/s 只是『能動』的等級,拿來簡單問答還行,真的要用在你接案的正式開發流程裡,還得自己再測一輪才能下判斷。