手上只有公司配發的 64GB MacBook Pro,卻很想親自跑跑看網路上吵翻天的 2.78 兆參數模型 Kimi K3,而不是只看別人貼的評測截圖
現在的大型語言模型,能力常常跟 參數模型裡用來儲存「知識與判斷力」的數字,數量越多通常代表模型讀過的東西、抓得到的細節越多 數量成正比,而這次主角 Kimi K3 有 2.78 兆個參數,正常需要好幾台伺服器等級的機器、上兆位元組的記憶體才裝得下。但有工程師寫了一套叫 WASTE 的 推理引擎讓訓練好的 AI 模型實際「回答問題」的幕後程式,負責把你打的問題轉成模型看得懂的格式,再把算出的結果轉回文字,成功讓一台一般人買得到、64GB 記憶體的 MacBook Pro,也扛得動這隻參數巨獸。
關鍵在於 Kimi K3 是一種 專家混合模型(MoE)把一個大模型拆成很多個小的「專家」模組,每次回答問題只挑其中一小部分專家出來運算,不用整顆模型同時動起來 的架構,每次答題大概只會動用全部參數的 4%。WASTE 抓住這一點:把大家共用、每次都會用到的「主幹」留在記憶體裡,其餘用不到的「專家」平常乖乖待在硬碟上,真的被點名要用才臨時讀取,剩下的記憶體則拿來當 快取把最近用過、之後可能還會再用到的資料先暫存在讀取速度快的地方(這裡是記憶體),下次要用就不必再跑一趟硬碟,省下時間,於是不用把兩兆多個參數全部塞進記憶體才能開機。
結果代價很清楚:正確性沒問題(每一層的計算結果都拿 PyTorch 官方版本核對過,誤差小到 3.6e-06),但速度只有每秒 0.5 個 tokenAI 處理文字的最小單位,可能是一個字、半個詞或一個標點符號,「幾 token 幾秒」就代表它吐字的速度,問一句「義大利首都是哪裡」要等 26 秒。這篇文章真正有意思的地方不是「跑得快不快」,而是證明了「兆級模型能不能在一般人的電腦上跑」這件事,答案已經從「不可能」變成「可能,只是還要靠工程慢慢優化」。