正在幫客戶挑一個能跑在自己筆電上、不用一直付 API 費用的 AI 模型
這次的主角是一家叫 IFM這次發布模型的開發團隊/公司名稱 的 AI 實驗室,他們推出的模型家族正式名稱叫「K2 Horizon」。你可以把「IFM」想成廠商招牌,「K2 Horizon」則是這次上市的產品系列名,類似「某家車廠推出某款休旅車系列」的關係。K2 Horizon 底下一共有六款不同大小的模型,由小到大依序是:0.9B、3.7B、7B、32B、36B-A4B、375B-A23B(B 代表十億參數,數字愈大代表模型能力愈強,但也愈耗運算資源)。
其中 375B-A23B 和 36B-A4B 用的是 MoE 混合專家架構模型內部切成很多小專家,每次只喚醒其中一部分來處理,可以做到「模型總量很大但實際運算量不用等比例變大」,所以 375B-A23B 代表模型總共有 3750 億參數、但每次實際只動用 230 億參數;36B-A4B 則是總量 360 億、每次動用 40 億,還多用了一個叫 MoVA(Mixture-of-Value-Attention)的新設計來提升每一分參數的效能。最特別的是,IFM 這次不只釋出六款模型的最終權重,連訓練過程中的 checkpoint模型訓練到一半時存下的「進度存檔」,讓其他人可以從半路接手研究,不必從零開始重練、訓練資料(或資料製作方法)、程式碼與訓練紀錄都一併公開,尤其是「怎麼讓模型學會用工具、完成多步驟任務」這段過程,過去幾乎沒有團隊公開過。
授權方面,模型與程式碼採 Apache 2.0一種寬鬆的開源授權,允許商用、修改、再散布,幾乎沒有限制 授權,資料則依各自來源標示授權,對開發者來說幾乎是「能拿就能用」的等級。