AI-LECTURER 速報課|2026-09-04|約 26 分鐘

IFM一次開源六顆模型:從手錶到企業伺服器,連怎麼練出來的都公開

取材:K2 Horizon: A connected fleet of six open models(Hacker News(AI 高人氣))
📍 真實場景
阿凱,一人接案的App後端工程師,平常幫小型店家做客服機器人

正在幫一家連鎖手搖飲品牌評估,要把AI客服功能直接做進他們的點餐App裡

😖 卡住的地方:串了雲端大廠的AI API之後,發現尖峰時段(下午茶時間)請求量一多,延遲跟費用都跟著暴衝,老闆一直問「能不能把AI直接裝進App裡,不要每次都連網問」,但阿凱查過的開源模型不是效能太弱、就是授權條款寫得模糊,不敢貿然拿去商用
💡 這堂課會帶阿凱看懂「一次發布六款不同大小、且完整公開訓練細節」的模型代表什麼意義,學會用工程師的角度判斷哪一款尺寸適合塞進App、授權能不能放心商用

🧭 這到底是什麼(白話版)

這則新聞在講的是:一家叫IFM的公司,一口氣發布了六款開源模型把模型的「權重」和訓練方法公開,任何人都能下載、研究、甚至商用的AI模型,跟只能透過API租用的雲端模型不一樣,取名叫K2 Horizon。重點不是「又一顆新模型」,而是這六顆從可以塞進手錶等級的裝置、到企業級伺服器都有對應的尺寸,官方稱它們是一個「連動的家族(connected fleet)」。

更特別的是「開源」的徹底程度。一般開源模型通常只給你最終的權重AI模型訓練完之後,內部所有參數的數值集合,可以想成是模型的「大腦記憶內容」,下載了它就等於下載了整個模型的能力,但這次IFM連訓練過程中定期存下的checkpoint訓練過程中每隔一段時間存下的模型「進度存檔」,讓人可以回頭看模型是怎麼一步步學會現在的能力的、訓練資料(或資料是怎麼建構出來的做法)、訓練程式碼、設定檔跟細部日誌都一併公開,這種「開放到骨子裡」的程度在AI圈很少見。

六顆模型的名字裡藏著工程細節,例如「36B-A4B」「375B-A23B」這種寫法:前面的數字是模型的總容量,「A」後面的數字則是模型實際運算時真正用到的參數量,這跟一種叫Mixture-of-Experts(MoE)一種模型設計方式,模型內部拆成很多小塊「專家」,每次回答問題只挑其中幾塊來運算,不用整個模型全開,藉此省下算力的做法有關——K2 Horizon還用了自家研發、叫MoVA的新版本。這樣設計的好處是:模型可以存很多知識(總容量大),但實際回答問題時只動用一小部分(啟用參數少),跑起來更省資源。

最後是授權:模型跟程式碼用的是Apache 2.0授權一種開源授權條款,允許任何人自由使用、修改、甚至拿去做商業產品,幾乎是對開發者最友善的授權之一,這代表像阿凱這樣的工程師,理論上可以直接把模型放進自己的商業App裡而不用另外付費授權金——但資料集本身用的是各自的授權(例如ODC-BY),所以「模型能商用」跟「資料能直接拿來重新散布」是兩件要分開看的事。

🎯 為什麼值得你花時間

不用外包AI大腦,你的App也能自己跑像阿凱這種要在App裡做客服機器人的人,最痛的就是雲端API的延遲跟費用會隨著用量暴衝。這次K2 Horizon特別做了0.9B、3.7B、7B這種可以塞進手機、甚至手錶的小尺寸,代表「把AI直接裝進裝置裡、不用每次都連網問」這件事,門檻正在快速降低。
開放不是嘴巴講講,是連怎麼練出來的都給你看多數公司說「開源」,通常只給你權重,讓你「知其然不知其所以然」。這次連checkpoint、訓練資料建構方式、訓練log都公開,代表任何人都能研究「這個模型是怎麼學會用工具、學會規劃步驟的」,甚至照著這套方法在自己的資料上重現一遍,這對想深入理解AI、而不只是呼叫API的人來說是很大的差別。
一個家族六顆模型,代表AI基礎設施的選擇題變多了以前選開源模型常常是「將就」——效能夠但太肥塞不進裝置,或是輕量但太笨。K2 Horizon把「同一套架構、同一套訓練方法」複製到六種尺寸上,等於是把「從邊緣裝置到企業伺服器」這條光譜上的每一格都補上了選項,工程師可以照著實際場景(手機、工作站、雲端)挑對應的那一顆,而不是遷就手上僅有的選擇。

⚙️ 它是怎麼運作的

1
先練出基礎能力(pretraining)六顆模型一開始都會先讀過大量文字資料,學會基本的語言能力、常識跟邏輯,這是每一顆模型共通的「打底」階段,也是六顆模型之所以能共用同一套架構跟字彙表的原因。
2
教它想得更深(推理post-training(後訓練)模型「打好底子」(預訓練)之後,再針對特定能力(像是推理、用工具)做加強訓練的階段打底之後,模型會針對數學、程式、邏輯推理這類需要「一步步想」的能力做加強訓練,這也是為什麼文章特別強調六顆模型在推理、數學、coding上都拿到同尺寸的最佳成績之一。
3
教它會自己動手做事(agentic(代理式)不是只回答一個問題就結束,而是能自己規劃步驟、呼叫工具、一步步完成一個複雜任務的AI行為模式後訓練)這是這次release最特別的一步:IFM把「教模型學會規劃、呼叫工具、完成多步驟任務」這整個過程也完整公開,讓外部研究者第一次能完整看到一個開源模型家族是怎麼「學會當代理人」的。
4
把體型縮小塞進不同裝置(量化(quantization)把模型內部數字用更少的位元儲存與計算,讓模型檔案變小、跑起來更省資源,但精準度會打一點折扣六顆模型全部支援量化,代表就算是32B、36B-A4B這種偏大的尺寸,也能透過量化壓縮後塞進工作站甚至更輕量的裝置跑起來,犧牲一點點精準度換取「跑得動」。
5
全部公開,讓別人也能重現整個過程最後一步不是技術步驟,而是決策:把上面每一階段用到的checkpoint、資料(或資料建構方式)、程式碼、設定、log全部釋出,讓外部研究者能重現、能拿去改造成自己的工具與場景,而不只是「拿現成的模型來用」。
六款模型分別適合塞進哪裡(依文章描述整理)
模型規格類型官方定位適合裝置
0.9B密集(全部參數啟用)極限輕量、同尺寸最強手錶、智慧眼鏡等極限受限環境
3.7B密集(全部參數啟用)同尺寸最強手機等隨身裝置
7B密集(全部參數啟用)同尺寸最強手機、裝置端進階應用
32B密集(全部參數啟用)頂尖水準之一本機工作站
36B-A4B稀疏(總36B、啟用約4B,MoVA機制)每啟用參數效能突出,贏過更大模型本機工作站、高效伺服
375B-A23B稀疏(總375B、啟用約23B)家族最強旗艦企業級雲端部署

🤔 這則沒有適合的實作——改用三個問題帶你想深

  1. 如果你是阿凱,要幫連鎖手搖飲的App選一款模型塞進客服功能,你會怎麼在「效能、裝置限制、授權風險」之間做取捨?六款模型裡,哪一款規格最貼近你的情境?為什麼不是選文章裡效能最強的那一顆?
  2. IFM選擇把「訓練資料的建構方式」也公開,而不是只給權重就好。如果你是IFM的競爭對手,這份公開資訊對你來說是機會還是威脅?換個角度想,如果你是IFM,為什麼願意冒著方法被抄走的風險,也要公開到這種程度?
  3. 36B-A4B這款模型用MoVA機制,做到「啟用參數只有約4B、卻打贏更大的模型」。如果之後你要幫不懂技術的老闆選AI模型,你會怎麼用一句話解釋「參數量大不代表比較厲害」,並說服他去看「啟用參數」而不是只看模型名稱裡最大的那個數字?

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 為什麼不是發一顆「最強模型」衝聲量,而是硬要湊齊六顆各種尺寸?
從工程與商業角度看,這是在覆蓋「部署場景光譜」——手錶、手機、工作站、企業伺服器的限制條件(記憶體、延遲、成本)完全不同,一顆模型不可能同時滿足所有場景。六顆模型共用同一套架構、字彙表、訓練方法,代表IFM是先把「一套可複製的訓練配方」做出來,再用它批次產出不同尺寸——這樣邊際成本遠低於分別從零開發六款模型,也讓使用者不用因為場景不同就得換供應商。
🔭 把checkpoint、訓練資料建構方式、訓練log全部公開,對IFM商業上到底圖什麼?
公開到這個程度看似「佛心」,但也是一種生態位卡位策略:開發者跟研究者會基於這套完整可重現的方法去微調、寫論文、回報問題、甚至幫忙優化,等於用開放換取免費的社群研發力跟人才漏斗;同時「別人能重現你的方法」本身就是一種技術實力的展示,比單純的benchmark分數更有說服力。開放跟商業利益不是對立的,而是IFM選擇的一種擴大影響力的路徑。
🔭 MoVA讓36B-A4B「啟用參數只有約4B卻打贏更大模型」,這個設計在權衡什麼?
這類稀疏設計的核心權衡是「總容量」跟「單次運算成本」分開計算:模型可以把知識存在很大的總參數量裡(36B),但每次實際回答問題時只動用一小部分(約4B),推理成本因此大幅降低。代價是工程複雜度變高——要設計好「怎麼決定該啟用哪些參數」的路由機制,還要避免某些參數被過度使用、某些又幾乎沒被訓練到,這正是MoVA要解決的問題,不是天下沒有白吃的午餐。
🔭 模型跟程式碼用Apache 2.0,但資料集卻是「各自的授權」,這個切割代表什麼考量?
模型權重跟訓練程式碼是IFM自己產出的東西,可以自己決定用最寬鬆的Apache 2.0授權出去;但訓練資料往往部分來自第三方網路內容,本身可能就帶有各自的授權限制,IFM沒有權利用同一個授權把它們全部重新包裝散布出去。所以文章才會特別提到「資料集用各自適用的授權,若不能重新散布就揭露資料是怎麼建構的」——這是在「盡量開放透明」跟「不踩到別人智慧財產權的法律紅線」之間找到的務實折衷。

📝 隨堂考(點選答案,立即回饋)

Q1. K2 Horizon這次總共釋出了幾款不同大小的模型?
✅ 文章開頭就寫明是六款模型:375B-A23B、36B-A4B、32B、7B、3.7B、0.9B。
Q2. 模型命名裡的「36B-A4B」,其中「A4B」代表什麼意思?
✅ 「A」代表Active(啟用)參數,指模型實際回答問題時真正動用的參數量,跟模型的總容量(前面的36B)是兩回事,這正是稀疏模型設計的關鍵。
Q3. 根據文章,IFM在這次release裡,除了模型權重之外,還額外公開了哪些東西?
✅ 文章明確列出:intermediate checkpoints、training data或data-construction recipes、架構、mixture組成、訓練程式碼、設定、細部log、評測結果跟最終權重全部公開。
Q4. 根據文章,0.9B這款最小的模型主要設計來塞進什麼裝置?
✅ 文章寫道0.9B模型是「designed for highly constrained environments such as watches and glasses」,是專門為極限受限裝置設計的。
Q5. 文章中「connected fleet(一個連動的家族)」這個說法,主要在強調六款模型之間有什麼共通點?
✅ 文章提到六款模型「share core architecture, vocabulary, training methodology, interfaces, evaluation infrastructure, and deployment tooling」,這種一致性讓在不同尺寸之間切換、動態分派工作變得更容易。

🃏 翻牌記憶卡(先想答案,再點開對答)

開源模型點我翻面
把模型的權重、甚至訓練方法都公開,任何人都能下載研究或商用的AI模型,跟只能租用的雲端AI不同
checkpoint(訓練存檔)點我翻面
訓練過程中定期存下的模型進度存檔,讓人能回溯模型是怎麼一步步學會現在的能力的
MoVA(Mixture-of-Value-Attention)點我翻面
K2 Horizon自研的新注意力機制,讓像36B-A4B這種模型能用較少的啟用參數,打出接近更大模型的效能
A23B / A4B 的「A」點我翻面
Active(啟用)參數的縮寫,代表模型實際運算時真正用到的參數量,不是模型的總容量
agentic後訓練點我翻面
在基礎訓練完成後,額外訓練模型自己規劃步驟、呼叫工具、完成多步驟任務的能力
量化(quantization)點我翻面
把模型內部數字用更精簡的方式儲存與計算,讓模型檔案變小、更省資源,方便塞進手機等裝置

✅ 離開前自測(全勾=這課真的學會了)

0%