📍 真實場景
陳威廷,做垂直產業客服機器人的新創技術主管
他正在幫8人新創團隊挑選要自架的開源模型原始碼與模型權重公開,任何人都能下載、修改、甚至商用的AI模型,跟只能透過付費API呼叫的封閉模型相對,準備把它裝進客服系統當作核心引擎
😖 卡住的地方:他打開Hugging Face的模型清單,發現中國實驗室(如Moonshot、MiniMax)一出手就是七千多億到兩兆多參數AI模型內部用來儲存學到的知識與規律的數值,數量越多通常代表模型能記住、處理的東西越複雜,但也越吃硬體資源的怪物模型,美國實驗室(除了NVIDIA、Thinking Machines Lab少數例外)大多還停留在千億參數以下;他完全看不懂這個尺寸落差代表什麼,更不知道該選哪一家的模型才不會踩坑
💡 這堂課會告訴他,模型尺寸的落差其實是兩種完全不同的商業算盤——看懂這盤算盤,他才能判斷『這家實驗室的模型系列,三個月後還會不會有人維護、能不能長期依賴』,而不是只看排行榜分數選型
🧭 這到底是什麼(白話版)
先看整個場子有多大。Hugging Face平台上的模型倉庫存放一個AI模型檔案與說明文件的資料夾單位,每上傳一個模型通常就會產生一個倉庫這段期間從243萬長到296萬,資料集從71萬1千長到100萬,展示應用(Spaces)也從100萬長到144萬。但數字大不代表『大家都在用』——文章的統計顯示,85.6%的模型倉庫終身下載數不到200次,而僅僅1.5%的倉庫,就拿走了全站99.2%的下載量。換句話說,絕大多數掛在Hugging Face上的模型,其實只是實驗性質的練習作,真正被開發者拿去用的,永遠只是金字塔頂端那一小撮。
在這個極端集中的場子裡,2026年出現了一個明顯的路徑分裂。以前的慣例是:實驗室先發布小模型練兵、累積口碑,再一步步做大,像是升級打怪一樣。但2026年,好幾家中國實驗室直接跳過這個階段——幾乎每個月,中國實驗室發布的最大、表現最好的開源模型,規模都超過美國實驗室自己發布過的任何東西。中國那一側的月度天花板落在7540億到2兆7800億參數AI模型內部用來儲存學到的知識與規律的數值,數量越多通常代表模型能記住、處理的東西越複雜,也越吃硬體資源與電力之間;美國那一側,七個月裡有五個月的天花板停在1300億以下,例外只有NVIDIA在5、6月推出的Nemotron 3 Ultra(5610億)和Thinking Machines Lab的Inkling。
這個現象背後,有兩件事讓『中國實驗室直接出巨獸模型』這條路走得通。第一,做大模型本身已經不再是差異化的招牌了——小米和美團今年都跨過了兆級參數的門檻,但這兩家一年前在開源模型圈根本沒沒無聞,證明『做得出大模型』已經不稀奇。第二,實驗室不再需要自己發小模型才能被一般開發者碰到,因為社群會自己動手,用量化把模型內部數值的精度降低(例如從32位元壓到4位元),讓模型檔案體積大幅縮小、能塞進一般顯卡甚至筆電運算的壓縮技術這套技術,在幾天內把一個大模型『瘦身』成能在自家設備上跑的版本。換句話說,『親民』這件事被外包給社群了,實驗室可以專心衝規模紀錄。
這也讓『模型尺寸的分佈』變成一種策略宣言,而不是能力證明。像Moonshot、MiniMax、小米、Z.ai這類幾乎不發70B以下版本的玩家,走的是純尖端策略(Frontier-only)只押注在最大、最強的旗艦模型,靠跑分排名和企業API需求賺錢,不特別在意一般開發者能不能直接在自己電腦上跑起來的產品策略——賭注全押在排行榜位置與API訂單。騰訊和阿里Qwen則反過來,從不到10億參數到兆級參數通吃,走的是全譜系策略(Full-spectrum)從小到大各種尺寸的模型都發布,目標是成為開發者長期依賴、優先選用的那個模型家族的產品策略——目標是成為開發者長期標配的那個家族。兩條路都合理,只是在爭奪不同的獎盃。
🎯 為什麼值得你花時間
尺寸落差,其實是兩種不同的生意純尖端策略押的是跑分(Benchmark)業界用來衡量AI模型表現好壞的標準化測試分數,常被拿來當作模型排名的依據排名和API訂單,全譜系策略押的是開發者的長期黏著度。看懂這個差異,你才不會誤把『模型很大』直接等同於『這家比較強、比較適合我』。
美國沒有缺席,只是換了主角今年發布最多開源模型倉庫的兩個組織,是做晶片的NVIDIA和AMD,各自超過200個倉庫,遠遠拋開其他對手,LiquidAI以大約100個排第三。這代表美國在開源模型生態的存在感,重心已經從傳統AI實驗室,悄悄轉移到賣硬體的公司身上——免費放出模型,是證明『我的晶片真的能扛AI』最直接的廣告。
下載集中度告訴你戰場在哪裡85.6%的模型倉庫下載數不到200次,1.5%的倉庫卻拿走99.2%的下載量。這代表你在挑選開源模型時,真正該看的不是『排行榜上出現了多少新模型』,而是那極少數真正被大量下載、被社群持續維護的模型——那裡才是真正的戰場。
🧠 工程思維透鏡(資深工程師看到的是什麼)
🔭 為什麼中國實驗室敢直接跳過小模型階段,不怕沒人用嗎?
量化技術讓社群自己就能做出『瘦身版』,實驗室等於把『讓模型變得可親近』這件事外包給生態系,自己專心衝規模紀錄。這是一種『把非核心工作外包給社群』的工程判斷,跟開源軟體世界『我只維護核心,外掛讓社群做』的邏輯完全一致——資深工程師會看到的,是資源分配的取捨,而不是技術能力的高低。
🔭 NVIDIA、AMD衝進開源模型排行榜前幾名,對整個生態系是好事嗎?
硬體商發模型的成本結構跟AI實驗室完全不同——他們不靠模型本身賺錢,模型是晶片的『活廣告』,所以可以不計成本地衝數量、衝多樣性。這會讓開源排行榜的『數量』失真,工程師選型時要分辨『這家是靠模型賺錢還是靠模型賣別的東西』,兩種動機會直接影響這個模型系列未來會不會被長期維護。
🔭 全譜系 vs 純尖端,兩種策略哪個對『長期維護』比較有保障?
全譜系玩家(涵蓋各尺寸)通常代表更成熟的產品線思維,對開發者生態系統的長期投資意圖較高;純尖端玩家的資源可能更集中在追逐最新的跑分成績,一旦有更亮眼的新模型出現,舊版本被放棄的風險較高。工程師選型時,該把『這家過去是否穩定地在各尺寸都持續更新』當成一個可靠度訊號,而不是只看單一版本的跑分。
📝 隨堂考(點選答案,立即回饋)
Q1. 根據文章,2026年中國實驗室發布的最大開源模型參數量級,落在哪個範圍?
✅ 文章提到中國那一側的月度天花板落在7540億到2兆7800億參數之間,遠超美國同期的上限。
Q2. 文章提到,是什麼技術讓實驗室不用自己出小模型,也能讓更多人用到大模型?
✅ 文章指出,量化技術能讓社群在幾天內把大模型壓縮成一般設備能跑的版本,實驗室因此不必自己出小模型。
Q3. 2026年美國發布最多新開源模型倉庫的兩個組織是誰?
✅ 文章指出今年發布最多新開源模型倉庫的兩個組織是做晶片的NVIDIA和AMD,各自超過200個倉庫,LiquidAI以約100個排第三。
Q4. 文章統計顯示,Hugging Face上多少比例的模型倉庫,終身下載數不到200次?
✅ 文章統計顯示85.6%的模型倉庫終身下載數不到200次,只有1.5%的倉庫拿走了99.2%的下載量。
Q5. 文中把『幾乎不發70B以下模型』的實驗室(如Moonshot、MiniMax)歸類為哪一種策略?
✅ 文章把Moonshot、MiniMax、小米、Z.ai這種幾乎不發70B以下模型的玩家,歸類為賭注全押在跑分與API需求的純尖端型(Frontier-only)策略。