AI-LECTURER 速報課|2026-08-03|約 28 分鐘

模型胖到一張顯卡塞不下:AMD顯卡怎麼靠「划算」打贏輝達旗艦卡

📍 真實場景
阿凱,一家新創公司的AI基礎設施工程師,平常負責維護客服機器人背後的大型語言模型伺服器

老闆剛開完會,丟給他一個任務:新一代開源模型的智慧程度已經逼近付費API,如果能自己架設,公司一年能省下大筆的API費用;但這個模型大到現有的GPU伺服器根本塞不下,得重新採購硬體

😖 卡住的地方:面對NVIDIA跟AMD兩份報價單,規格表上滿滿是TP16、KV cache、all-reduce這些生字,他分不清「跑得快」跟「划算」根本是兩回事,深怕選錯方案讓公司多燒好幾十萬的顯卡預算
💡 這堂課會教他怎麼看穿「跑得快」和「划算」的差別,學會用「每一塊美金能換到多少效能」的思維,破解顯卡採購裡的行銷話術陷阱

🧭 這到底是什麼(白話版)

最近幾個月,開源AI模型的實力嚇死人。像GLM5.2、DeepSeek V4-Pro這些公開釋出、任何人都能下載來自己架設的開源模型跟需要花錢呼叫官方API、看不到內部細節的「閉源模型」相反,開源模型的參數會整包公開,你可以下載到自己的機器上執行,已經逼近頂級付費模型的聰明程度。而這篇文章的主角Kimi K3,更是被形容為有機會摸到最頂級商用模型的水準。但問題來了:模型要變聰明,通常代表它要記住的參數(parameters)模型裡負責記住規律的一堆數字旋鈕,你可以想成是模型的「腦細胞數量」,參數越多通常學到的東西越細緻,但也越佔位置越多——Kimi K3的參數量高達2.8兆(2.8T),換算下來光是把這些參數塞進顯示卡,就需要超過1.5TB的VRAM顯示卡專門用來放模型參數跟運算暫存資料的記憶體,俗稱顯存,VRAM不夠大,模型根本裝不進這張卡,這還沒把服務長文章對話所需的KV cache模型在處理很長一段文字時,把已經算過的中間計算結果先存起來、之後重複利用的暫存區,可以想成是「先算好的筆記」,省得每次從頭算一遍算進去。

這麼胖的模型,連NVIDIA最新的B200顯示卡,一個節點塞8張卡都裝不下——只好用Tensor Parallelism(張量平行,簡稱TP)當一個模型太大、一張顯示卡裝不下時,把模型內部的運算拆成好幾份,分給多張顯示卡一起分工計算的技術,TP16就是把工作切成16份,讓16張卡一起扛這招,把運算拆給更多顯示卡一起扛。這時候擺在工程團隊面前的選擇只剩兩條路:要嘛硬上規格更高、單卡288GB顯存的NVIDIA B300,一個節點8卡就夠;要嘛動用兩個B200節點(TP16跨16張卡)一起分攤。而這篇文章要介紹的第三條路,是AMD的MI355X——它同樣有288GB顯存,價格卻比B300便宜約2.4倍、比B200便宜約1.7倍。過去AMD最讓人詬病的是軟體支援跟不上,跑推論(inference)模型訓練完成後,拿來實際回答問題、生成內容,正式上場運作的階段,跟訓練(教會模型)是不同的兩件事效率所需要的底層優化工程量很大,但這次AMD在Kimi K3發布當天就把優化做好(業界稱為day-0支援),等於幫工程團隊省下一大段苦工。

實測結果很有意思:B300單節點的吞吐量(throughput)單位時間內能處理完成的資料量,這裡指每秒能吐出幾個字(tok/s),吞吐量越高代表機器越能同時應付更多人使用確實是三者中最快的,但因為它的租金也最貴,算成「每花一塊美金能換到多少tok/s」(也就是每美元效能)之後,反而是MI355X奪冠。至於花了兩個節點硬撐的B200,因為要透過網路做跨節點的all-reduce多張顯示卡分頭算完各自負責的部分後,要互相對答案、把結果同步成一致版本的通訊動作,節點跨得越多,對答案的來回次數跟等待時間就越長,會拖慢速度,表現反而是三者中最吃虧的一個。

🎯 為什麼值得你花時間

開源模型正在追上,但代價是模型體積失控開源模型(GLM5.2、DeepSeek V4-Pro、Kimi K3)已經逼近頂級閉源模型的智慧程度,但為了塞進這麼多知識,參數量暴增到連旗艦GPU伺服器都裝不下,這代表以後「養得起模型」本身就是一道門檻。
顯示卡的比賽,重點正從「算得快」轉向「裝得下」過去挑GPU看算力,現在Kimi K3這類巨獸級模型讓VRAM容量變成第一關卡,連NVIDIA自家B200都因為裝不下而要跨兩個節點運作,反而拖慢整體效能。
划算(perf/dollar)比跑得快更決定誰能活下來B300單節點吞吐量最高,但貴了2.4倍,算下來MI355X的每美元效能反而接近B300的1.5倍;對要長期營運AI服務的公司來說,這種「效能除以成本」的思維才是能不能賺錢的關鍵。

⚙️ 它是怎麼運作的

1
開源模型越來越聰明,但也越來越「胖」GLM5.2有753B參數、DeepSeek V4-Pro有1.6T、Kimi K3則衝到2.8T——參數量暴增的速度,跟模型變聰明的速度一樣快。
2
一張顯示卡裝不下,只好「拆帳」給好幾張卡一起扛2.8T參數加上服務長對話所需的KV cache,換算下來超過1.5TB顯存,遠超單張顯示卡的容量,只能靠張量平行(TP)把運算拆給多張卡。
3
只剩兩條路:多租一個B200節點,或換張顯卡連8卡一節點的B200(TP16)都塞不下Kimi K3,只能選擇動用兩個B200節點一起分攤,或是換成單卡288GB顯存、一節點8卡就夠的B300。
4
半路殺出AMD MI355X:一樣288GB顯存,價格砍到骨折MI355X同樣有288GB顯存,卻比B300便宜約2.4倍、比B200便宜約1.7倍,過去AMD最大的痛點是軟體支援跟kernel優化較弱。
5
AMD直接Day-0支援Kimi K3,工程團隊少走一大段冤枉路AMD在模型發布當天就把底層推論優化做好,Wafer團隊等於白撿了原本要自己動手做的苦工。
6
實測結果:B300最快,但MI355X最划算MI355X整節點達952 tok/s、單串流118 tok/s,是B200(跨節點TP16)整節點吞吐量的3.8倍、單串流的1.3倍;B300整節點雖仍領先MI355X約1.65倍,但貴了2.4倍,換算每美元效能後MI355X完勝。
三種方案實測結果(價格假設:MI355X $2.50、B200 $4.25、B300 $6.00,皆為每GPU每小時)
方案單串流解碼(tok/s)整節點吞吐量尖峰(tok/s)每GPU吞吐量尖峰(tok/s)每美元效能尖峰(tok/s/$)
8×AMD MI355X(TP8)11895211948
2×8 NVIDIA B200(TP16,跨2節點)90498317
NVIDIA B300(TP8+DCP8)172156819633

🔍 程式碼漫遊(點有 ● 的行看白話講解)

這段小程式重現文章表格裡「每美元效能」是怎麼算出來的——用吞吐量除以總花費,就知道誰的錢花得划算。

def calc_perf_per_dollar(node_throughput, price_per_gpu_hour, gpus_per_node):
💬 定義一個函式:輸入「整節點吞吐量」「每張GPU每小時租金」「節點裡有幾張GPU」
total_cost_per_hour = price_per_gpu_hour * gpus_per_node
💬 先算出這個節點「整組」每小時要花多少錢,不是只算一張卡——這是B200吃虧的關鍵,因為它要算16張卡的錢
return round(node_throughput / total_cost_per_hour, 1)
💬 重點行:吞吐量除以總花費,就是「每花一塊美金換到多少tok/s」,這正是文章表格最後一欄的算法
configs = {
💬 把文章表格的三種方案,包成一個字典,方便待會兒一次全部算過一遍
"MI355X (TP8)": (952, 2.50, 8),
💬 MI355X:整節點952 tok/s、每GPU-hr租金2.5美元、8張卡一節點
"B200 x2節點 (TP16)": (498, 4.25, 16),
💬 B200:因為裝不下模型,用兩個節點共16張卡撐起來,租金要用16張卡去算
"B300 (TP8+DCP8)": (1568, 6.00, 8),
💬 B300:整節點吞吐量最高,但每GPU-hr租金也最貴
}
for name, (tput, price, gpus) in configs.items():
💬 把三種方案一個一個拿出來算
print(name, calc_perf_per_dollar(tput, price, gpus))
💬 重點行:印出每個方案的「每美元效能」,算出來大約是MI355X 47.6、B300 32.7、B200 7.3,跟文章表格四捨五入後的48、33、7對得上

🛠️ 動手做:GPU 採購划算度試算機

  1. 先看預設數字(就是文章裡的實測值),猜猜看哪個方案「每美元效能」最高
  2. 把B300的租金改成跟MI355X一樣的$2.50,看看排名會不會變
  3. 把MI355X的整節點吞吐量降到跟B200一樣的498,感受「吞吐量」跟「划算度」是兩件不同的事
  4. 試著調整B200的租金,看要降到多少,它才能追上MI355X的划算度
👇 下面是活的,直接操作

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 為什麼兩個B200節點(TP16)的整體表現,反而比不上一個MI355X節點?
因為Kimi K3塞不進單一8卡B200節點,只好把運算拆給兩個節點一起做,但兩節點之間要靠網路(RoCE v2,約195Gb/s)做all-reduce同步答案,這個「跨節點對答案」的通訊延遲,直接卡在解碼的關鍵路徑上,等於是「多請了幫手,卻要花更多時間開會對稿」,資源沒有省到,協調成本反而先吃掉一部分產能。這給工程師的啟示是:規劃硬體架構時,「能不能塞進單一節點」本身就是一個效能指標,不是只看理論算力。
🔭 AMD顯示卡過去被吐槽軟體支援差,為什麼這次能day-0支援新模型?
過去AMD弱的不是硬體規格(288GB顯存其實跟B300打平),而是把模型「跑起來」需要的底層kernel優化跟推論框架工程投入不足。文章點出重點:現在AI agent已經能協助做kernel和模型優化,把過去需要一整個團隊手工調校好幾個月的工作大幅壓縮,才讓AMD能在模型發布當下就跟上腳步。對工程師的啟示是:選擇平台時,「軟體生態的追趕速度」正在變成一個可以被AI加速的變數,不再是一成不變的硬傷。
🔭 文章特別強調「每美元效能」而不是「最高吞吐量」,這反映了什麼採購邏輯?
如果只看跑得快,B300以1,568 tok/s整節點吞吐量遙遙領先;但它的每GPU-hr要價6美元,是MI355X的2.4倍。算成「每花一塊美金能換到多少tok/s」後,B300反而輸給MI355X。這提醒工程師:基礎設施採購的終極問題不是「哪個最強」,而是「在我的預算下,哪個能撐住最多用戶」,尤其當服務要長期、大量運行時,規模效應會把單位成本的差距放大成巨大的總支出差距。

📝 隨堂考(點選答案,立即回饋)

Q1. Kimi K3有2.8T(兆)個參數,這代表什麼?
✅ 文章提到GLM5.2是753B、DeepSeek V4-Pro是1.6T,Kimi K3的2.8T參數量是三者中最大的,連旗艦GPU伺服器都裝不下。
Q2. 為什麼連效能最強的NVIDIA B200,8卡一節點都裝不下Kimi K3?
✅ 文章明講2.8T參數就超過1.5TB VRAM,再加上要跑1M token的KV cache,連一個8張B200(每張192GB)的節點都塞不下。
Q3. 文章中「每美元效能(perf/dollar)」最高的方案是?
✅ 表格顯示MI355X每美元效能是48 tok/s/$,遠高於B300的33和B200的7,雖然B300整節點吞吐量最高,但算上價格後MI355X最划算。
Q4. 為什麼B200這組數字被文章形容為「有點吃虧」?
✅ 文章特別註明B200是唯一跨兩節點(2×8)的組合,解碼過程中要透過RoCE v2網路做跨節點的all-reduce同步,這個通訊開銷會壓低它的實際吞吐量表現。

🃏 翻牌記憶卡(先想答案,再點開對答)

VRAM點我翻面
顯示卡上專門存放模型參數與暫存資料的記憶體,VRAM不夠大,模型就裝不進這張卡。
Tensor Parallelism(張量平行,TP)點我翻面
把一個大模型的計算拆成好幾份,分給多張顯示卡一起扛,例如TP16就是16張卡一起分工。
KV cache點我翻面
模型處理長文章時,把已經算過的中間結果存起來重複利用的暫存區,可以省下重複計算的時間,但也會佔用大量VRAM。
perf/dollar(每美元效能)點我翻面
用「吞吐量 ÷ 花費」算出來的划算程度指標,比較的是「花同樣的錢誰能做更多事」,不是單純比誰跑得快。
all-reduce點我翻面
多張顯示卡分頭算完後互相同步答案的通訊動作,跨節點時要走網路,會拖慢速度。

✅ 離開前自測(全勾=這課真的學會了)

0%