🚨 AI-LECTURER 快訊速報|2026-08-03|5 分鐘速讀

🚨 開源模型大到塞不下NVIDIA顯卡,AMD靠「性價比」殺出一條路

取材:Running Kimi K3 on MI355X at Better Performance per Dollar Than B300(Hacker News(AI 高人氣))|完整課同日跟進,見書架
📍 真實場景
剛入職新創的資訊工程師阿凱

老闆說想把客服機器人換成最新的開源AI模型,要阿凱去查該租哪種GPU伺服器比較划算

😖 卡住的地方:阿凱只聽過NVIDIA顯卡,不知道原來還有AMD的選項,更不知道「同樣預算能換到更多運算量」這件事該怎麼判斷、怎麼查證
💡 讀完這篇,你就能看懂雲端GPU報價單上那些型號代表什麼,並學會用「每一塊錢能換多少運算量」來判斷划不划算

⚡ 一句話講清楚

開源AI模型最近進步飛快,像這次主角Kimi K3的參數(parameters)AI模型裡負責「記住知識」的數字有多少個,數字越多通常代表模型越聰明,但也越占儲存空間量高達2.8兆(2.8T),比之前的GLM5.2(7530億)、DeepSeek V4-Pro(1.6兆)都大上一截。模型越聰明,代價就是「胖到裝不下」——文章作者實測後發現,光是把Kimi K3的模型本體塞進顯卡,就要超過1.5TB的VRAM(顯卡記憶體)顯示卡上專門用來暫存模型和運算資料的記憶體,模型太大就得靠好幾張顯卡的VRAM加起來裝,連NVIDIA最頂級的B200伺服器(8張顯卡)都裝不下,還沒算上要留給對話記錄用的KV cacheAI模型生成文字時用來暫存「已經算過的資訊」的記憶區塊,可以加快下一個字的生成速度,對話越長占用越多

面對這個「裝不下」的難題,作者測試了幾種方案:用NVIDIA最新的B300伺服器硬扛、把兩台B200伺服器接起來合力跑(這種把超大模型拆成好幾份、分別放到不同顯卡上同時計算的技術叫TP(張量平行)Tensor Parallelism,把一個超大模型拆成好幾份,分別放到不同顯卡上同時計算的技術),或是改用AMD的MI355X——它剛好也有288GB的VRAM,單張就能跟B300打對台。結果很意外:MI355X的推論(inference)把訓練好的AI模型拿來實際回答問題、生成內容的過程,跟「訓練模型」是不同階段,速度快慢直接影響服務品質和成本速度,整台伺服器加總起來可以跑到952個token(可以想成「字」)每秒,比兩台B200接起來的498還快將近一倍,只比B300慢一截。

但重點是價格——MI355X平均每張比B300便宜約2.4倍。算下來,MI355X的「每花一塊錢能換到多少運算量」是每美元每小時48 tok/s,B300只有33,B200更只有7。也就是說,雖然B300絕對速度最快,但AMD這次靠著超大顯卡記憶體加上更親民的價格,在「性價比」這個戰場上打了一場漂亮的勝仗——而這正是為什麼像Kimi K3這種巨無霸開源模型,反而可能成為AMD打進AI伺服器市場的突破口。

🏃 快速上手三步(今天就能做)

1
查你現在用的AI服務背後撐得住嗎如果公司或你自己有在用開源大模型(不管自架伺服器或租雲端GPU),去查目前的顯卡型號和VRAM容量,對照模型官網公布的參數量,用「參數量 x 2 ≈ 至少要多少GB的VRAM」這個粗略經驗法則,看看裝不裝得下。
2
比價時看「每美元的效能」不是看「顯卡貴不貴」如果正在考慮租GPU伺服器跑AI推論,上RunPod、Lambda Labs、CoreWeave這類雲端GPU平台,把NVIDIA(B200/B300)和AMD(MI300X/MI355X)的每小時報價都列出來,除以廠商公布的benchmark吞吐量(tokens/秒),算出「每美元能換多少token」再決定,不要只看單價高低。
3
選AMD前先確認你的推論框架有沒有跟上AMD顯卡的軟體生態(像vLLM、SGLang這些跑AI模型的框架)支援度還在追NVIDIA,採用前務必先到該框架的官方GitHub或文件搜尋「MI355X」或「ROCm」關鍵字,確認有沒有正式支援、有沒有其他人已經踩過雷,再決定要不要跳。

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 B300單機吞吐量硬是贏MI355X快1.65倍,為什麼作者還是說MI355X比較划算?
這是典型的「絕對效能」vs「性價比」取捨。如果服務量夠大、預算夠高,B300的絕對速度確實有它的價值;但多數團隊的實際使用量不會24小時都跑滿載,這時候「每一塊錢能買到多少運算量」才是決定成本的關鍵指標,而不是「哪張卡最快」。
🔭 文章特別提到B200的成績「因為要跨機通訊而被拖慢」,這對工程師有什麼啟示?
B200單機裝不下Kimi K3,得靠兩台伺服器(16張顯卡)分工合作,但兩台機器之間得透過網路傳資料(用的是RoCE v2,速度約195Gb/s),這個「機器之間搬資料」的延遲會拖慢整體效能。這提醒工程師:選硬體不能只看單張顯卡多強,「模型大小能不能剛好塞進一台機器裡」往往比顯卡的絕對算力更影響實際表現。