🚨 AI-LECTURER 快訊速報|2026-08-05|5 分鐘速讀

🚨 不靠NVIDIA也能扛住巨型模型:一張AMD顯卡跑起3040億參數DeepSeek實戰紀錄

取材:DeepSeek V4 Flash on a Single AMD MI300X(Hacker News(AI 高人氣))|完整課同日跟進,見書架
📍 真實場景
剛把公司唯一一顆GPU預算用完的新創技術長

正在報價單上比較NVIDIA H100與AMD MI300X,想找一張便宜又扛得住大型模型的顯卡

😖 卡住的地方:業界文件、教學全部預設用NVIDIA,查不到AMD顯卡實際能不能跑起跟頂級大模型一樣大的東西,也不確定半路會不會冒出奇怪的錯誤,不敢貿然下單
💡 讀完你會知道:一張比NVIDIA便宜一半的顯卡,已經有工程師公開把地雷都排掉、把完整設定檔釋出,讓別人可以直接照抄

⚡ 一句話講清楚

有工程師公開了在單張AMD MI300X顯示卡上,跑動DeepSeek V4 Flash(一個3040億參數的大型模型)的完整生產環境設定。特別的是,模型不需要壓縮成更小的數字格式(量化quantization把模型內部的數字用更少的位元儲存以節省空間,通常會犧牲一點準確度來換取速度,這裡強調完全不需要),也不用把部分參數暫存到較慢的裝置(權重卸載weight offload當顯卡記憶體不夠大,把模型部分參數暫時搬到速度較慢的主機記憶體或硬碟,需要時再搬回來,會拖慢速度),因為這張卡的記憶體夠大,整個模型直接塞得下。

問題在於,官方的部署方案預設是照NVIDIA顯卡的規格寫的,AMD顯卡晶片架構不同,連最基本的數字表示法都不一樣(FP8一種用8個位元表示一個數字的精簡格式,大型模型常用它加速運算、節省記憶體;不同廠牌顯卡對這8個位元的定義方式並不完全相同)。如果直接照抄NVIDIA的程式碼,算出來的數字可能整整差兩倍卻不會報錯——這種「安靜算錯」比當機更麻煩,因為沒人會發現。作者還額外修好了大型模型內部「分工挑專家」的邏輯(MoE路由Mixture-of-Experts routing大型模型其實由很多個「小專家」組成,每次只挑幾個相關的來運算以節省算力;很多人同時使用時,挑選邏輯容易出錯),以及生成文字時用來加速的暫存機制(KV快取KV cache模型生成文字時,把前面算過的中間結果存起來,下一個字不用整段重算,是加速生成的關鍵機制)在CPU與GPU之間對不齊的問題。

結果是:這套修好、版本號都釘死的設定,讓一張記憶體是NVIDIA H100兩倍多、價格卻只要一半的顯卡,不靠NVIDIA的生態系,也能同時扛住8個到64個人的真實流量,全程沒當機、沒記憶體爆掉。換句話說,「大型模型只能靠NVIDIA」這個假設,正在被一份公開、可重現的實戰紀錄一點一滴打破。

🏃 快速上手三步(今天就能做)

1
查一張顯卡扛不扛得住到GitHub搜尋這個專案(作者repo:ryanzhou/deepseek-v4-flash-mi300x),打開README看效能表格,抓出兩個數字對照:模型的「參數量」(這裡是3040億)與顯卡的「記憶體大小」(這裡是192GB HBM)。以後評估任何「這張卡能不能跑這個模型」的問題,先比這兩個數字,粗略估算:參數量(十億)大約要接近相同數字的GB記憶體才裝得下(未壓縮情況)。
2
動手比較雲端GPU租用報價到你熟悉的雲端服務(如AWS、GCP,或RunPod、Lambda Labs這類專門租GPU的平台)分別查AMD MI300X與NVIDIA H100的每小時租用價格。判斷標準:把文中的效能數字(例如8組並發時542 tok/s)換算成「每小時能處理多少字」,除以該顯卡的每小時租金,算出「每美元能換到多少產出」,兩張卡一比就知道誰划算。
3
檢查你正在用的AI工具有沒有綁死NVIDIA打開你目前使用或考慮採用的AI部署工具、框架文件,搜尋關鍵字「CUDA」出現的次數。如果每個範例都預設CUDA、完全沒提到「ROCm」(AMD對應的生態系名稱),代表這套工具目前綁死NVIDIA。這不是壞事,但代表未來若想換便宜顯卡省錢,會需要額外的工程投入去修相容性問題——就像這篇文章的作者做的事。

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 為什麼官方的部署方案沒有支援MI300X,要靠一個工程師自己修、自己釋出?
官方資源有限,只會優先照顧主流硬體(NVIDIA)與最新一代(MI325X、MI355X),舊一代或非主流硬體的相容性就落到開源社群頭上。這代表選擇「非主流但便宜」的硬體,等於自己要承擔一部分本該由官方負責的維護成本;省下的採購費用划不划算,取決於你團隊有沒有工程能量去補這個坑——多數團隊沒有,這正是為什麼這類公開設定檔特別有價值。
🔭 為什麼「64組並發串流不會記憶體爆掉、不會出錯」比模型本身跑得動更值得注意?
一個模型能不能用,不是看它「跑得起來」,而是看真實流量下的並發承載力與穩定性。很多實驗室demo在單一使用者測試時跑得很順,正式上線後多人同時用就當機或爆記憶體——這篇文章特別列出「8組並發542 tok/s」「64組突發830 tok/s、無OOM」這種數字,就是在證明它不是demo等級,而是真的扛得住生產環境,這才是工程上真正稀缺、也最難驗證的部分。