老闆要求她三個月內用 AI 做出客服問答機器人和宣傳短影片,但公司沒有工程師,預算也只夠訂閱幾個免費或低價方案
這禮拜如果你也滑到 AI 相關新聞,大概會看到兩則看起來八竿子打不著的消息:一家 AI 公司把新模型直接免費放出來讓人下載,另一邊 Hugging Face 的工具讓你用滑鼠拖拉方塊就能把好幾個 AI 兜成一條流程。乍看是兩件不相干的小事,但放在一起看,其實在講同一件事——AI 的能力正在被拆解成一塊塊誰都拿得到的積木,這正是這門課「模型瘦身與組裝術」接下來要帶你看懂、也要帶你動手做的方向。
先看第一則。智譜 AI 把新模型 GLM-5.3 的開源權重模型AI 訓練完之後那份巨大的「參數檔案」被公開放出來,任何人都能下載到自己的電腦或伺服器上執行,不必透過原廠收費的網路服務直接放上 Hugging Face。有意思的是,官方特別說明 GLM-5.3 用的底層模型架構跟上一代 GLM-5.2 完全一樣,所有進步都來自後訓練模型的基礎架子蓋好之後,再用額外的資料去「加強調教」它,讓它更會做特定任務,有點像學生下課後另外補習加強某一科,結果卻是寫程式與處理長串複雜任務的能力大幅跳升——像「Terminal Bench 3.0」這項考終端機操作能力的跑分測試(Benchmark)用一套固定的考題去測不同 AI 模型,看誰考得高分,方便互相比較實力,從上一代的 4.6 分衝到 28.3 分,翻了六倍多。
第二則新聞來自另一個方向。Hugging Face 旗下的 Gradio 推出 gr.Workflow,讓你不用自己寫串接程式碼,只要用滑鼠把一個個節點(Node)流程圖裡的一個方塊,每個方塊各自負責一件事,例如「生成一張圖」或「幫圖片去背」拖拉、連線,就能把好幾個 AI 模型兜成一條自動化流程——例如輸入一段文字,同時生成一張圖、一段配音、一個標題。畫好的流程圖還能一鍵變成網頁,也能直接變成給程式呼叫的API讓不同軟體之間互相溝通的窗口,可以想成餐廳的「外送專線」,不用親自進廚房也能點到菜,不必再自己另外寫串接程式。
把這兩件事擺在一起看,你會發現它們其實是同一條供應鏈的上下游:GLM-5.3 這種開源權重模型,是別人已經幫你「養好、練好」的 AI 半成品積木;gr.Workflow 這種無代碼組裝工具,則是讓你不用懂程式也能把這些積木兜起來用的螺絲起子。以前要用到最新 AI 能力,得自己養模型或付費喊 API;現在材料跟工具都被拆開放到你面前,門檻正在快速往下降。
這也是這門課接下來要做的事——先搞懂「為什麼大家都在拼省」,再學怎麼把通用 AI 捏成「你的」AI,最後換你自己動手組裝一次。這一單元你只需要記住一件事:這禮拜紅的不是某一個模型或某一個工具,而是「AI 能力正在被拆成人人能拿的積木」這件事本身。
| 測試項目 | GLM-5.3 | GLM-5.2 | 意義 |
|---|---|---|---|
| Terminal Bench 3.0(終端機操作任務) | 28.3 | 4.6 | 同一顆模型,只靠後訓練就翻了六倍多 |
| DeepSWE v1.1(自動修程式) | 66.9 | 46.2 | 修 bug、寫程式的能力明顯變強 |
| CyberGym(資安漏洞挖掘) | 84.5 | 77.2 | 連找資安漏洞的能力都跟著變強,是官方也說意外的副作用 |
上一堂我們看過這週AI圈最紅的技術八卦,但如果你認真滑過那些貼文,會發現不管新模型多讓人驚艷,留言裡永遠有人在問同一句話:「這個要花多少錢才跑得動?」這堂課要拆的,就是這句話背後的功夫——為什麼從做模型的團隊到做推理軟體的團隊,這陣子都卯起來拼「省」。
先講模型本身怎麼省。AI模型裡的每一個參數,原本是用很精細的數字存起來的,佔的檔案空間跟運算量都很驚人。量化(quantization)把模型參數從很精細的數字,壓縮成用更少位元儲存的簡化數字,像把一張高畫質照片存成小檔案,檔案變小、算得快,但可能會失真就是解法之一。一份最新研究把一個1200億參數的模型(GPT-OSS 120B),先砍到剩600億參數,再用4-bit(MXFP4)只用4個二進位數字就存一個參數的極端壓縮格式,原本可能要用16個甚至32個位元才存得下的規格壓縮,等於模型體積大幅縮水。
照常理來說,壓得越狠,AI應該變得越笨,但這份研究的結果反過來了:那個又小又壓縮的4-bit模型,在9項測驗裡有7項贏過壓縮前的原始滿血版模型。關鍵在「怎麼補回壓縮造成的損傷」這一步,研究團隊把這個做法取名叫量化感知修復(QAH)模型壓縮、變成低位元格式之後,再用另一個更完整的「老師模型」重新指導它把能力補回來的訓練方式。過去常見的做法是拿「已經修復過的壓縮版模型」自己當老師,但這等於學生在模仿一個本身就打了折扣的老師,天花板被鎖死;QAH的做法是直接讓「壓縮前、貨真價實的原始滿血模型」當老師,學生等於是跟真正的高手學,自然學得比較準。
模型本身瘦身只是省一半,另一半的省,發生在「跑模型的軟體」上。推理加速引擎vLLM在最新的v0.28.0版本裡,針對Kimi-K3、DeepSeek V4這類熱門大型模型做了大量優化:例如透過「共享專家分片」的設計,每張顯示卡可以省下大約17 GiB的記憶體(GPU memory)顯示卡上用來暫存模型參數與運算過程的空間,空間不夠模型就跑不動,佔用越少,同一張卡就能同時服務更多使用者;還加入自動調整的推測解碼技術,讓某些模型回應第一個字的等待時間(也就是TTFT使用者送出問題後,AI吐出第一個字所需要的時間,數字越小代表反應越快)縮短了大約六成。
把這兩邊合起來看就清楚了:一邊是把模型本身「瘦身又修復」,讓它變小卻不失準;另一邊是把跑模型的引擎「調校加速」,讓同樣一張顯卡榨出更多效能、省下更多記憶體。這兩股力量疊在一起,才是這陣子AI圈拼命喊「省」的真正原因——目標都是把跑最新AI模型的成本,壓到一般人、小公司也負擔得起的範圍。
| 做法 | 怎麼補回精度損失 | 遇到的問題 |
|---|---|---|
| 量化感知訓練(QAT) | 把假量化步驟塞進訓練過程,持續用任務資料微調 | 等於要重跑一次昂貴的訓練流程,而且訓練太久還可能變不穩定 |
| 量化感知蒸餾(QAD) | 拿同一個模型「壓縮前的滿血版」當老師,用老師的輸出來教壓縮後的學生 | 只適合單純量化、沒動架構的情況;一旦模型連層數、神經元都被砍過,就沒有真正對應的滿血老師 |
| 量化感知修復(QAH) | 不管模型架構怎麼被砍,都直接找「原始、未壓縮前」的滿血模型當老師 | 老師和學生架構完全不同也沒關係,學生一樣能學到接近甚至超越老師水準的能力 |
前一單元說到大家都在拼「省」——把大模型壓縮、量化,讓它跑得動、跑得便宜。這一單元要看的是另一條路:不是把 AI 變小,而是把「通用」的 AI 變成「懂你」的 AI。省的是運算資源,這裡省的則是你的時間與精力——公版模型不用重新設計架構,只靠少量客製化調整,就能貼著你的問題走。
先看第一個例子。做搜尋、做問答系統的人常用「嵌入模型」把文字轉成向量再比對相似度,但一般的嵌入模型是把整段文字壓成一顆向量,細節容易被平均掉。Hugging Face 的教學介紹了一種更精細的做法,叫 多向量嵌入模型(ColBERT 風格)不是把一整篇文章壓成一個向量,而是每個字都留一個小向量,查詢時逐字比對取最相似的分數加總,抓字詞細節更準,保留了逐字比對的能力,代價是索引會變大。
但這篇教學真正厲害的地方不是模型架構本身,而是示範了 微調(finetuning)拿一個已經訓練好的通用模型,用少量你自己的資料再訓練一次,讓它更懂你的特定領域 的威力。作者只用一張 RTX 3090 顯卡、花 14.5 小時,拿醫療領域的資料把公版模型重新調教一遍,結果這個客製化模型在醫療搜尋測試上,打贏了市面上所有現成的通用檢索模型——不管是密集向量、稀疏向量、關鍵字比對,還是多向量模型都比不過。這說明了一件事:通用模型解決的是「大部分情況」,微調後的模型解決的是「你的情況」,而後者往往更準。
第二個例子換一個場景,但邏輯一樣。Google 的 Gemini Omni 1.1 Flash 是拿來生成影片的模型,這次更新的重點不是畫質變好,而是讓你能「精細控制」生成過程。開發者可以指定一段影片的起點與終點畫面,叫做 關鍵影格(keyframe)影片的起始與結束畫面,你只要指定頭尾兩張圖,AI 就會自動生成中間的過渡動畫,模型會自動補完中間的運鏡與轉場;也可以延續前一段影片的內容一段一段接下去,最長能疊到 40 秒。
微調和關鍵影格控制,表面上一個是「重新訓練」、一個是「下指令」,做法完全不同,但背後是同一套邏輯:公版模型給的是「什麼都會一點」的能力,而你要的是「這件事做到位」的結果。微調是用你自己的資料去調整模型內部,關鍵影格則是用精確的輸入去約束模型的輸出——兩者殊途同歸,都是把「通用」收斂成「專屬」。
| 微調(Finetuning) | 精細控制(如關鍵影格) | |
|---|---|---|
| 怎麼做 | 用你自己的資料重新訓練模型內部參數 | 用明確的輸入條件(起訖畫面、延伸秒數)引導模型輸出 |
| 需要什麼 | 你的領域資料 + 一點運算資源(教學案例只用一張顯卡) | 清楚的需求描述,不需要重新訓練 |
| 效果 | 模型從內部就懂你的領域,長期使用效益高 | 單次生成結果更精準,但換下一個任務要重新下指令 |
| 適合情境 | 同一類任務會重複做很多次(如你自己的搜尋系統) | 一次性或少量的創作任務(如做一支客製影片) |
這是 Gemini API 做「場景延伸」的實際呼叫方式,示範了怎麼用精確的輸入條件,把通用的影片生成模型引導成你要的結果。
from google import genaiclient = genai.Client()interaction = client.interactions.create( model="gemini-omni-1.1-flash", previous_interaction_id=previous_video_interaction.id, input=[{"type": "text", "text": "Continue the scene."}], response_format={"resolution": "360p"},)上一個單元我們看到,想把通用AI變成「你的AI」,其實有好幾種手法可以疊加使用。這個單元要做的事,是把整條路徑一次攤開:挑一個夠好的開源權重模型公司把訓練好的模型參數整包公開,任何人都能下載到自己電腦或伺服器上執行、修改,而不是只能透過網路 API 呼叫、找到能讓它省資源跑起來的推論引擎把訓練好的模型實際「跑」起來回答問題的軟體,同樣一顆模型換一套推論引擎,速度與所需記憶體可以差很多、再用組裝工具把它變成一個真正能用的服務——這正是「換你動手組裝」的意思。
先看「大腦」怎麼挑。智譜AI釋出的 GLM-5.3 是一款開源權重模型,底層模型其實跟前一版 GLM-5.2 完全相同,所有進步都來自「後訓練」——也就是模型訓練完成後,再針對特定能力額外調教。結果是它在複雜寫程式與長流程代理任務上大幅進步:在官方 Z.ai Code Bench 上比前一版提升 50%,在 Terminal Bench 3.0、Agents' Last Exam 等公開跑分上也拿下開源模型最佳成績。材料也老實揭露,它在資安漏洞探測(CyberGym)與後續攻擊利用的跑分同樣飆升——這提醒我們,同一份能力可以用來修補系統,也可能被用來攻擊系統,挑模型、部署模型都要顧到這一層責任。
光有模型還不夠,你得讓它「跑得動」。GLM-5.3 的官方部署清單裡,vLLM 就是列在最前面的選項之一;剛好 vLLM 在 v0.28.0 這個版本裡,針對多款最新模型(包含 Kimi-K3、DeepSeek V4)做了大量最佳化——像是幫某些模型省下每張顯卡約 17GB 的記憶體、加快回應速度、甚至把一次能處理的資料量上限從 8192 提高到 16384。對零基礎的你來說,不用懂這些最佳化的技術細節,只要知道「vLLM 是專門負責把模型踩油門又省油的引擎」,而它剛好支援得起像 GLM-5.3 這樣的開源模型。
模型會跑之後,還缺一個把「輸入丟進去、結果送出來」串成完整服務的骨架,這就是 Gradio 新推出的 gr.Workflow 要解決的事。你用拖拉節點的方式畫出一張流程圖,例如:一個主題丟進去,同時扇出去讓一個模型生一張圖、另一個模型配一段語音旁白、再讓語言模型想一個標題——這種「一份輸入同時觸發好幾條平行處理」的做法,材料裡稱作fan-out(扇出)模式表示一個輸入同時分送給好幾個不同的處理節點,各自平行跑出不同的結果,不用等前一個做完才能做下一個。畫完的流程圖不只能給人在網頁上操作,還會自動變成一支 REST API,讓你或別的程式直接呼叫特定一段結果,並且一個指令就能發布到網路上。
把三塊拼起來,你自己的 AI 小專案雛形就出現了:用 vLLM 把 GLM-5.3 這類開源模型省資源地跑起來,再用 gr.Workflow 把「請它寫草稿、串一個影像模型配圖、自動整理成網頁與API」這幾步接成一條龍,一鍵發布出去給自己或朋友試用。這條路徑不需要你從零寫伺服器程式,也不必是資工背景出身——挑模型、挑引擎、拉節點組裝,就是這四個單元想帶你看懂、而且真的可以自己動手做一次的完整流程。
| 拼圖 | 負責什麼 | 這次教材裡的例子 |
|---|---|---|
| 開源模型(大腦) | 決定 AI 懂什麼、能力多強 | GLM-5.3:開源權重、寫程式與代理任務能力大幅提升 |
| 推論引擎(油門) | 讓大腦省資源、跑得快 | vLLM v0.28.0:多款模型推論最佳化,省記憶體、加速回應 |
| 工作流程工具(骨架) | 把輸入輸出串成能用的服務並發布 | Gradio gr.Workflow:拖拉節點組裝,一鍵變網頁與API |