🎓 AI-LECTURER 週末主題課|2026-08-30|約 150 分鐘(可分次讀)

模型瘦身與組裝術:讓最新 AI 變成你用得起的工具

彙整本週素材:Training and Finetuning Multi-Vector Emb、GLM-5.3 is now open-weight、Quantization-Aware Healing: a compressed、vLLM v0.28.0、Wire It, Run It, Deploy It: AI Workflows、Gemini Omni 1.1 Flash lets you build wit
📍 真實場景
小型網路商店的行銷企劃 Amy

老闆要求她三個月內用 AI 做出客服問答機器人和宣傳短影片,但公司沒有工程師,預算也只夠訂閱幾個免費或低價方案

😖 卡住的地方:每次看到「開源權重」「量化壓縮」「推論引擎」這些新聞,都覺得是工程師的世界,不知道跟自己的小專案有什麼關係
💡 這門課會告訴 Amy(和你):現在的 AI 工具已經拆解成一塊塊積木,不用會寫程式,也能挑對積木組裝出自己的服務
第 1 單元|這週的 AI,到底在紅什麼

🧭 本單元白話講

這禮拜如果你也滑到 AI 相關新聞,大概會看到兩則看起來八竿子打不著的消息:一家 AI 公司把新模型直接免費放出來讓人下載,另一邊 Hugging Face 的工具讓你用滑鼠拖拉方塊就能把好幾個 AI 兜成一條流程。乍看是兩件不相干的小事,但放在一起看,其實在講同一件事——AI 的能力正在被拆解成一塊塊誰都拿得到的積木,這正是這門課「模型瘦身與組裝術」接下來要帶你看懂、也要帶你動手做的方向。

先看第一則。智譜 AI 把新模型 GLM-5.3 的開源權重模型AI 訓練完之後那份巨大的「參數檔案」被公開放出來,任何人都能下載到自己的電腦或伺服器上執行,不必透過原廠收費的網路服務直接放上 Hugging Face。有意思的是,官方特別說明 GLM-5.3 用的底層模型架構跟上一代 GLM-5.2 完全一樣,所有進步都來自後訓練模型的基礎架子蓋好之後,再用額外的資料去「加強調教」它,讓它更會做特定任務,有點像學生下課後另外補習加強某一科,結果卻是寫程式與處理長串複雜任務的能力大幅跳升——像「Terminal Bench 3.0」這項考終端機操作能力的跑分測試(Benchmark)用一套固定的考題去測不同 AI 模型,看誰考得高分,方便互相比較實力,從上一代的 4.6 分衝到 28.3 分,翻了六倍多。

第二則新聞來自另一個方向。Hugging Face 旗下的 Gradio 推出 gr.Workflow,讓你不用自己寫串接程式碼,只要用滑鼠把一個個節點(Node)流程圖裡的一個方塊,每個方塊各自負責一件事,例如「生成一張圖」或「幫圖片去背」拖拉、連線,就能把好幾個 AI 模型兜成一條自動化流程——例如輸入一段文字,同時生成一張圖、一段配音、一個標題。畫好的流程圖還能一鍵變成網頁,也能直接變成給程式呼叫的API讓不同軟體之間互相溝通的窗口,可以想成餐廳的「外送專線」,不用親自進廚房也能點到菜,不必再自己另外寫串接程式。

把這兩件事擺在一起看,你會發現它們其實是同一條供應鏈的上下游:GLM-5.3 這種開源權重模型,是別人已經幫你「養好、練好」的 AI 半成品積木;gr.Workflow 這種無代碼組裝工具,則是讓你不用懂程式也能把這些積木兜起來用的螺絲起子。以前要用到最新 AI 能力,得自己養模型或付費喊 API;現在材料跟工具都被拆開放到你面前,門檻正在快速往下降。

這也是這門課接下來要做的事——先搞懂「為什麼大家都在拼省」,再學怎麼把通用 AI 捏成「你的」AI,最後換你自己動手組裝一次。這一單元你只需要記住一件事:這禮拜紅的不是某一個模型或某一個工具,而是「AI 能力正在被拆成人人能拿的積木」這件事本身。

⚙️ 脈絡拆解

1
先看兩則新聞在講什麼GLM-5.3 開源放出權重;Gradio 推出拖拉組裝的 gr.Workflow——兩則看似不相關的消息。
2
拆解關鍵字一個是「材料」(開源權重模型),一個是「工具」(無代碼組裝),各自解決不同問題。
3
兩者為什麼同時出現當材料被公開、工具又不用寫程式,原本只有懂技術的人才能玩的 AI,門檻正在往下降。
4
這對你意味著什麼先記住這個大方向,下一單元會拆解「為什麼大家都在拼省」,幫你理解背後的成本邏輯。
GLM-5.3 相較上一代 GLM-5.2 的部分成績(底層模型沒換,只靠後訓練)
測試項目GLM-5.3GLM-5.2意義
Terminal Bench 3.0(終端機操作任務)28.34.6同一顆模型,只靠後訓練就翻了六倍多
DeepSWE v1.1(自動修程式)66.946.2修 bug、寫程式的能力明顯變強
CyberGym(資安漏洞挖掘)84.577.2連找資安漏洞的能力都跟著變強,是官方也說意外的副作用

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 GLM-5.3 沒有換模型架構,只靠後訓練就讓寫程式能力翻倍,這說明了什麼?
這代表 AI 進步的方式不是只有「蓋更大的模型」一條路,花心思在「怎麼教」既有的模型,一樣能榨出大幅進步,而且這種調教方式的門檻,比從零重新訓練一顆模型低得多——這正好呼應這門課要講的「瘦身」:不一定要更大、更貴,才能更好用。

📝 隨堂考(點選答案,立即回饋)

Q1. 「開源權重模型」代表的意思最接近下列何者?
✅ 開源權重指的是模型訓練好之後那個巨大的參數檔案(權重)被公開,不是程式原始碼,也不是只能網頁用;下載後就能在自己的電腦或伺服器上跑,像 GLM-5.3 就是這樣直接放上 Hugging Face。
Q2. 根據文章,gr.Workflow 最大的特色是什麼?
✅ 文章說明 gr.Workflow 把「串流程」變成拖拉節點的圖形化操作,每個節點都能單獨執行、看得到中間結果,而且同一張流程圖能直接變成 REST API,也能一鍵發布到 Hugging Face Spaces,完全不必自己寫串接程式碼。
第 2 單元|為什麼現在大家都在拼「省」

🧭 本單元白話講

上一堂我們看過這週AI圈最紅的技術八卦,但如果你認真滑過那些貼文,會發現不管新模型多讓人驚艷,留言裡永遠有人在問同一句話:「這個要花多少錢才跑得動?」這堂課要拆的,就是這句話背後的功夫——為什麼從做模型的團隊到做推理軟體的團隊,這陣子都卯起來拼「省」。

先講模型本身怎麼省。AI模型裡的每一個參數,原本是用很精細的數字存起來的,佔的檔案空間跟運算量都很驚人。量化(quantization)把模型參數從很精細的數字,壓縮成用更少位元儲存的簡化數字,像把一張高畫質照片存成小檔案,檔案變小、算得快,但可能會失真就是解法之一。一份最新研究把一個1200億參數的模型(GPT-OSS 120B),先砍到剩600億參數,再用4-bit(MXFP4)只用4個二進位數字就存一個參數的極端壓縮格式,原本可能要用16個甚至32個位元才存得下的規格壓縮,等於模型體積大幅縮水。

照常理來說,壓得越狠,AI應該變得越笨,但這份研究的結果反過來了:那個又小又壓縮的4-bit模型,在9項測驗裡有7項贏過壓縮前的原始滿血版模型。關鍵在「怎麼補回壓縮造成的損傷」這一步,研究團隊把這個做法取名叫量化感知修復(QAH)模型壓縮、變成低位元格式之後,再用另一個更完整的「老師模型」重新指導它把能力補回來的訓練方式。過去常見的做法是拿「已經修復過的壓縮版模型」自己當老師,但這等於學生在模仿一個本身就打了折扣的老師,天花板被鎖死;QAH的做法是直接讓「壓縮前、貨真價實的原始滿血模型」當老師,學生等於是跟真正的高手學,自然學得比較準。

模型本身瘦身只是省一半,另一半的省,發生在「跑模型的軟體」上。推理加速引擎vLLM在最新的v0.28.0版本裡,針對Kimi-K3、DeepSeek V4這類熱門大型模型做了大量優化:例如透過「共享專家分片」的設計,每張顯示卡可以省下大約17 GiB的記憶體(GPU memory)顯示卡上用來暫存模型參數與運算過程的空間,空間不夠模型就跑不動,佔用越少,同一張卡就能同時服務更多使用者;還加入自動調整的推測解碼技術,讓某些模型回應第一個字的等待時間(也就是TTFT使用者送出問題後,AI吐出第一個字所需要的時間,數字越小代表反應越快)縮短了大約六成。

把這兩邊合起來看就清楚了:一邊是把模型本身「瘦身又修復」,讓它變小卻不失準;另一邊是把跑模型的引擎「調校加速」,讓同樣一張顯卡榨出更多效能、省下更多記憶體。這兩股力量疊在一起,才是這陣子AI圈拼命喊「省」的真正原因——目標都是把跑最新AI模型的成本,壓到一般人、小公司也負擔得起的範圍。

⚙️ 脈絡拆解

1
模型先瘦身:量化壓縮把參數從精細數字壓成4-bit這種極簡格式,體積大幅縮小,例如把120B參數的模型先砍到60B,再量化。
2
瘦身後要修復:找對老師用QAH的做法,讓壓縮後的模型去跟「壓縮前的滿血原版」學,而不是跟已經打折的checkpoint學,才能補回甚至超越原本的表現。
3
軟體也要提速:推理引擎優化vLLM v0.28.0透過共享專家分片、推測解碼等技術,幫熱門模型省記憶體、縮短回應第一個字的等待時間。
4
兩邊一起省,才是真省模型變小、軟體變快,兩件事加在一起,才能把AI服務的成本壓低到普通人跟小公司也用得起的程度。
三種「修復」壓縮模型的做法比較
做法怎麼補回精度損失遇到的問題
量化感知訓練(QAT)把假量化步驟塞進訓練過程,持續用任務資料微調等於要重跑一次昂貴的訓練流程,而且訓練太久還可能變不穩定
量化感知蒸餾(QAD)拿同一個模型「壓縮前的滿血版」當老師,用老師的輸出來教壓縮後的學生只適合單純量化、沒動架構的情況;一旦模型連層數、神經元都被砍過,就沒有真正對應的滿血老師
量化感知修復(QAH)不管模型架構怎麼被砍,都直接找「原始、未壓縮前」的滿血模型當老師老師和學生架構完全不同也沒關係,學生一樣能學到接近甚至超越老師水準的能力

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 為什麼壓縮再修復後的模型,反而能贏過壓縮前的原始版本?
關鍵不在「壓縮」本身,而在「修復時找誰當老師」。過去的做法常常是讓壓縮模型去模仿一個已經被簡化過的checkpoint,等於學生的天花板從一開始就被老師鎖死了。QAH的做法是回頭去找「壓縮前、貨真價實的原始模型」當老師,學生等於直接跟真正的高手學,天花板自然被打開,結果甚至能反超。這說明「省」這件事不是單純減法,設計補救的方法比減了多少更重要。
🔭 模型壓縮和推理引擎優化,為什麼會在同一段時間一起被討論?
因為使用AI要花的錢,其實是「模型本身多重」乘上「跑起來多有效率」的結果:模型壓縮讓體積跟運算量變小,推理引擎優化(像vLLM省記憶體、縮短等待時間)讓同一份硬體資源能服務更多人、回應更快。這兩件事分別由不同團隊在做,卻是同一個成本方程式的兩端,只要有一邊沒跟上,省下來的效果就會被抵銷,這也是為什麼這陣子兩邊的新聞會一起冒出來。

📝 隨堂考(點選答案,立即回饋)

Q1. 根據文中的QAH(量化感知修復)研究,把GPT-OSS 120B壓縮到60B並量化成4-bit後,結果是什麼?
✅ 文中明確寫到,QAH修復後的4-bit模型「beats its own full-precision (bfloat16) version on 7 of 9 benchmarks」,也就是9項指標裡有7項贏過原本的滿血版,顛覆了「壓縮一定會變差」的常識。
Q2. vLLM v0.28.0裡,「共享專家分片(shared-expert sharding)」這項優化,主要帶來什麼效果?
✅ 原文寫道這項設計是「optional shared-expert sharding saving ~17 GiB of memory per GPU」,也就是透過共享專家的方式分攤負擔,讓每張顯示卡省下約17 GiB記憶體,而不是取消運算或拿掉其他功能。
第 3 單元|怎麼把通用 AI 變成「你的」AI

🧭 本單元白話講

前一單元說到大家都在拼「省」——把大模型壓縮、量化,讓它跑得動、跑得便宜。這一單元要看的是另一條路:不是把 AI 變小,而是把「通用」的 AI 變成「懂你」的 AI。省的是運算資源,這裡省的則是你的時間與精力——公版模型不用重新設計架構,只靠少量客製化調整,就能貼著你的問題走。

先看第一個例子。做搜尋、做問答系統的人常用「嵌入模型」把文字轉成向量再比對相似度,但一般的嵌入模型是把整段文字壓成一顆向量,細節容易被平均掉。Hugging Face 的教學介紹了一種更精細的做法,叫 多向量嵌入模型(ColBERT 風格)不是把一整篇文章壓成一個向量,而是每個字都留一個小向量,查詢時逐字比對取最相似的分數加總,抓字詞細節更準,保留了逐字比對的能力,代價是索引會變大。

但這篇教學真正厲害的地方不是模型架構本身,而是示範了 微調(finetuning)拿一個已經訓練好的通用模型,用少量你自己的資料再訓練一次,讓它更懂你的特定領域 的威力。作者只用一張 RTX 3090 顯卡、花 14.5 小時,拿醫療領域的資料把公版模型重新調教一遍,結果這個客製化模型在醫療搜尋測試上,打贏了市面上所有現成的通用檢索模型——不管是密集向量、稀疏向量、關鍵字比對,還是多向量模型都比不過。這說明了一件事:通用模型解決的是「大部分情況」,微調後的模型解決的是「你的情況」,而後者往往更準。

第二個例子換一個場景,但邏輯一樣。Google 的 Gemini Omni 1.1 Flash 是拿來生成影片的模型,這次更新的重點不是畫質變好,而是讓你能「精細控制」生成過程。開發者可以指定一段影片的起點與終點畫面,叫做 關鍵影格(keyframe)影片的起始與結束畫面,你只要指定頭尾兩張圖,AI 就會自動生成中間的過渡動畫,模型會自動補完中間的運鏡與轉場;也可以延續前一段影片的內容一段一段接下去,最長能疊到 40 秒。

微調和關鍵影格控制,表面上一個是「重新訓練」、一個是「下指令」,做法完全不同,但背後是同一套邏輯:公版模型給的是「什麼都會一點」的能力,而你要的是「這件事做到位」的結果。微調是用你自己的資料去調整模型內部,關鍵影格則是用精確的輸入去約束模型的輸出——兩者殊途同歸,都是把「通用」收斂成「專屬」。

⚙️ 脈絡拆解

1
先講清楚你要什麼微調需要你自己領域的資料(像醫療文件);關鍵影格控制需要你明確指定的起訖畫面。兩者都是先把「你要什麼」交代清楚,模型才有東西可以貼著走。
2
選路線:重新訓練,或是精準下指令資料夠多、會長期重複用,值得像 Sentence Transformers 教學那樣走一次微調流程;只是單次任務,用像 Gemini API 那樣的參數控制就夠了。
3
先小規模驗證再投入教學裡的醫療模型只花 14.5 小時在一張顯卡上就驗證有效;做影片的話也可以先用 360p 草稿模式快速預覽,確認方向對了再生成正式版。
4
把結果收斂成你能重複用的工具不管是微調完的檢索模型,還是設好關鍵影格的影片生成流程,最終目的都是讓它固定下來,變成你以後可以重複呼叫的專屬工具,而不是每次從頭來過。
兩種「客製化」的路線比較
微調(Finetuning)精細控制(如關鍵影格)
怎麼做用你自己的資料重新訓練模型內部參數用明確的輸入條件(起訖畫面、延伸秒數)引導模型輸出
需要什麼你的領域資料 + 一點運算資源(教學案例只用一張顯卡)清楚的需求描述,不需要重新訓練
效果模型從內部就懂你的領域,長期使用效益高單次生成結果更精準,但換下一個任務要重新下指令
適合情境同一類任務會重複做很多次(如你自己的搜尋系統)一次性或少量的創作任務(如做一支客製影片)

🔍 程式碼漫遊(點有 ● 的行看白話講解)

這是 Gemini API 做「場景延伸」的實際呼叫方式,示範了怎麼用精確的輸入條件,把通用的影片生成模型引導成你要的結果。

from google import genai
💬 先載入 Gemini 的官方 SDK。
client = genai.Client()
💬 建立一個跟 Gemini API 溝通的用戶端。
interaction = client.interactions.create(
💬 呼叫生成互動的函式,開始建立一段新的影片生成請求。
model="gemini-omni-1.1-flash",
💬 指定要用的模型版本——這裡是這次更新的 Omni 1.1 Flash。
previous_interaction_id=previous_video_interaction.id,
💬 帶入前一段影片的 ID,這就是「場景延伸」的關鍵:模型會參考這段影片最長 10 秒的畫面,接著往下生成,而不是從零開始。
input=[{"type": "text", "text": "Continue the scene."}],
💬 用一句簡單的文字指令,告訴模型「接著演下去」。
response_format={"resolution": "360p"},
💬 指定輸出畫質為 360p 草稿模式,速度最多快 60%、成本只要 720p 的三分之一,適合先快速預覽再決定要不要生成正式版。
)
💬 送出請求,模型就依照這些精細控制條件生成延伸影片。

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 為什麼「微調」跟「下指令控制」算是同一種能力?
兩者做的其實是同一件事:把模型從「通用」收斂到「專屬」。差別只在於你是動模型的「內部」(用資料重新訓練參數),還是動模型的「輸入」(用精確條件約束輸出)。理解這個共通邏輯後,遇到新工具時可以先問自己:這個工具是要我提供資料去調教它,還是要我把需求講得更精確?抓對方向,就知道怎麼把公版工具變成自己的專屬工具。
🔭 為什麼教學特別強調「只用一張顯卡、14.5 小時」?
這在暗示微調的門檻已經不是研究單位或大公司的專利。過去要打造一個超越通用模型的專屬 AI,聽起來需要龐大運算資源,但這篇教學證明:只要資料夠對準你的領域(這裡是醫療),小規模的微調就能打敗所有現成的通用模型。這正好呼應本單元的主題——通用 AI 變成「你的」AI,門檻比想像中低。

📝 隨堂考(點選答案,立即回饋)

Q1. 多向量嵌入模型(ColBERT 風格)跟一般嵌入模型最大的差異是什麼?
✅ 一般的密集嵌入模型把整段文字壓成一顆向量,細節容易被平均掉;多向量模型改成每個字留一個向量,查詢時逐字比對取最相似分數加總(MaxSim),保留更細的比對訊號,代價是索引會變大。
Q2. Gemini Omni 1.1 Flash 的「場景延伸」功能,是靠什麼讓新生成的畫面銜接前一段影片?
✅ 文中提到 Omni 1.1 現在能分析「最長 10 秒」的前段內容,比舊版只看最後一秒進步很多,讓生成畫面在視覺與敘事上更連貫,可以一段一段延伸到最長 40 秒。
第 4 單元|對你的意義:換你動手組裝

🧭 本單元白話講

上一個單元我們看到,想把通用AI變成「你的AI」,其實有好幾種手法可以疊加使用。這個單元要做的事,是把整條路徑一次攤開:挑一個夠好的開源權重模型公司把訓練好的模型參數整包公開,任何人都能下載到自己電腦或伺服器上執行、修改,而不是只能透過網路 API 呼叫、找到能讓它省資源跑起來的推論引擎把訓練好的模型實際「跑」起來回答問題的軟體,同樣一顆模型換一套推論引擎,速度與所需記憶體可以差很多、再用組裝工具把它變成一個真正能用的服務——這正是「換你動手組裝」的意思。

先看「大腦」怎麼挑。智譜AI釋出的 GLM-5.3 是一款開源權重模型,底層模型其實跟前一版 GLM-5.2 完全相同,所有進步都來自「後訓練」——也就是模型訓練完成後,再針對特定能力額外調教。結果是它在複雜寫程式與長流程代理任務上大幅進步:在官方 Z.ai Code Bench 上比前一版提升 50%,在 Terminal Bench 3.0、Agents' Last Exam 等公開跑分上也拿下開源模型最佳成績。材料也老實揭露,它在資安漏洞探測(CyberGym)與後續攻擊利用的跑分同樣飆升——這提醒我們,同一份能力可以用來修補系統,也可能被用來攻擊系統,挑模型、部署模型都要顧到這一層責任。

光有模型還不夠,你得讓它「跑得動」。GLM-5.3 的官方部署清單裡,vLLM 就是列在最前面的選項之一;剛好 vLLM 在 v0.28.0 這個版本裡,針對多款最新模型(包含 Kimi-K3、DeepSeek V4)做了大量最佳化——像是幫某些模型省下每張顯卡約 17GB 的記憶體、加快回應速度、甚至把一次能處理的資料量上限從 8192 提高到 16384。對零基礎的你來說,不用懂這些最佳化的技術細節,只要知道「vLLM 是專門負責把模型踩油門又省油的引擎」,而它剛好支援得起像 GLM-5.3 這樣的開源模型。

模型會跑之後,還缺一個把「輸入丟進去、結果送出來」串成完整服務的骨架,這就是 Gradio 新推出的 gr.Workflow 要解決的事。你用拖拉節點的方式畫出一張流程圖,例如:一個主題丟進去,同時扇出去讓一個模型生一張圖、另一個模型配一段語音旁白、再讓語言模型想一個標題——這種「一份輸入同時觸發好幾條平行處理」的做法,材料裡稱作fan-out(扇出)模式表示一個輸入同時分送給好幾個不同的處理節點,各自平行跑出不同的結果,不用等前一個做完才能做下一個。畫完的流程圖不只能給人在網頁上操作,還會自動變成一支 REST API,讓你或別的程式直接呼叫特定一段結果,並且一個指令就能發布到網路上。

把三塊拼起來,你自己的 AI 小專案雛形就出現了:用 vLLM 把 GLM-5.3 這類開源模型省資源地跑起來,再用 gr.Workflow 把「請它寫草稿、串一個影像模型配圖、自動整理成網頁與API」這幾步接成一條龍,一鍵發布出去給自己或朋友試用。這條路徑不需要你從零寫伺服器程式,也不必是資工背景出身——挑模型、挑引擎、拉節點組裝,就是這四個單元想帶你看懂、而且真的可以自己動手做一次的完整流程。

⚙️ 脈絡拆解

1
挑大腦:選一個夠好的開源模型看跑分不是要你全部看懂,是要抓重點——例如 GLM-5.3 靠後訓練大幅提升寫程式與代理任務能力,而且權重公開可以下載。
2
配引擎:讓模型省資源跑起來同一顆模型換上像 vLLM 這類專門優化的推論引擎,回應可以更快、更省顯卡記憶體,GLM-5.3 官方也把 vLLM 列為支援的部署方式之一。
3
拉節點:用工作流程工具組裝服務用 Gradio gr.Workflow 把「輸入 -> 呼叫模型 -> 整理輸出」畫成一張流程圖,不用自己寫串接程式碼,還能同時串好幾個模型平行處理。
4
一鍵發布:變成網頁與API同一張流程圖直接生成網頁介面和 REST API,你或其他程式都能呼叫,等於一次把「做出來」跟「發布出去」一起完成。
拼出一個你自己的 AI 小專案,三塊拼圖各司其職
拼圖負責什麼這次教材裡的例子
開源模型(大腦)決定 AI 懂什麼、能力多強GLM-5.3:開源權重、寫程式與代理任務能力大幅提升
推論引擎(油門)讓大腦省資源、跑得快vLLM v0.28.0:多款模型推論最佳化,省記憶體、加速回應
工作流程工具(骨架)把輸入輸出串成能用的服務並發布Gradio gr.Workflow:拖拉節點組裝,一鍵變網頁與API

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 為什麼「挑模型 + 配引擎 + 拉節點組裝」這條路徑,現在一個人也做得起來?
過去要做一個AI服務,得自己訓練模型、自己寫伺服器、自己接前端,門檻很高。現在這三份材料剛好對應到這條路徑上被拆解出去的三個環節:模型有人開源釋出(GLM-5.3)、跑模型的效能有人專門優化(vLLM)、串接與發布也有工具幫你做好(gr.Workflow)。這代表「組裝」正在取代「從頭打造」,成為一個人也能啟動 AI 小專案的主要方式。
🔭 GLM-5.3 材料特別提到「資安漏洞探測能力大幅提升」,這跟你組裝AI小專案有什麼關係?
你組裝出來的服務如果串接了這類能力更強的開源模型,它同時也具備更強的資安攻防能力。這代表當你發布一個對外開放的 API 或網頁時,同時要考慮「別人可能怎麼濫用這個服務」,而不是只看「這個服務能做到多少厲害的事」——能力與責任是綁在一起被放大的。

📝 隨堂考(點選答案,立即回饋)

Q1. 材料提到 GLM-5.3 相較於前一版 GLM-5.2 有大幅進步,這個進步主要來自哪裡?
✅ 材料明白寫出「GLM-5.3 uses the same base model as GLM-5.2 — every gain comes from post-training」,代表底層模型沒換,是後訓練的調教讓寫程式與代理任務能力大幅提升。
Q2. 關於 Gradio 的 gr.Workflow,下列敘述何者正確?
✅ 材料提到 gr.Workflow 讓你用拖拉節點的方式描述流程,每個節點都可執行、中繼結果都看得到,同一張圖同時是 REST API,還能一個指令部署成網頁服務,不用自己寫串接程式碼。

✅ 離開前自測(全勾=這課真的學會了)

0%