AI-LECTURER 速報課|2026-08-29|約 24 分鐘

GLM-5.3全面開源:程式碼能力狂飆的背後,官方自己坦承「意外多學會的駭客攻擊力」

取材:GLM-5.3 is now open-weight(Hacker News(AI 高人氣))
📍 真實場景
阿明,一人接案的後端工程師,最近幫一家小新創評估要不要把公司內部的程式碼審查流程,從月付訂閱的雲端AI服務,換成自己架的開源模型

他找到剛發布的GLM-5.3,號稱程式撰寫能力打趴前代、還能免費下載自己架設,打算把它接進客戶的CI流程,做自動化的程式碼審查機器人

😖 卡住的地方:他看不懂技術報告裡「開源權重」跟平常聽到的「開源軟體」到底哪裡不一樣;也搞不懂為什麼一份講程式能力的報告,會特別花一整段講「模型意外具備駭客攻擊能力」,這跟他要做的code review工具有什麼關係;他甚至完全沒注意到reasoning_effort這個參數如果沒設好,會讓每一次CI呼叫都用最貴的力度全力思考
💡 這堂課會帶他弄懂三件事:開源權重模型跟一般開源軟體差在哪、為什麼一份炫耀程式能力的報告需要坦承資安風險、以及reasoning_effort跟clear_thinking這兩個容易被忽略的參數,該怎麼設定才不會讓自架主機的運算成本悄悄爆表。

🧭 這到底是什麼(白話版)

GLM-5.3是中國AI公司智譜(Zhipu / Z.ai)推出的最新一代大型語言模型,最特別的一點是它採用開源權重(open-weight)公司把訓練好的模型「參數檔案」整包公開,讓任何人免費下載到自己的電腦或伺服器上執行,但通常不會一併公開訓練資料與訓練方法,跟原始碼完全公開的傳統開源軟體不完全是同一件事的方式釋出,意味著不只是大公司,一般工程師也能自己架設、免費使用。

更值得注意的是,GLM-5.3用的是跟上一代GLM-5.2完全相同的基礎模型,所有的能力提升全部來自後訓練(post-training)模型完成最初的「打底」訓練之後,額外針對特定能力(例如寫程式、處理需要很多步驟的任務)做調校的階段,不需要從頭重新訓練整個模型。這次後訓練特別加強了兩塊:一是寫程式的能力,二是代理型長任務(agentic/long-horizon task)不是問一句答一句,而是要AI自己規劃步驟、連續操作很多回合才能完成的複雜任務,像是自動幫一整個專案抓bug並修好,也就是能自己動手做完一整串工程工作,而不只是回答單一問題。

官方用一系列基準測試(benchmark)用一組固定的標準題目,幫不同AI模型打分數,方便互相比較誰在特定任務上表現比較好來證明這次的進步:在公司內部的Code Bench上比GLM-5.2進步了50%,在公開的Terminal Bench 3.0(模擬人類在終端機裡連續下指令完成任務)等基準上,拿下開源模型裡的最高分,整體實力已經能跟多款目前最頂尖的模型互相匹敵。

🎯 為什麼值得你花時間

頂尖能力不再是大公司專利開源權重代表接近頂級水準的AI能力,任何人都能免費下載使用,不只是資源雄厚的大公司或研究機構才玩得起,這對整個產業的技術門檻是結構性的改變。
能自己動手做完整串工作程式撰寫與長任務能力的躍進,代表這類模型能自動處理更複雜、跨更多步驟的開發工作(例如自動修bug、自動寫測試),工程師的角色也從「自己動手做」逐漸變成「監督AI做完整串任務」。
沒被刻意訓練的能力也可能意外冒出來這份報告最值得工程師警惕的一段:模型並沒有被特別訓練去做資安攻擊,但隨著整體訓練規模擴大,攻擊相關能力卻跟著快速成長——而且因為是開源權重,這份能力人人都能下載,值得在導入前多想一層風險。

⚙️ 它是怎麼運作的

1
沿用同一顆基礎模型,資源全押在後訓練GLM-5.3不是重新訓練一個更大的模型,而是拿GLM-5.2一模一樣的基礎模型,把資源集中投入後訓練這個調校階段,針對程式撰寫和長任務兩項能力加強訓練。
2
用內部與公開基準,證明程式能力的躍進在公司自製的Code Bench上,成績比GLM-5.2進步了50%;在公開的Terminal Bench 3.0、Agents' Last Exam等基準上,也拿下開源模型裡的最高分,證明不是自己說了算。
3
訓練規模一擴大,漏洞挖掘(vulnerability discovery)在程式或系統裡找出可以被利用來發動攻擊的安全弱點,是資安工程師的核心工作之一能力跟著意外成長團隊發現,隨著後訓練規模擴大,模型的資安能力成長速度比預期快,在CyberGym(漏洞挖掘測試)上拿下所有列出模型裡的最高分。
4
越靠近實際攻陷系統,進步幅度越誇張更關鍵的是,沿著攻擊鏈/利用鏈(exploitation chain)從「找到一個漏洞」到「真的能拿它入侵系統、取得控制權」中間要串起來的一連串攻擊步驟往上爬,進步幅度越大:ExploitGym(實際攻陷系統的測試)分數是GLM-5.2的三倍以上,遠比單純的漏洞挖掘能力進步得多。
5
開放讓任何人下載部署,並提供思考力度調整模型權重整包公開,支援SGLang、vLLM等多種部署框架,還提供推理力度(reasoning_effort)控制AI在正式回答前「思考」花多少運算資源的參數,官方文件定義了low、high、max三種力度,力度越高通常品質越好、但花費的運算資源也越多參數,讓使用者自己決定要花多少運算力氣。
6
思考草稿預設保留,要自己動手才會清掉另一個容易被忽略的思考草稿保留(clear_thinking)控制要不要把模型在生出最終答案前,內部推演用的草稿文字從對話紀錄裡清掉的參數參數,預設值是false,也就是模型的內部推理過程預設會留在對話紀錄裡。
GLM-5.3 對比上一代 GLM-5.2 的關鍵基準測試變化(數據取自官方模型卡)
基準測試GLM-5.2GLM-5.3白話意義
Terminal Bench 3.0(終端機代理任務)4.628.3翻了超過6倍,代表能獨立完成的複雜終端機操作任務大幅增加
CyberGym(漏洞挖掘)77.284.5只小幅提升,但已經是所有列出模型裡的最高分
ExploitGym 6小時(實際攻陷系統)39130超過3倍成長,是所有列出的資安相關指標裡增幅最誇張的一項
ProgramBench(幾乎完全解決)9.519.0翻倍,代表能獨立寫到「幾乎完成」的專案比例提高

🔍 程式碼漫遊(點有 ● 的行看白話講解)

這段程式示範怎麼透過vLLM這類支援GLM-5.3的部署框架,用跟OpenAI相容的用戶端函式庫發出一次請求,並明確指定reasoning_effort跟clear_thinking這兩個容易被忽略、卻直接影響運算成本的參數。

from openai import OpenAI
💬 GLM-5.3 支援的 vLLM/SGLang 等部署框架,通常會開一個跟 OpenAI 相容的網路窗口,所以可以直接用這套熟悉的用戶端函式庫呼叫
client = OpenAI(base_url="http://localhost:8000/v1", api_key="not-needed")
💬 指向你自己架的 GLM-5.3 服務位址,因為是自己的主機,不需要真正的付費金鑰
response = client.chat.completions.create(
💬 發出一次真正的問答請求
model="glm-5.3",
💬 指定要用哪一顆模型回答
messages=[{"role": "user", "content": "幫我找出這段程式碼的 bug"}],
💬 這是你真正想問的問題,格式跟一般聊天型 AI API 相同
extra_body={"reasoning_effort": "high", "clear_thinking": True},
💬 重點行:明確指定思考力度為 high(而不是放著讓它掉回預設的 max),並且把思考草稿留在回應裡方便除錯
)
💬 送出請求
print(response.choices[0].message.content)
💬 取出模型的回答內容並印出來

🛠️ 動手做:reasoning_effort 預設值陷阱 + 資安能力天平:兩個模擬器

  1. 先在上半部「推理力度」區塊,兩個下拉選單都保持「(不指定)」,看看程式判斷出的「有效力度」是什麼——這正是模型卡裡特別提醒的隱藏預設行為。
  2. 依序切換reasoning_effort為low/high/max,觀察思考力度條的變化,想像如果這是你自己架的GPU主機,接進客戶的CI流程要選哪個力度才不會燒爆算力。
  3. 把reasoning_effort故意選成「medium」(文件沒定義的值),看看它會不會像沒傳一樣,一樣掉回max。
  4. 切換clear_thinking的true/false,看看對話紀錄框裡的文字說明有什麼不同,這對照的是官方文件裡容易被略過的一個小段落。
  5. 到下半部「資安能力天平」拖動滑桿,從GLM-5.2一路拖到GLM-5.3,同時盯著左邊「漏洞挖掘」和右邊「實際攻陷系統」這兩條線,誰爬得比較快。
  6. 想一想:如果你是決定要不要把這顆模型接進客戶系統的工程師,「程式能力變強」和「資安攻擊力意外變強」這兩件事,哪一個該讓你在導入前多做一步風控?
👇 下面是活的,直接操作

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 為什麼技術報告要特地在成果亮點裡,主動坦承自己意外具備駭客攻擊能力,而不是低調帶過?
站在負責任揭露的角度,把模型的攻擊能力講清楚,能讓防禦端提早提高警覺;但反過來說,這段話同時也等於把「這個模型有多強」的能力秀給潛在的惡意使用者看。開源權重代表任何人都能下載這份能力,官方等於在做一個雙重用途(dual-use)同一項技術同時可以拿來做好事(例如防禦、教學)也可以拿來做壞事(例如攻擊),很難只留下好的用途、擋掉壞的用途的權衡:與其藏著讓別人自己意外發現,不如公開講清楚,把選擇權和責任攤在陽光下——這沒有零風險的答案,只有取捨。
🔭 同一個模型,為什麼漏洞挖掘能力只小幅進步,但「真的打穿系統」的能力卻大幅跳升?
這反映「找到弱點」和「把弱點串成一次完整攻擊」是兩種不同難度的任務。前者比較像單點的模式辨識,模型本來就擅長;後者需要像代理型任務一樣,規劃多步驟、根據每一步的回饋調整下一步——這正好對應到GLM-5.3這次整體加強的長任務與代理能力。也就是說,這次的資安能力躍進,不是模型單獨學會了駭客技能,而是它在「長任務規劃」上的整體進步,剛好也適用在攻擊鏈上。這提醒工程師:評估一個模型的風險,不能只看它在單一測試集上的分數,要想它「整體變聰明」之後,還能被用在哪些你沒設計過的任務上。
🔭 reasoning_effort的預設值是max而不是low或中間值,這個設計決定透露了什麼?
把預設值設在「品質優先、成本其次」的一端,是廠商在幫使用者做一個隱性的價值判斷:他們賭大部分使用者寧可多花一點運算成本,也不想收到品質打折的答案。但這對「大量、重複呼叫」的場景(像阿明想接進CI的自動code review)其實不利——如果沒有讀文件、沒有主動指定low或high,每一次呼叫都在用最貴的力度跑。這是經典的「安全預設值」設計取捨:預設保護的是答案品質,不是使用者的荷包,想省成本的人要自己動手爭取。
🔭 同樣是模型升級,為什麼官方特別強調「用的是同一顆基礎模型,所有進步都來自後訓練」?
這句話在告訴工程師和研究者一件重要的事:這次的能力提升,不是靠砸更多算力重新訓練一個更大的模型換來的,而是靠調整「怎麼教」這顆既有的模型。這代表後訓練這個階段本身的投資報酬率,可能比單純把模型做大更划算——對正在評估要不要投入資源做類似優化的團隊來說,這是一個值得注意的訊號:比起一直追更大的模型,把心力放在後訓練調校,可能是更有效率的路。

📝 隨堂考(點選答案,立即回饋)

Q1. GLM-5.3相較GLM-5.2,最主要的進步來源是什麼?
✅ 官方模型卡明確指出GLM-5.3用的是跟GLM-5.2一模一樣的基礎模型,所有的能力提升都是後訓練階段帶來的。
Q2. 根據模型卡數據,GLM-5.3在資安相關的基準測試上,哪個現象最值得注意?
✅ CyberGym(漏洞挖掘)只小幅進步(77.2→84.5),但ExploitGym(實際攻陷系統)的分數從39跳到130,顯示越靠近真的能「打穿」系統,進步越猛。
Q3. reasoning_effort參數如果沒有指定,或是傳了文件沒定義的值(例如打錯字),會發生什麼事?
✅ 官方文件寫明reasoning_effort只認low/high/max三個值,沒傳或傳了其他值,一律當成沒傳,套用預設值max。
Q4. 「開源權重(open-weight)」跟一般常聽到的「開源軟體」,最大的不同是什麼?
✅ 開源權重模型讓任何人免費下載、部署、使用這份訓練好的參數,但訓練資料、訓練方法等「怎麼練出來的」細節通常不會一起公開,跟原始碼完全公開的傳統開源軟體不完全一樣。
Q5. 為什麼這篇報告特別提到「意外的資安能力」,而不是只講程式能力進步就好?
✅ 這正是這篇模型卡最值得工程師留意的一段:能力提升有時候會「意外」外溢到沒被刻意訓練的領域,而開源權重意味著這份能力人人可下載,防禦端跟惡意使用者拿到的是同一份工具,值得在導入前多一層風控考量。

🃏 翻牌記憶卡(先想答案,再點開對答)

開源權重(open-weight)點我翻面
公開訓練好的模型參數檔案讓任何人免費下載部署,但通常不公開訓練資料與訓練方法,跟完全公開原始碼的傳統開源軟體不完全一樣。
後訓練(post-training)點我翻面
基礎模型訓練完成後,針對特定能力(如寫程式、長任務)額外調校的階段,不用重新訓練整個模型。
reasoning_effort 的預設值點我翻面
沒傳或傳錯值,一律掉回max(最高思考力度),是官方「品質優先於成本」的安全預設值選擇。
clear_thinking 的預設值點我翻面
預設是false,代表模型的內部推理草稿預設會保留在對話紀錄裡,要自己動手才會清掉。
為什麼漏洞挖掘進步小、實際攻陷進步大?點我翻面
找到漏洞比較像單點辨識,模型原本就擅長;真的攻陷系統需要多步驟規劃與臨場調整,對應到GLM-5.3整體加強的長任務與代理能力。
Terminal Bench 3.0點我翻面
考驗AI能不能像人一樣,在終端機裡連續下指令、自己規劃步驟完成複雜工程任務的基準測試,GLM-5.3在這項上是開源模型裡的最高分。

✅ 離開前自測(全勾=這課真的學會了)

0%