他找到剛發布的GLM-5.3,號稱程式撰寫能力打趴前代、還能免費下載自己架設,打算把它接進客戶的CI流程,做自動化的程式碼審查機器人
GLM-5.3是中國AI公司智譜(Zhipu / Z.ai)推出的最新一代大型語言模型,最特別的一點是它採用開源權重(open-weight)公司把訓練好的模型「參數檔案」整包公開,讓任何人免費下載到自己的電腦或伺服器上執行,但通常不會一併公開訓練資料與訓練方法,跟原始碼完全公開的傳統開源軟體不完全是同一件事的方式釋出,意味著不只是大公司,一般工程師也能自己架設、免費使用。
更值得注意的是,GLM-5.3用的是跟上一代GLM-5.2完全相同的基礎模型,所有的能力提升全部來自後訓練(post-training)模型完成最初的「打底」訓練之後,額外針對特定能力(例如寫程式、處理需要很多步驟的任務)做調校的階段,不需要從頭重新訓練整個模型。這次後訓練特別加強了兩塊:一是寫程式的能力,二是代理型長任務(agentic/long-horizon task)不是問一句答一句,而是要AI自己規劃步驟、連續操作很多回合才能完成的複雜任務,像是自動幫一整個專案抓bug並修好,也就是能自己動手做完一整串工程工作,而不只是回答單一問題。
官方用一系列基準測試(benchmark)用一組固定的標準題目,幫不同AI模型打分數,方便互相比較誰在特定任務上表現比較好來證明這次的進步:在公司內部的Code Bench上比GLM-5.2進步了50%,在公開的Terminal Bench 3.0(模擬人類在終端機裡連續下指令完成任務)等基準上,拿下開源模型裡的最高分,整體實力已經能跟多款目前最頂尖的模型互相匹敵。
| 基準測試 | GLM-5.2 | GLM-5.3 | 白話意義 |
|---|---|---|---|
| Terminal Bench 3.0(終端機代理任務) | 4.6 | 28.3 | 翻了超過6倍,代表能獨立完成的複雜終端機操作任務大幅增加 |
| CyberGym(漏洞挖掘) | 77.2 | 84.5 | 只小幅提升,但已經是所有列出模型裡的最高分 |
| ExploitGym 6小時(實際攻陷系統) | 39 | 130 | 超過3倍成長,是所有列出的資安相關指標裡增幅最誇張的一項 |
| ProgramBench(幾乎完全解決) | 9.5 | 19.0 | 翻倍,代表能獨立寫到「幾乎完成」的專案比例提高 |
這段程式示範怎麼透過vLLM這類支援GLM-5.3的部署框架,用跟OpenAI相容的用戶端函式庫發出一次請求,並明確指定reasoning_effort跟clear_thinking這兩個容易被忽略、卻直接影響運算成本的參數。
from openai import OpenAIclient = OpenAI(base_url="http://localhost:8000/v1", api_key="not-needed")response = client.chat.completions.create( model="glm-5.3", messages=[{"role": "user", "content": "幫我找出這段程式碼的 bug"}], extra_body={"reasoning_effort": "high", "clear_thinking": True},)print(response.choices[0].message.content)