📍 真實場景
在小公司負責維護網站後台的後端工程師小陳
每天用 AI 幫忙修 bug、整理報表,月底一看 AI 用量帳單,token 費用又超支
😖 卡住的地方:模型越強通常越貴、越慢;想用便宜的模型,又怕它修不好 bug、寫出來的東西不能用
💡 讀完你會知道 Sonnet 5.5 到底改進了什麼、適合拿來做什麼,以及今天就能怎麼試它、怎麼判斷值不值得換
⚡ 一句話講清楚
Anthropic(做 Claude 的公司)推出了 Claude Sonnet 5.5。Claude 5.5 是一個模型家族,Sonnet 是其中「中量級」的成員:比最強的 Opus 5.5 便宜、速度快,專門處理「範圍明確的日常工作」,例如修 bug、做簡報、整理試算表。官方說它比上一代 Sonnet 5 快 30% 以上,而且完成同樣的工作,花費最多可省 30%。
最亮眼的是「代理式寫程式」的成績。代理式寫程式(agentic coding)讓 AI 自己開終端機、讀檔案、改程式、跑測試,一步步把任務做完,而不是只回答一段程式碼 的評測 Terminal-Bench 4.0 上,Sonnet 5.5 拿到 70.6%,上一代 Sonnet 5 只有 10.3%。這個分數甚至高過官方列出的 Opus 5.5(66.4%)。不過官方也老實說:遇到需要長時間判斷、答案不唯一的複雜工作,Opus 5.5 仍然明顯比較強,基準測試(benchmark)用一組固定題目幫模型打分數的考試,只能反映能力的一個面向 的分數不能全信。
價格沒有漲:每百萬個 tokenAI 計費與處理文字的最小單位,大約是一個字或半個字 輸入收 2 美元、輸出收 10 美元,快取讀取(cache read)重複送出相同的開頭內容時,系統直接用已存好的結果,所以只收很低的 0.20 美元 。因為它做同一件事通常用更少的 token,所以每個任務的實際成本會比 Sonnet 5 低。另外它是第一個內建資安防護的 Sonnet:因為它的資安能力接近 Opus 5,所以加上了跟最強模型同等級的防護,只針對少數高風險請求,一般寫程式不受影響。
🏃 快速上手三步(今天就能做)
1
查:你現在的任務屬不屬於「範圍明確」 列出你過去一週丟給 AI 的 5 件事,逐一標記:是「修一個已知 bug、改一份文件、做簡報」這類目標清楚的(適合 Sonnet 5.5),還是「重構整個系統、開放式設計判斷」這類(仍建議用 Opus 5.5)。只有前者才值得換。
▼
2
試:用同一批任務 A/B 比較,不要憑感覺 挑 3 個你已經有標準答案的舊任務(例如一個修好的 bug、一份已完成的報表)。在 Claude Code 或 API 把模型指定為 claude-sonnet-5-5 重跑一次,記錄三件事:有沒有做對、花了幾秒、用了多少 token。對照你現在用的模型(如 Sonnet 5),算出實際省了多少。
▼
3
注意:別被單一分數騙,並設好退路 官方自己承認複雜開放任務 Opus 5.5 更強,所以先用在低風險工作上,並保留「Sonnet 5.5 做不好就切回 Opus 5.5」的做法。同時留意:資安相關的請求(例如寫漏洞利用程式)可能被防護機制擋下或轉交,這是預期行為,不是壞掉。判斷標準:成功率不低於舊模型、成本下降,就可以正式換。
🧠 工程思維透鏡(資深工程師看到的是什麼)
🔭 Terminal-Bench 從 10.3% 跳到 70.6%,這個數字該怎麼看?
跳幅大到不像單純的模型變強,更可能是評測版本、工具接法或 agent 框架也一併改變(Terminal-Bench 4.0 是新版本),而且 10.3% 這個基準點本身偏低。工程上應把它當成「方向正確」的訊號,而不是保證:真正該看的是你自己的任務集上的通過率。另外同一張表裡 FrontierCode 1.1 的成績是 46.2%(Max 強度)對 Opus 5.5 的 54.4%,差距就明顯得多,說明在難題上兩者仍有距離。
🔭 「單價不變但更省」對成本結構代表什麼?
單價沒變,省的是「每個任務需要的 token 數」,所以效益取決於你的工作型態:輸出短、步驟少的任務省得多,長上下文且大量快取的工作省得少。加上速度快 30%,在需要多輪迭代的代理流程裡,延遲會累積成明顯差異。取捨是:把高頻、低複雜度的流量路由給 Sonnet 5.5,把少數需要判斷力的留給 Opus 5.5,通常比全部換成單一模型划算,也比較容易控管風險。
ai-lecturer 速報|藍圖 flash-brief-v1.0|零外部依賴