📍 真實場景
阿凱,接案的後端工程師,正幫一家 12 人的電商公司做客服自動化
他的客服機器人每天要處理約 500 件任務(查訂單、改地址、寫回覆草稿),老闆要他在月底前交出「下個月 AI 預算」的報告
😖 卡住的地方:上週他才選定 GPT-6 Sol 並估好預算,今天同一家公司就推出 GPT-6.1 Sol,Hacker News 上又吵成一團。他不知道該不該換、換了會省多少、會不會變笨,也不會看那些「指數」「效率前緣」的圖
💡 這課帶你把一篇模型比較報告讀成一張預算表:看懂「每項任務成本」、「快取折扣」、「帕雷托前緣」,並親手算出換模型到底省多少錢
🧭 這到底是什麼(白話版)
2026 年這個時間點,AI 公司換新版模型的速度非常快。這則新聞的主角是 GPT-6.1 Sol:它上線才 7 天,就直接取代了 GPT-6 Sol。第三方評測機構 Artifact Analysis 用自己的 Intelligence Index(智慧指數)把模型放在一堆測驗題上考試後,整合成的一個總分,分數越高代表整體越會做題 來比較,結果 GPT-6.1 Sol 只比旗艦款 GPT-6 Astra 低 1 分。
最有感的是價錢。評測用的單位叫 Cost per Task(每項任務成本)讓模型完整做完一題測驗所花的總美元,包含輸入與輸出的費用。以最高努力程度來看,GPT-6.1 Sol 做一項任務花 0.72 美元,GPT-6 Astra 要 3.26 美元,上一代 GPT-6 Sol 是 1.05 美元,更早的 GPT-5.6 Sol 是 1.99 美元。也就是說,它的成本不到旗艦款的四分之一。
單價表面上沒變:每百萬個 tokenAI 讀寫文字的計費單位,大約是一個字或半個字 輸入收 2 美元、輸出收 10 美元,跟 GPT-6 Sol 一樣。但 快取讀取折扣如果你重複送同一段開頭內容(例如固定的系統指令),AI 會從暫存直接讀,這部分價格打折 從 90% 提高到 95%,所以反覆叫用、開頭內容很長的 agentic 工作流讓 AI 自己多步驟地做事、呼叫工具、反覆讀寫的用法,而不是一問一答,實際帳單會再少一點。
除了便宜,它也真的變強了:終端機操作測驗 Terminal-Bench 4.0 進步 12 分,Humanity’s Last Exam 進步 5 分,AA-Omniscience 的準確度進步 8 分,幻覺率AI 不知道卻硬編出答案的比例,越低越可靠 從 60% 降到 54%。這些都是報告裡寫出來的數字,不是我們的推測。
🎯 為什麼值得你花時間
預算要重算同樣品質等級的工作,成本可以掉到原本的 31% 到 36%(比 GPT-6 Sol 省 31%,比 GPT-5.6 Sol 省 64%)。如果你上週才報過預算,這週就已經過時了,報價與選型需要有「定期重新比較」的習慣。
便宜不等於變笨過去常見的取捨是「便宜就弱」。這次報告指出 GPT-6.1 Sol 各個努力程度都把成本效率的前緣往外推:在同樣的智慧分數下,找不到更便宜的模型。選型不再只是旗艦與平價二選一。
但有隱藏成本要看它輸出的 token 比 GPT-6 Sol 多約 10% 到 30%,因為輸出每百萬 token 要 10 美元,話多的模型會吃掉部分省下來的錢。只看單價會誤判,要看「做完一項任務總共多少錢」。
⚙️ 它是怎麼運作的
1
先決定要比什麼評測機構把模型丟進同一組測驗題(智慧指數、寫程式代理指數、幻覺測驗等),每個模型用同樣的方式跑,這樣分數才能公平比較。
▼
2
記錄分數,也記錄花費每個模型做完整套題目,除了算分數,也記下總共花了多少美元,再除以題數,得到每項任務成本。
▼
3
調整努力程度再測一次同一個模型可以設定不同的 effort(努力程度)告訴模型要花多少力氣思考,越高通常越準但越貴越慢,例如 low、medium、xhigh、max。每個設定都跑一次,得到一組「分數 vs 成本」的點。
▼
4
畫出帕雷托前緣把所有點畫在圖上,橫軸是成本、縱軸是分數。帕雷托前緣在圖上沒有任何點能同時更便宜又更聰明的那條邊界線 上的點,就是「沒有更好的選擇」的點。報告說 GPT-6.1 Sol 的每個努力程度都落在前緣上。
▼
5
對照你的需求選點你的任務需要多高的智慧分數?預算上限多少?在前緣上挑一個剛好夠用的點,而不是一律選最貴的。
最高努力程度下,各模型每項任務成本(來源:評測報告)
| 模型 | 每項任務成本(美元) | 相對 GPT-6.1 Sol |
|---|
| GPT-6 Astra(旗艦) | 3.26 | 貴約 4.5 倍 |
| GPT-5.6 Sol | 1.99 | 貴約 2.8 倍 |
| GPT-6 Sol | 1.05 | 貴約 1.5 倍 |
| GPT-6.1 Sol | 0.72 | 基準 |
🛠️ 動手做:用報告數字算你的月預算
- 拖動滑桿,設定你每天要處理的任務數(例如阿凱的客服機器人是 500 件)。
- 觀察表格:每月花費 = 每項任務成本 × 每天任務數 × 30 天。
- 找出:任務數在 500 件時,換成 GPT-6.1 Sol 相較 GPT-6 Sol 每月省多少美元?相較 GPT-6 Astra 呢?
- 想一想:這張表只算了「每項任務成本」,沒有反映各模型的智慧分數差距。如果你的任務需要最後那 1 分,你願意多付多少錢?
👇 下面是活的,直接操作
🧠 工程思維透鏡(資深工程師看到的是什麼)
🔭 為什麼單價沒變,報告還說「成本下降」?資深工程師看的是哪個數字?
單價(每百萬 token 2 美元與 10 美元)只是零件價格,真正的帳單是「單價 × 用了多少 token」。GPT-6.1 Sol 的輸出 token 反而多了 10% 到 30%,但每項任務成本仍降了 31%,代表它在其他地方省下的更多(例如快取折扣提高、用更少回合或更少重試完成任務)。工程師的習慣是看端到端的單位成本(每項任務多少錢),而不是只比較價目表。這也提醒你:在自己的系統上實測一次,比相信任何通用數字都可靠。
🔭 為什麼 xhigh 努力程度在寫程式代理指數上,反而比 max 高 3 分?
報告觀察到 xhigh 比 max 多 3 分,而且 xhigh 的分數比 GPT-6 Astra 還高 1 分、成本卻不到 15%。這顯示「最高檔」不一定是最好的檔:思考太久可能過度推理、繞路,反而降低結果。工程上的權衡是:旋鈕不是越大越好,必須對自己的任務做掃描實驗,找出甜蜜點。我們沒有報告提供的原因說明,不宜擅自斷言機制,但結論——要實測、不要預設最高檔最佳——是站得住腳的。
🔭 模型 7 天就換代,這對系統架構設計意味著什麼?
如果你把模型名稱寫死在程式各處,每次換代都要大改。有經驗的人會把模型名稱、努力程度、價格放進設定檔,並保留一套固定的小型測試題(回歸測試),換模型時先跑一遍,比較品質與成本再切換。此外,幻覺率從 60% 降到 54% 仍然偏高,意味著即使新模型更強,關鍵流程仍需要人工覆核或查證機制,不能因為分數高就拆掉安全網。
📝 隨堂考(點選答案,立即回饋)
Q1. 依報告,GPT-6.1 Sol 在最高努力程度下的每項任務成本,大約是 GPT-6 Astra 的多少?
✅ 0.72 美元對 3.26 美元,約 22%,確實不到四分之一。
Q2. GPT-6.1 Sol 的每百萬 token 價格相較 GPT-6 Sol 有什麼變化?
✅ 報告指出價格維持 2 美元與 10 美元,僅快取讀取折扣上調,所以整體混合價格略低。
Q3. GPT-6.1 Sol 的輸出 token 比 GPT-6 Sol 多約 10% 到 30%。這代表什麼?
✅ 輸出 token 多會推高費用,但報告的每項任務成本仍低了 31%,所以要看端到端的總成本,而不是單一項目。
Q4. 「帕雷托前緣」上的點代表什麼?
✅ 前緣是指沒有任何其他點能同時更便宜又更聰明,報告說 GPT-6.1 Sol 各努力程度都推進了這條前緣。
🃏 翻牌記憶卡(先想答案,再點開對答)
每項任務成本(Cost per Task)是什麼?點我翻面
模型做完一項評測任務所花的總美元(含輸入與輸出),比只看每百萬 token 單價更貼近真實帳單。
GPT-6.1 Sol 與 GPT-6 Astra 的智慧指數差距?點我翻面
只差 1 分,但最高努力程度的每項任務成本不到 Astra 的四分之一(0.72 對 3.26 美元)。
快取讀取折扣提高的影響?點我翻面
從 90% 升到 95%,重複送同一段長開頭的工作(如 agentic 工作流)實際帳單會略低。
為什麼不能只看單價選模型?點我翻面
輸出 token 用量不同(這次多 10% 到 30%),真實成本是單價乘以用量,要看每項任務總成本。
xhigh 與 max 的發現?點我翻面
在 Coding Agent Index 上,xhigh 比 max 高 3 分,且 GPT-6.1 Sol xhigh 比 Astra 高 1 分、成本不到 15%,最高檔不一定最好。