AI-LECTURER 速報課|2026-09-30|約 25 分鐘

GPT-6.1 Sol:接近最強 Astra 的實力,價格只要五分之一——代理人成本怎麼算才划算?

取材:GPT 6.1 Sol: Near-Astra intelligence for a fifth of the price(Hacker News(AI 高人氣))
📍 真實場景
阿哲,32 歲,一家 30 人小型電商 SaaS 公司的後端工程師,負責維護公司自己做的「自動修 bug 小幫手」

他讓 AI 代理(自己一步步呼叫工具、改程式碼的 AI 程式)每天處理 200 張程式錯誤單,每張單要來回請求模型十幾次,每次都要把整個專案說明重新丟給模型。

😖 卡住的地方:月底帳單比預期高很多,老闆問:「換最強的 Astra 要多花多少?換便宜的 Sol 會不會變笨?」阿哲手上只有一堆看不懂的價格表,不知道該怎麼算。
💡 這課給你一套算帳方法:看懂 GPT-6.1 Sol 的價格結構(特別是快取輸入只要每百萬 token 0.10 美元),並用一個小計算機親手比較「有快取」和「沒快取」差多少。

🧭 這到底是什麼(白話版)

OpenAI 推出 GPT-6.1 Sol,是 GPT-6 Sol 的升級版。官方說法是:在代理式寫程式讓 AI 自己讀程式碼、改檔案、跑測試、再修正,而不是只回答一句話、電腦操作AI 像真人一樣看螢幕、點按鈕、操作應用程式和專業工作上,它「幾乎追上」最強的 GPT-6 Astra,但標準的輸入與輸出 tokenAI 計費與讀寫的最小單位,大約是一個字或半個字 價格只有 Astra 的五分之一。

第二個重點是「快取輸入」。快取輸入如果你這次送的開頭內容和上一次一模一樣,模型就不必重新讀,可以用折扣價計費每百萬 token 只要 0.10 美元,比標準輸入便宜 95%,也比 GPT-6 Sol 自己的快取價再便宜 50%。從這兩個比例可以反推:標準輸入約 2.00 美元/百萬 token,GPT-6 Sol 的快取價約 0.20 美元。

官方拿幾個基準測試一套固定的考題,讓不同模型考同一份,比較分數與花費來說明。DeepSWE v1.1(真實程式庫裡的複雜軟體工程任務)上,Sol 6.1 的分數與 Astra 相當,成本約五分之一。AutomationBench(多步驟商務流程)比 Opus 5.5 高 2.2 個百分點,成本約三分之一。Terminal-Bench Science 0.1(資料分析、模擬、定理證明)在最高推理強度下,平均每題 5.47 美元,Opus 5.5 是 23.21 美元,Astra 是 23.80 美元。

但官方也坦白:最難的科學研究任務上,Astra 仍以 68.1% 拿到測試模型中的最高分,應該繼續用 Astra。所以這不是「Sol 取代 Astra」,而是「大部分日常工作可以用便宜很多的選擇」。

🎯 為什麼值得你花時間

代理人的帳單是被「重複讀」撐大的代理人每走一步就要再送一次請求,而每次請求開頭往往是同一份專案說明、工具清單和歷史紀錄。這些重複內容占了輸入的大部分,所以把快取輸入壓到 0.10 美元/百萬 token,比單純降低標準價更影響總成本。
「差不多好」加「便宜五倍」改變選型邏輯以前常見做法是先用最強模型確保成功率。現在官方數據顯示,在 DeepSWE v1.1 這類真實程式任務上,Sol 6.1 與 Astra 分數相當、成本約五分之一,代表大多數日常任務可以預設用 Sol,只有最難的才升級到 Astra。
數字要看「每題成本」而非只看單價官方用「每題平均成本」比較(例如 5.47 美元對 23.80 美元,低了約 77%),因為模型思考越久、輸出越多,費用越高。單價只是其中一個因素,真正決定帳單的是完成一件工作總共花了多少 token。

⚙️ 它是怎麼運作的

1
代理人送出第一次請求把「專案說明、工具清單、任務描述」一起送給模型。這一次整份內容都按標準輸入價計費,同時系統記住這段開頭。
▼
2
模型回應並呼叫工具模型讀完後決定下一步,例如「去跑測試」,輸出的字數按輸出價計費(輸出通常比輸入貴)。
▼
3
工具結果回來,再送第二次請求新請求的開頭仍是同一份專案說明,後面才接上新的工具結果。開頭相同的那一段可以走快取輸入價(0.10 美元/百萬 token),只有新增的部分照標準價算。
▼
4
重複直到任務完成步驟越多,「被快取的重複內容」累積越多,省下的錢越多。這也是官方特別強調快取價的原因:讓開發者能建構並執行「跨請求重複使用上下文」的代理人。
▼
5
依難度挑選模型日常工作用 Sol 6.1 省錢;官方明講最困難的科學研究任務應使用 Astra。選型的關鍵是先估算任務難度與失敗代價。
官方文中的成本與表現比較(只列原文提到的數字)
測試項目GPT-6.1 Sol 的表現成本重點
DeepSWE v1.1(真實程式庫軟體工程)與 GPT-6 Astra 相當;比 GPT-6 Sol 最佳分數高 6.4 個百分點約 Astra 的五分之一
GDP.pdf(複雜 PDF 專業問答)高於 Opus 5.5(含 fallback);接近 Astra每題不到 Opus 5.5 的一半;約 Astra 的五分之一
AutomationBench(多步驟商務流程)中等推理強度下比 Opus 5.5 高 2.2 個百分點;比 GPT-6 Sol 高 4.8 個百分點約 Opus 5.5 的三分之一
OSWorld 2.0 離線集(電腦操作)最高推理強度下比 GPT-6 Sol 高 7 個百分點;離 Astra 差 2.1 個百分點比 GPT-6 Sol 便宜一半以上;約 Astra 的七分之一
Terminal-Bench Science 0.1(科學工作流程)最高推理強度下分數超過 GPT-6 Sol 的兩倍;Astra 仍最高(68.1%)每題 5.47 美元,Opus 5.5 為 23.21 美元,Astra 為 23.80 美元

🔍 程式碼漫遊(點有 ● 的行看白話講解)

這段小程式用官方公布的 0.10 美元快取價,估算一個代理人任務跑很多步時,有快取和沒快取的輸入費用差多少。輸出價官方摘錄沒有提供,所以程式只算輸入部分。

●PRICE_IN = 2.00 # 標準輸入,美元/百萬 token(由「快取價便宜 95%」反推)
💬 0.10 美元是標準價的 5%,所以標準價 = 0.10 ÷ 0.05 = 2.00 美元。這是推算值,不是官方直接寫出的數字。
●PRICE_CACHED = 0.10 # 快取輸入,美元/百萬 token(官方公布)
💬 官方明寫:快取輸入每百萬 token 只要 0.10 美元。
●def input_cost(steps, ctx, new, use_cache):
💬 steps 是代理人請求次數,ctx 是每次都重複的開頭 token 數,new 是每次新增的 token 數。
● first = (ctx + new) * PRICE_IN / 1e6
💬 第一次請求沒有快取可用,整份內容都按標準價算。
● ctx_price = PRICE_CACHED if use_cache else PRICE_IN
💬 重點行:後續請求裡重複的開頭,有開快取就用 0.10,沒開就仍用 2.00。
● rest = (steps - 1) * (ctx * ctx_price + new * PRICE_IN) / 1e6
💬 新增內容永遠按標準價;只有「重複開頭」享有折扣。這就是為什麼提示詞要把固定內容放前面、變動內容放後面。
● return first + rest
💬 回傳整個任務的輸入費用(美元)。
●print(input_cost(15, 40000, 2000, False), input_cost(15, 40000, 2000, True))
💬 試算:15 步、每次重複 4 萬 token、新增 2 千 token。你會看到有快取的費用明顯更低。

🛠️ 動手做:代理人輸入成本計算機:快取到底省多少?

  1. 先不改數字,按「計算」,看「沒快取」和「有快取」兩個輸入費用差多少。
  2. 把「請求次數」從 15 改成 3,再改成 40,觀察省下的比例怎麼變(步驟越多,快取越划算)。
  3. 把「每次重複的開頭 token」調大到 100000,再調小到 5000,想想:提示詞裡固定內容占比高,快取效益會怎樣?
  4. 把「快取價」改成 0.20(GPT-6 Sol 的快取價,由官方「便宜 50%」反推),和 0.10 比較。
  5. 輸出價官方摘錄沒有公布,欄位預設值只是示範數字,請換成你實際查到的價格再判斷。
👇 下面是活的,直接操作

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 為什麼「快取價」比「標準價」更影響代理人的總成本?
代理人每一步都會把固定開頭重送一遍,請求次數越多,重複內容的累積量就越大。官方把快取輸入降到 0.10 美元(比標準輸入便宜 95%),等於直接壓低最大宗的重複支出。資深工程師會把這視為架構訊號:提示詞應該設計成「固定內容在前、變動內容在後」,才能吃到折扣;反過來,如果每次都把時間戳記或隨機內容放在最前面,快取就會失效。
🔭 「幾乎追上最強模型」該怎麼解讀,才不會被行銷話術騙?
官方數據顯示:DeepSWE v1.1 上與 Astra 相當、OSWorld 2.0 離線集差 2.1 個百分點,但 Terminal-Bench Science 0.1 上 Astra 仍以 68.1% 領先,且官方自己說最難的科學研究要用 Astra。這代表差距集中在「最難的尾端」。工程上的做法是分層路由:大多數任務走便宜模型,只有失敗代價高或難度極高的才升級。取捨在於路由判斷本身也要花成本,判斷錯了就可能讓難題落在弱模型手上。
🔭 為什麼官方用「每題成本」和不同推理強度做比較,而不是只報單價?
同一個模型在「最高推理強度」會想得更久、花更多 token,單價相同但每題成本差很多。官方把分數和每題成本放在一起(如 5.47 美元對 23.80 美元),是因為使用者真正在意的是「解決一個問題要花多少錢、成功率多少」。資深工程師會建議自己拿真實任務重測,因為官方基準測試不一定反映你的資料,單價只是成本公式的一項。

📝 隨堂考(點選答案,立即回饋)

Q1. 官方說快取輸入每百萬 token 0.10 美元,比標準輸入便宜 95%。由此可推算標準輸入價約是多少?
✅ 便宜 95% 表示快取價是標準價的 5%。0.10 ÷ 0.05 = 2.00 美元。
Q2. 官方說快取價比 GPT-6 Sol 的快取輸入價便宜 50%,那 GPT-6 Sol 的快取價約是多少?
✅ 0.10 是舊價的一半,所以舊價是 0.10 × 2 = 0.20 美元。
Q3. Terminal-Bench Science 0.1 最高推理強度下,Sol 6.1 平均每題 5.47 美元,Astra 是 23.80 美元。成本大約降低多少?
✅ 5.47 ÷ 23.80 約 0.23,也就是只花 23%,省下約 77%,與官方說的「低超過 75%」一致。
Q4. 根據原文,哪種情況仍建議使用 GPT-6 Astra?
✅ 原文明說 Astra 在 Terminal-Bench Science 0.1 拿到 68.1% 的最高分,應用在最困難的科學研究任務。
Q5. 為了讓代理人吃到快取折扣,提示詞(送給模型的內容)最合理的排列方式是?
✅ 快取要求「開頭相同」才算命中,所以固定內容(專案說明、工具清單)放前面,新結果接在後面。

🃏 翻牌記憶卡(先想答案,再點開對答)

GPT-6.1 Sol 的定位是什麼?點我翻面
接近 GPT-6 Astra 的代理式寫程式、電腦操作、專業工作能力,但標準輸入與輸出價格約為 Astra 的五分之一。
快取輸入的價格與折扣幅度?點我翻面
每百萬 token 0.10 美元,比標準輸入便宜 95%,比 GPT-6 Sol 的快取價便宜 50%。
快取輸入為什麼對代理人特別重要?點我翻面
代理人每一步都重送相同的開頭內容,快取讓這些重複部分用折扣價計費,步驟越多越省。
官方在哪類任務上仍推薦 Astra?點我翻面
最困難的科學研究任務;Terminal-Bench Science 0.1 上 Astra 得分 68.1%,是測試模型中最高。
為什麼要比較「每題成本」而不只是單價?點我翻面
推理強度與輸出長度會改變總 token 數,實際帳單取決於完成一個任務總共花了多少,單價只是其中一項。

✅ 離開前自測(全勾=這課真的學會了)

0%