他讓 AI 代理(自己一步步呼叫工具、改程式碼的 AI 程式)每天處理 200 張程式錯誤單,每張單要來回請求模型十幾次,每次都要把整個專案說明重新丟給模型。
OpenAI 推出 GPT-6.1 Sol,是 GPT-6 Sol 的升級版。官方說法是:在代理式寫程式讓 AI 自己讀程式碼、改檔案、跑測試、再修正,而不是只回答一句話、電腦操作AI 像真人一樣看螢幕、點按鈕、操作應用程式和專業工作上,它「幾乎追上」最強的 GPT-6 Astra,但標準的輸入與輸出 tokenAI 計費與讀寫的最小單位,大約是一個字或半個字 價格只有 Astra 的五分之一。
第二個重點是「快取輸入」。快取輸入如果你這次送的開頭內容和上一次一模一樣,模型就不必重新讀,可以用折扣價計費每百萬 token 只要 0.10 美元,比標準輸入便宜 95%,也比 GPT-6 Sol 自己的快取價再便宜 50%。從這兩個比例可以反推:標準輸入約 2.00 美元/百萬 token,GPT-6 Sol 的快取價約 0.20 美元。
官方拿幾個基準測試一套固定的考題,讓不同模型考同一份,比較分數與花費來說明。DeepSWE v1.1(真實程式庫裡的複雜軟體工程任務)上,Sol 6.1 的分數與 Astra 相當,成本約五分之一。AutomationBench(多步驟商務流程)比 Opus 5.5 高 2.2 個百分點,成本約三分之一。Terminal-Bench Science 0.1(資料分析、模擬、定理證明)在最高推理強度下,平均每題 5.47 美元,Opus 5.5 是 23.21 美元,Astra 是 23.80 美元。
但官方也坦白:最難的科學研究任務上,Astra 仍以 68.1% 拿到測試模型中的最高分,應該繼續用 Astra。所以這不是「Sol 取代 Astra」,而是「大部分日常工作可以用便宜很多的選擇」。
| 測試項目 | GPT-6.1 Sol 的表現 | 成本重點 |
|---|---|---|
| DeepSWE v1.1(真實程式庫軟體工程) | 與 GPT-6 Astra 相當;比 GPT-6 Sol 最佳分數高 6.4 個百分點 | 約 Astra 的五分之一 |
| GDP.pdf(複雜 PDF 專業問答) | 高於 Opus 5.5(含 fallback);接近 Astra | 每題不到 Opus 5.5 的一半;約 Astra 的五分之一 |
| AutomationBench(多步驟商務流程) | 中等推理強度下比 Opus 5.5 高 2.2 個百分點;比 GPT-6 Sol 高 4.8 個百分點 | 約 Opus 5.5 的三分之一 |
| OSWorld 2.0 離線集(電腦操作) | 最高推理強度下比 GPT-6 Sol 高 7 個百分點;離 Astra 差 2.1 個百分點 | 比 GPT-6 Sol 便宜一半以上;約 Astra 的七分之一 |
| Terminal-Bench Science 0.1(科學工作流程) | 最高推理強度下分數超過 GPT-6 Sol 的兩倍;Astra 仍最高(68.1%) | 每題 5.47 美元,Opus 5.5 為 23.21 美元,Astra 為 23.80 美元 |
這段小程式用官方公布的 0.10 美元快取價,估算一個代理人任務跑很多步時,有快取和沒快取的輸入費用差多少。輸出價官方摘錄沒有提供,所以程式只算輸入部分。
PRICE_IN = 2.00 # 標準輸入,美元/百萬 token(由「快取價便宜 95%」反推)PRICE_CACHED = 0.10 # 快取輸入,美元/百萬 token(官方公布)def input_cost(steps, ctx, new, use_cache): first = (ctx + new) * PRICE_IN / 1e6 ctx_price = PRICE_CACHED if use_cache else PRICE_IN rest = (steps - 1) * (ctx * ctx_price + new * PRICE_IN) / 1e6 return first + restprint(input_cost(15, 40000, 2000, False), input_cost(15, 40000, 2000, True))