🚨 AI-LECTURER 快訊速報|2026-09-30|5 分鐘速讀

🚨 GPT-6.1 Sol 登場:接近最強 Astra 的能力,價格只要約五分之一

取材:GPT 6.1 Sol: Near-Astra intelligence for a fifth of the price(Hacker News(AI 高人氣))|完整課同日跟進,見書架
📍 真實場景
小雅,接案的網頁工程師,自己做了一個會自動幫客戶修 bug 的程式代理人(agent)

每天讓代理人讀客戶的程式碼、改檔案、跑測試,一個月下來 API 帳單快要比接案收入還高

😖 卡住的地方:最強的模型很準但很貴;便宜的模型又常常改錯,她一直在「準確」和「省錢」之間二選一
💡 讀完你能判斷自己的工作該不該換成 GPT-6.1 Sol,並用三個小步驟在今天實測出省多少錢

⚡ 一句話講清楚

OpenAI 推出了 GPT-6.1 Sol,是舊版 GPT-6 Sol 的升級。它的定位很明確:能力幾乎追上 OpenAI 最強的模型 GPT-6 Astra,但每用一次的費用大約只有 Astra 的五分之一。你可以把 Astra 想成「請資深顧問」,Sol 則是「請一位快追上顧問水準的中堅幹部」,價差很大,做事品質卻差不多。

官方用幾個測試來證明。在 DeepSWE v1.1(基準測試一組固定的考題,讓不同 AI 做同樣的題目再比分數,這一題考的是在真實程式專案裡修改程式)中,GPT-6.1 Sol 和 Astra 打成平手,成本卻約只有五分之一。在 AutomationBench(考 AI 能不能把多步驟的公司流程做對)中,它比 Opus 5.5 高 2.2 個百分點,成本約三分之一。在 OSWorld 2.0(考 AI 能不能像人一樣操作電腦軟體)中,離 Astra 只差 2.1 個百分點,每個任務成本約七分之一。注意:這些數字都是 OpenAI 自己公布的,還沒有獨立第三方驗證。

另一個重點是「快取輸入」(快取輸入你重複送給 AI 的內容,例如一大份說明書,第二次以後 AI 會用折扣價計費):每百萬個 token(tokenAI 計費用的文字單位,大約一個中文字到兩個中文字算一個)只要 0.10 美元,比一般輸入價便宜 95%,也比舊版 Sol 的快取價便宜一半。代理人每一輪都會重複帶著同一大包背景資料,所以這個折扣對它特別有感。但要小心:官方也承認,最難的科學研究任務(Terminal-Bench Science,Astra 得 68.1%)仍然應該用 Astra,Sol 不是全面取代。

🏃 快速上手三步(今天就能做)

1
查:先算出你目前的花費結構打開你使用的 API 後台(例如 OpenAI 的 Usage 頁面),把最近 7 天的帳單依模型拆開,找出哪一種任務花最多(寫程式?讀文件?操作流程?)。再抓出「輸入 token」和「輸出 token」的比例,以及有多少輸入是每次都重複的內容。重複比例越高,快取價 0.10 美元/百萬 token 對你越划算。今天先做到寫下一個數字:『我每週約花多少錢在最貴模型上』。
▼
2
試:拿 10 個真實任務做 A/B 對照從你過去做過的任務中挑 10 個(含 3 個你覺得最難的),用同一份提示詞(prompt)分別送給你現在用的最強模型和 GPT-6.1 Sol,模型名稱以官方文件列出的為準。每個任務記三件事:結果對不對(能跑過你原本的測試就算對)、花了多少錢、花了多久。若你的工具可以調「推理強度」(reasoning effort,讓 AI 多想或少想的設定),先用中等強度,因為官方的多數比較也是在中等強度下進行。
▼
3
注意:設好分流規則,別全部一次換判斷標準:10 個任務中 Sol 答對數 ≥ 舊模型的 90%,且單次成本低於一半,就先把「日常、量大、有測試可驗證」的任務改用 Sol。最難的任務(大型重構、科學計算、需要高度嚴謹的分析)仍留給 Astra 或同級模型。同時記得:官方評測是廠商自己報的數字,你的專案才是真正的考場;換之前保留一個能隨時切回舊模型的設定開關。

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 「幾乎一樣強、只要五分之一價錢」對系統架構代表什麼?
最直接的影響是「模型分流」(model routing)變得更值得做:大部分請求走 Sol,只有 Sol 失敗或任務被判定為高難度時才升級到 Astra。代價是你要多維護一層判斷邏輯與失敗重試,並持續監控兩邊的品質差。以官方數字看,差距在不同任務上不一致(DeepSWE 打平、OSWorld 差約 2 個百分點、科學任務 Astra 仍領先),所以分流規則應依任務類型而不是一刀切。另外,價格降到這個程度,過去因為太貴而不敢做的功能(每次動作都讓 AI 多檢查一遍)會開始變得可行,但總花費可能因為用量變大而不降反升,要設預算上限。
🔭 0.10 美元的快取價,會怎麼改變你設計提示詞與代理人的方式?
快取只在「前面一大段內容完全相同」時才會命中,所以要把固定不變的內容(系統指令、工具說明、專案背景)放在提示詞最前面,會變動的內容(使用者這一輪的問題)放最後;任何在前段插入時間戳、隨機 ID 的習慣都會讓快取失效。好處是長對話、多輪代理人的成本大幅下降,可以放心帶更完整的上下文,減少因資訊不足而出錯的重試。風險是快取通常有存活時間限制,且你會對這個計價方式產生依賴,若之後價格調整或換供應商,成本模型要重算;建議把『快取命中率』當成一個要長期監控的指標。