🚨 AI-LECTURER 快訊速報|2026-09-24|5 分鐘速讀

🚨 OpenAI 推出 GPT-6 Sol 與 Luna:兩個平價新型號,API 價格較 GPT-5.6 促銷價再降 50%

取材:GPT-6 Sol and Luna(Hacker News(AI 高人氣))|完整課同日跟進,見書架
📍 真實場景
12 人電商公司的後端工程師小陳,負責客服自動回信系統

月底對帳單時發現,客服機器人每天呼叫旗艦模型處理大量來信,API 費用已逼近老闆給的預算上限

😖 卡住的地方:想換便宜一點的模型省錢,又怕答錯客人的問題被客訴;官方每次都說「更強又更便宜」,卻沒人告訴他該怎麼判斷這次是不是真的值得換
💡 讀完你能用 30 分鐘、20 個自己的真實題目,算出 Sol 或 Luna 換下現用模型到底省多少、錯多少,再決定要不要換

⚡ 一句話講清楚

OpenAI 本月稍早推出旗艦模型 GPT-6 Astra,官方稱它是目前最聰明、也最符合人類期望(對齊讓模型的行為符合人類的期望與安全要求)的模型。但不是每份工作都需要旗艦:有的要求快,有的預算緊。所以這次 OpenAI 在 Astra 之外,再推出兩個平價型號——GPT-6 Sol 與 GPT-6 Luna。官方說它們用和 Astra 相似的方法訓練,把 Astra 在專業工作、事實正確性、寫程式、操作電腦上的進步,帶到更快、更便宜的模型上;至於最吃重、最重要的專案,官方仍建議選 Astra。

這則消息的重點在價錢。API 是讓你的程式直接呼叫模型的介面,費用按 token模型處理文字時切出的小碎片,計費就是按碎片數量算 計價,價格以每 100 萬個 token 為單位。OpenAI 說 Sol 與 Luna 的 API 價格,比它們在 GPT-5.6 時期的促銷價再降 50%,原因是 快取把重複用到的內容先存起來,下次不必重新計算 與推論(模型實際運算的過程)效率改善,成本降了就直接讓利給用戶。要注意兩件事:這個降幅是跟「促銷價」比,不是跟正式標價比;而我們拿到的文章節錄裡沒有價格表,實際單價得去官方頁面確認。

官方也放出一批數字,但這些都是 OpenAI 自己的測試結果。在 AutomationBench(模擬跨多個應用程式的企業工作流程,屬於 基準測試一份固定的考卷,讓不同模型考同樣的題目來比分數)上,Sol 在 xhigh(極高)推理強度模型回答前「想多久」的檔位,檔位越高通常越準,但也越貴越慢 下,表現勝過 Claude Opus 5 的最高強度,每題成本卻只有 Opus 5 的 9%;Luna 在 high 強度下比上一代高 5.4 個百分點,每題成本低 58%。另一個測試 Agents' Last Exam 上,Sol 在最高強度得 56.4%,高於 Opus 5 在該測試的最高分,每題成本低 60%。事實正確性方面,官方用「使用者標記過模型答錯」的真實對話(已去識別化)做內部測驗,Sol 的錯誤約為前代的一半。

🏃 快速上手三步(今天就能做)

1
查:算出你自己的真實單價打開官方發表頁 https://openai.com/index/introducing-gpt-6-sol-and-luna/ ,找到「Prices are per 1 million tokens」下方的價格表,把 Sol、Luna 與你現在用的型號的「輸入單價」和「輸出單價」抄進試算表。每次呼叫成本 =(輸入 token 數 × 輸入單價 + 輸出 token 數 × 輸出單價)÷ 1,000,000。注意官方說的「降 50%」是相對 GPT-5.6 促銷價,不一定等於相對你現在帳單的降幅,所以一定要拿你自己的帳單單價來比。
2
試:用你自己的 20 題實測從真實工作裡挑 20 個有代表性的任務(例如客服來信、要整理的報表),把同一批題目分別丟給你現用的模型、Sol、Luna,各跑一次,並固定同一檔推理強度。從 API 回應的 usage 欄位記下輸入與輸出的 token 數,套用上一步的公式算出每題成本,再人工給每題標「對/錯」。模型代號請照官方 models 清單填寫,不要用猜的(本次素材沒有給出確切代號)。
3
判:用門檻決定換不換,並避開陷阱建議門檻(可依風險調整):答對數與現用模型只差 1 題以內、且每題成本明顯較低,就先切 10% 流量觀察一週;差 2 題,再多測 20 題;差 3 題以上,該任務留在原模型。三個陷阱:一,官方基準測試是 OpenAI 自家公布,不能當成你場景的保證;二,調高推理強度會讓單題成本上升,比較時要用「同強度」或「同總成本」;三,出錯代價高的任務(金額、法規、醫療)別為了省錢硬換,官方自己也說要最好結果就選 Astra。

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 「每題成本只有 9%」這種數字,能直接拿來估你的帳單嗎?
不能直接套用。這個數字是 OpenAI 在特定測驗、特定推理強度、自家計價下量出來的「每題成本」,比較對象也是自己挑的競品。你的實際成本 = 單價 × token 數,而 token 數取決於你的任務:輸入很長、輸出很短的工作和反過來的工作,成本結構完全不同;推理強度越高,通常會多花 token 在「思考」上。另外官方提到快取降低了成本,你的請求若有大量重複的前綴(例如固定的系統提示),受益會比較大;每次內容都不同的請求則不一定。權衡是:官方數字用來決定「值得測」,你自己的 20 題實測才用來決定「要不要換」。
🔭 Astra、Sol、Luna 三個型號,工程上該怎麼分工?
三個型號等於官方給你一條成本對智力的選擇曲線,資深工程師通常會依「出錯代價」分層:高風險或極複雜的任務走 Astra;一般複雜的工作流程走 Sol;大量、簡單、可容錯的任務走 Luna,並加上自動驗證(例如檢查輸出格式)與抽樣人工複核,必要時設定「Luna 不確定就升級到 Sol」的規則。官方說 Sol 的錯誤約為前代一半,但那是相對前代、沒有給絕對錯誤率,所以不代表可以省略驗證。代價是多一層路由邏輯、每個型號都要維護自己的評測題庫,而且三個型號都來自同一家供應商,價格或政策一變(這次降價本身就是跟「促銷價」比),你的成本也跟著變。建議把模型名稱與強度檔位放進設定檔,不要寫死在程式裡,之後要調整或換家才不用改程式。