AI-LECTURER 速報課|2026-08-13|約 27 分鐘

Grok 4.6 拚進第一梯隊:分數只差一點,帳單可能差好幾倍

取材:Grok 4.6 scores 61 on the Artificial Analysis Intelligence Index(Hacker News(AI 高人氣))
📍 真實場景
廷維,一人接案的自動化工程師,專門幫中小企業客戶架設 AI 客服與文件審核的代理型流程

正在幫一個客戶把 24 小時銀行客服機器人,從原本用的模型換成別家,想在不犧牲品質的前提下把每月帳單壓下來

😖 卡住的地方:手上有兩三家模型可以選,供應商的介紹頁都說自己「跑分最高」,但報價方式是「每百萬 token 多少錢」,跟客戶實際「一天要跑幾百次多輪對話」完全兜不起來,換算不出真正的月費差距,只能憑感覺猜
💡 這課會用 Grok 4.6 這次公開評測揭露的完整數據,教你怎麼把「跑分」換算成「你自己場景下的月費」,並用一個試算工具實際感受兩顆模型的帳單能差到幾倍

🧭 這到底是什麼(白話版)

Grok 4.6 是 SpaceXAI(馬斯克旗下 AI 團隊)在近期推出的最新旗艦模型,這次成績單上的重點數字是 61 分——這是它在 Intelligence Index(智慧指數)由 Artificial Analysis 這個第三方評測機構,把好幾套 AI 能力測驗的結果合併算成的單一分數,方便不同家模型互相比較整體聰明程度 拿到的分數,一口氣追平了 OpenAI 的 GPT-5.6 Sol,只落後 Claude Opus 5(63 分)與 Claude Fable 5(62 分)一點點。距離上一代 Grok 4.5 發布才過一個多月,就多拿了 5 分;比起再上一代 Grok 4.3,更是進步了 23 分。

但這篇報告真正有意思的地方,不在總分本身,而在它怎麼測「agentic(代理型)讓 AI 不只是回答一個問題,而是自己規劃步驟、呼叫工具、一輪一輪把一整件任務從頭做到尾 能力」。Artificial Analysis 額外設計了三套情境題:GDPval-AA v2(模擬真實知識工作)、τ³-Banking(多輪銀行客服並要求正確呼叫工具)、Terminal-Bench v2.1(在終端機裡完成軟體任務)。Grok 4.6 在 GDPval-AA v2 拿下 Elo 分數原本是幫西洋棋選手打分的方式,這裡借來讓不同 AI 模型的作答結果兩兩比較,分數愈高代表愈常「贏」對手 1753 分,只輸給 Claude Opus 5;在 τ³-Banking 拿 50.7%,是前兩名;在 Terminal-Bench v2.1 拿 88.4%,跟最強的一批模型同一水準。

更關鍵的是「花多少代價換到這個成績」。Grok 4.6 的定價維持 Grok 4.5 原本的每百萬 tokenAI 讀寫文字時的計費最小單位,大約是一個字或詞的片段,輸入、輸出都要另外算錢 輸入 2 美元、輸出 6 美元,比 Claude Opus 5 的 5/25 美元便宜六成以上;平均每個任務只花約 0.84 美元,跟同樣便宜的 Kimi K3 打平,但智慧分數更高一點。它的 context window(上下文視窗)AI 一次能「記住」多少內容的容量上限,超過這個量,前面說過的內容就會被忘記 維持 50 萬 token 沒有變大——這次進步的重點,不是記憶力變大,而是把同樣的視窗用得更有效率:在 AA-Briefcase 這個長任務基準上,Grok 4.6 平均只要 53 turn(輪次)代理型任務裡,AI 每次「想一步、做一步」算一輪,輪數愈多代表繞的路愈多、花的錢通常也愈多、燒掉約 5 億輸入 token 就能完成一項任務,Claude Opus 5 卻要 103 輪、燒掉約 20 億輸入 token 才能做完類似的事。

這也是為什麼 Artificial Analysis 說 Grok 4.6 落在「Pareto frontier(帕累托前緣)在『智慧分數』和『花費』這兩個目標中,找不到其他選項能同時做得更聰明又更便宜的那一群『最划算』選擇」上:在目前幾乎所有的代理型評測項目裡,沒有其他模型能同時比它聰明又比它便宜。唯一要注意的是,cache hit(快取命中)如果同一段內容之前已經送給模型算過一次,之後重複用同一段時,只用便宜很多的價格計費,不用整段重新算 的價格從 Grok 4.5 的每百萬 token 0.3 美元漲到了 0.5 美元——這對重度使用代理型迴圈、上下文常常被重複送進模型的應用來說,是需要重新算一次帳的細節。

🎯 為什麼值得你花時間

跑分要看「相對哪個維度」61 分只代表整體排名往上爬,但這篇文章真正的重點在於:智慧分數相近的模型,完成同一件代理型任務所需的輪次跟成本,可以差好幾倍——這是選型時最容易被忽略的一塊。
定價打平,但快取悄悄漲價headline 價格從 Grok 4.5 沿用不變(每百萬 token 輸入 2 美元、輸出 6 美元),但快取命中價格從 0.3 美元漲到 0.5 美元,對重度依賴快取的代理型應用來說,真實負擔其實變了。
帕累托前緣是選型的實用工具把「智慧分數」和「每任務成本」畫成散佈圖,能一眼看出誰是「同樣聰明但更便宜」或「同樣便宜但更聰明」的選項,而不是被單一排行榜名次綁架決策。

⚙️ 它是怎麼運作的

1
先用綜合題庫打出 Intelligence Index把模型丟進涵蓋推理、知識、程式等的標準化題庫,統一轉換成一個分數當作「整體聰明程度」的量尺,Grok 4.6 這次拿 61 分。
2
再用真實工作場景單獨測代理型能力另外設計 GDPval-AA v2(真實知識工作)、τ³-Banking(多輪銀行客服含工具呼叫)、Terminal-Bench v2.1(終端機操作)三套情境題,看模型能不能真的把一件事從頭做到尾,而不只是回答單題。
3
用 Elo 分數算出誰比較常贏在 GDPval-AA v2 這類測驗裡,讓不同模型的作答結果兩兩比較,用 Elo 分數系統算出相對強弱,Grok 4.6 拿下 1753 分,僅次於 Claude Opus 5。
4
記錄完成一件任務要花幾輪、燒多少 token在 AA-Briefcase 這個長任務基準裡,同時記下模型平均要來回幾輪、燒掉多少輸入 token 才能做完——Grok 4.6 約 53 輪、5 億輸入 token;Claude Opus 5 約 103 輪、20 億輸入 token。
5
把智慧分數跟每任務成本畫成散佈圖找帕累托前緣橫軸放花費、縱軸放智慧分數,找出沒有其他選項能同時更聰明又更便宜的那一群模型,Grok 4.6 就落在這條線上。
各模型智慧分數與代理任務數據比較(皆出自原文,未提供的欄位如實標註)
模型Intelligence Index定價(input/output,每百萬 token)備註
Grok 4.6612/6 美元GDPval-AA v2 Elo 1753;每任務成本約 0.84 美元;快取命中 0.5 美元/百萬 token
GPT-5.6 Sol(max)與 61 同級(原文未單獨列出精確分數)5/30 美元OpenAI 陣營,原文稱 Grok 4.6 與其「同級」
Claude Opus 5(max)63(目前最高)5/25 美元GDPval-AA v2 Elo 僅次於它排第一;AA-Briefcase 平均約 103 輪、20 億輸入 token
Claude Fable 5(max with fallback)62原文未提供GDPval-AA v2 Elo 與 Grok 4.6、Qwen3.8 Max 信賴區間重疊,統計上難分高下
Kimi K3略低於 61(原文未提供精確分數)原文未提供每任務成本同為約 0.84 美元

🛠️ 動手做:Grok 4.6 vs Claude Opus 5:代理型任務月費試算工具

  1. 在「每日任務量」欄位輸入你想像中一天要跑幾個像文中 AA-Briefcase 這樣的長任務代理型工作
  2. 在「平均輪次」欄位輸入你預期任務需要 AI 來回幾輪才能做完,可以先用文中 Grok 4.6 的 53 輪或 Claude Opus 5 的 103 輪試算,感受落差
  3. 按下「試算月費」,查看兩顆模型的預估月費、輸入 token 總量與成本倍數差異
  4. 讀一下試算結果下方的備註:理解為什麼「線性估算」跟文中揭露的實際每任務成本(0.84 美元)會有落差——這正是本課 lens 想帶你看懂的重點
  5. 試著把「每日任務量」拉高(例如 100),或把「平均輪次」拉低(例如 20),觀察哪一個變數對月費差距影響更大
👇 下面是活的,直接操作

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 Grok 4.6 只多一點智慧分數,為什麼能換來遠低於對手的實際帳單?
文中揭露 Claude Opus 5 平均要花 103 輪、20 億輸入 token 才能完成一件 AA-Briefcase 任務,Grok 4.6 只要 53 輪、5 億輸入 token。這說明「聰明」跟「省錢」是兩個不同維度:分數只差 2 分(61 對 63),但完成同一件事所花的輪次與 token 卻差了將近一倍。資深工程師選型時不會只看排行榜名次,而是會回頭問「這個分數是花多少代價換來的」——這正是文中帕累托前緣概念想表達的重點。
🔭 快取命中價格從每百萬 token 0.3 美元漲到 0.5 美元,對哪種使用者影響最大?
代理型迴圈的本質是同一段上下文被反覆送進模型,快取命中比例高的重度代理型應用(例如一直重讀同一份長文件、同一個系統提示)對快取單價特別敏感;反之只做少量問答、幾乎不重複上下文的應用幾乎不受影響。看定價表不能只看 headline 的每百萬 token 價格,要回頭比對自己的使用模式落在哪一格。
🔭 文中揭露 Grok 4.6 實測每任務成本是 0.84 美元,但如果只用「定價 × 輸入 token 數」線性估算,算出來的數字通常會高很多,這代表什麼?
線性估算沒有考慮 prompt caching 大幅降價、也沒考慮並非每一輪都要重新處理整個上下文視窗。工程選型時的粗估公式(像本課的試算工具)只能拿來做「量級比較」,正式上線前一定要拿真實流量跑一次小規模測試,不能只憑供應商公布的 headline 數字直接編預算。
🔭 context window 沒有變大(仍是 50 萬 token),但代理型任務分數大幅進步,說明了什麼設計取捨?
這代表這次進步的重點不在「記憶容量」,而在「怎麼更有效率地在有限視窗內完成多輪工具呼叫」——也就是規劃與工具使用策略的優化,而不是單純堆高上下文長度。這對工程師的啟示是:模型能力提升的來源要拆解清楚,不能簡單歸因成「視窗變大了」。

📝 隨堂考(點選答案,立即回饋)

Q1. Grok 4.6 在 Artificial Analysis Intelligence Index 拿下幾分?
✅ 文中明確寫出 Grok 4.6 拿下 61 分,加入以 GPT-5.6 Sol 為代表的第一梯隊,僅次於 Claude Opus 5(63)與 Claude Fable 5(62)。
Q2. 這次 Grok 4.6 進步,以下哪一項其實維持不變(沒有變大)?
✅ 文中寫明 context window 維持 50 萬 token,跟 Grok 4.5 一樣沒有變大;其餘三項分數都是這次進步的具體數字。
Q3. 文中提到的快取命中(cache hit)價格,從 Grok 4.5 的多少漲到 Grok 4.6 的多少(每百萬 token)?
✅ 文中寫「cache hits discounted to $0.5 per 1M tokens, an increase over Grok 4.5's $0.3 per 1M tokens for cache hits」。
Q4. 為什麼只看 Intelligence Index 排名,可能不足以做出好的選型決策?
✅ 文中舉出 Grok 4.6 約 53 輪、Claude Opus 5 約 103 輪才能做完同類任務,分數相近但效率跟成本差很多,這正是本課強調的重點。
Q5. 根據文中數據,Claude Opus 5(max)在 AA-Briefcase 長任務基準上,平均要花幾輪、消耗多少輸入 token 才能完成一項任務?
✅ 文中寫 Claude Opus 5(max)平均約 103 輪、約 20 億輸入 token,對比 Grok 4.6 的約 53 輪、約 5 億輸入 token。

🃏 翻牌記憶卡(先想答案,再點開對答)

Intelligence Index(智慧指數)點我翻面
把多套 AI 能力測驗結果合併算成的單一分數,方便比較不同模型的整體聰明程度;Grok 4.6 這次拿 61 分。
agentic(代理型)點我翻面
AI 不只回答問題,而是自己規劃步驟、呼叫工具,一輪一輪把整件任務做完。
Elo 分數點我翻面
借用西洋棋計分方式,讓模型的作答結果兩兩比較算出相對強弱;Grok 4.6 在 GDPval-AA v2 拿 1753 分。
cache hit(快取命中)點我翻面
重複用同一段先前送過的內容時,用比較便宜的價格計費;Grok 4.6 這項價格從每百萬 token 0.3 美元漲到 0.5 美元。
Pareto frontier(帕累托前緣)點我翻面
在智慧分數與花費之間,找不到其他選項能同時更聰明又更便宜的那群「最划算」選擇。
turn(輪次)點我翻面
代理型任務裡 AI「想一步、做一步」算一輪;Grok 4.6 平均 53 輪,Claude Opus 5 平均 103 輪才能完成同類任務。

✅ 離開前自測(全勾=這課真的學會了)

0%