AI-LECTURER 速報課|2026-07-26|約 26 分鐘

Claude Opus 5 上線:同樣的錢,效能怎麼跳一級?

取材:Introducing Claude Opus 5(Anthropic News)
📍 真實場景
34歲的新創技術主管敏潔,帶著3人工程團隊,同時得兼看程式品質與帳單金額

她正在評估要不要把團隊用的AI編程助手,從舊版模型升級成最新款,好讓自動code review跟修bug的流程更順手

😖 卡住的地方:老闆丟下一句「AI工具月費能不能壓低」,但過去每次為了省錢換成比較陽春的模型,反而常常要跑好幾輪才抓到問題,總時間跟算力花得更多
💡 這篇會告訴她:Anthropic剛發布的新旗艦模型Claude Opus 5,不是「更貴更強」的老套路,而是「同樣的錢、效能跳級」,還多了一個能自己調整「要想多深」的旋鈕,讓她不用再被迫在便宜與夠用之間二選一

🧭 這到底是什麼(白話版)

Anthropic(打造Claude系列AI的公司)最近發布了新一代旗艦模型Claude Opus 5。「旗艦模型」的意思是同一個產品系列裡最頂級、最強的那一顆,通常也是公司拿出來展示技術極限的招牌產品。這次最特別的地方,不是單純「分數更高」,而是跟前一代Opus 4.8相比,在基準測試(Benchmark)用一套固定的標準題目,替不同AI模型打分數,方便大家公平比較誰比較厲害上花一樣的錢,效能卻大幅跳升。

文章特別提到一個新設計,叫做effort setting(努力程度設定)讓使用者自己調整這次要AI「想多深」的一個旋鈕,想得越深通常越準,但也越花時間、越花錢。有了這個設定,同一顆模型就能同時服務「便宜、秒回答的日常小事」跟「不計代價也要做對的重要任務」,不需要為了省錢另外挑一顆比較笨的模型來用。

官方用多個跑分(評測基準)業界公認、拿來評比不同AI模型能力高低的標準化測驗證明這次升級不是紙上談兵:在寫程式與知識型工作的測驗上創下新高,在需要「解決從沒看過的全新問題」的ARC-AGI 3一種測試AI能不能應付陌生、沒練習過的新題型的評測,比較像檢驗「舉一反三」的能力,而不是看它背了多少題庫測驗中,分數是第二名模型的三倍。不過它也不是全能:在資安相關任務上,仍然輸給另一顆叫Mythos 5的模型,說明沒有一顆AI能在所有領域都稱王。

除了寫程式跟解題,Opus 5在生命科學研究生物、化學、醫學等自然科學的領域,這裡特別指用AI幫忙分析實驗數據的應用相關的測驗也全面贏過前代,尤其是從光譜學數據利用光和物質作用後產生的訊號,反推出分子結構長什麼樣子的化學分析技術反推分子結構、以及預測蛋白質序列變化如何影響功能這兩項,進步特別明顯。這代表這顆模型不只是「工程師的AI」,連做實驗、跑數據的科學家也用得上。

🎯 為什麼值得你花時間

同代升級不加價這不是「更貴但更強」的常見套路,而是「一樣的錢,效能跳一級」——文章寫得很清楚:Opus 5是在跟前代Opus 4.8「相同成本」下,效能大幅提升。對已經在用Claude Opus系列的團隊來說,等於直接白拿到效能升級。
多了一個「省錢開關」effort setting讓同一顆模型可以依任務重要性調整運算深度——重要任務開到最高(max),日常瑣事開低一點,一顆模型就能覆蓋所有預算,不用再糾結要不要為了省錢換一顆比較笨的模型。
多步驟任務更靠得住官方強調這代模型更會「檢查、驗證自己的工作,並耐心迭代到成功」。對需要串連很多步驟才能完成的自動化任務(像是自己寫程式、自己抓bug、自己重跑)來說,這直接影響任務最後做不做得完,而不只是回答得好不好看。

⚙️ 它是怎麼運作的

1
先決定要「想多深」使用者(或串接的系統)可以先選擇這次任務用哪一種effort(努力程度)——想得越深,通常代表模型會多花運算去檢查、推敲。
2
運算深度換算成時間跟費用不同的effort對應到不同的運算量(也就是要花多少token),運算量越大,回應通常越慢、也越貴,這是一個實際的取捨,不是免費的午餐。
3
用一整套跑分量出「效能對成本」的曲線官方拿多個標準測驗(像Frontier-Bench、CursorBench),在不同effort設定下各跑一次,畫出「花多少錢、能拿到多少效能」的曲線,而不是只公布一個分數。
4
多數任務類型:同樣的錢,曲線都在別人上面不管是寫程式(Frontier-Bench v0.1效能是前代兩倍以上、成本更低)、知識工作(Zapier AutomationBench完成率約是第二名的1.5倍)、還是操作電腦畫面(OSWorld 2.0),Opus 5在同樣成本下的表現都超過其他模型。
5
但少數領域仍有落差在資安相關任務上,Opus 5還是輸給Mythos 5,說明「效能對成本」的曲線並不是每個領域都贏,選模型還是要看場景。
幾個關鍵跑分,Opus 5表現一覽
評測基準衡量什麼Opus 5的表現
Frontier-Bench v0.1真實軟體工程任務的完成品質超越所有其他模型,效能是前代Opus 4.8的兩倍以上,單次任務成本卻更低
CursorBench 3.2(max effort)實際寫程式的產出品質跟Fable 5的最高分只差0.5%,成本卻只要一半
ARC-AGI 3解決從沒看過的全新問題分數是第二名模型的三倍
Zapier AutomationBench能不能從頭到尾獨立完成一件商業任務同樣成本下完成率約是第二名的1.5倍;連最低effort設定都贏過所有其他模型
OSWorld 2.0直接操作電腦畫面完成任務(電腦使用能力)任何成本下都贏過其他模型,只花Fable 5最佳成本三分之一多一點,就超越Fable 5的最佳成績

🤔 這則沒有適合的實作——改用三個問題帶你想深

  1. 如果你現在的工作(或想做的專案)需要用到AI編程或知識型助手,你會因為「更便宜」還是「更聰明」決定要不要升級?為什麼?
  2. Opus 5在資安任務上還輸給Mythos 5,如果你要決定該不該把這套系統用在處理機敏資料的場景,這個落差會怎麼影響你的判斷?
  3. 官方特別強調這顆模型「會檢查自己的工作、耐心迭代到成功」,如果這變成常態,你覺得工程師這個職業未來最值錢的能力會是什麼——還是寫程式本身,還是別的?

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 為什麼Anthropic要設計「effort setting」這種可調整的旋鈕,而不是直接出一顆更強的模型就好?
這反映一種「一顆模型、算力可調」的設計哲學:與其為不同預算、不同延遲需求分別維護好幾顆模型,不如讓同一顆模型透過旋鈕去服務所有場景。對公司來說,這樣可以省下維護、部署、路由(決定哪個任務該用哪顆模型)的複雜度;對使用者來說,也不用在「便宜但笨」跟「聰明但貴」之間被迫二選一,而是同一個產品脈絡下依場景動態權衡。
🔭 為什麼「打平但更便宜」有時候比「絕對最強」更重要?
CursorBench的結果顯示,Opus 5只落後Fable 5峰值0.5%,但成本是一半——對真的要把AI用在日常工作的工程團隊而言,決策依據往往不是「誰分數最高」,而是「性價比曲線」:同樣一塊錢能換到多少效能。文章反覆強調「at a lower cost per task」而不是只講贏了多少分,說明Anthropic很清楚,實際採用決策是看成本效益,不是看排行榜。
🔭 為什麼特別強調模型「更會驗證自己的工作、耐心迭代」,這件事有那麼重要嗎?
在需要一連串步驟才能完成的自動化(agent)任務裡,真正的瓶頸往往不是單一步驟的正確率,而是「複合錯誤率」——只要中間任何一步出錯,整個任務就可能失敗,步驟越多,整體成功率會用指數方式往下掉。「自我驗證、耐心迭代」直接針對的就是這個問題:讓模型在出錯時能自己抓出來、修正,而不是一路錯到底,這是把設計重點從「單次回答準不準」轉向「整個任務做不做得完」。
🔭 Opus 5在資安任務上輸給Mythos 5,這說明了什麼取捨?
沒有一顆模型能在所有維度都贏,這通常反映訓練資源分配是策略性選擇——Anthropic這次顯然把資源更多押在程式工程與知識型工作,而不是資安特化。對實際要採用模型的人來說,這是一個提醒:選模型不該只看「總分」或「知名度」,而要回頭看自己的場景最在乎哪個面向,再去找對應表現最好的那一顆。

📝 隨堂考(點選答案,立即回饋)

Q1. Claude Opus 5跟前一代Opus 4.8相比,在「費用」跟「效能」上發生了什麼變化?
✅ 文章明確寫道Opus 5是在跟Opus 4.8「相同成本」下,效能有大幅度的提升;至於「用一半價錢」是拿來跟Fable 5比,不是跟前代Opus 4.8比,兩個比較對象不要搞混。
Q2. 什麼是「effort setting(努力程度設定)」?
✅ 文章提到effort setting是給客戶用來在「追求更聰明」跟「省token、跑得更快更便宜」之間做選擇的設定,跟程式語言或雲端儲存無關。
Q3. 根據文章,Opus 5目前在哪一類任務上還輸給其他模型?
✅ 文章寫得很清楚:雖然Opus 5在多數評測都創新高,但在資安任務上仍然落後另一顆叫Mythos 5的模型。
Q4. ARC-AGI 3這項測驗,主要是在衡量模型的什麼能力?
✅ 文章形容ARC-AGI 3是要模型去解「novel problems」,也就是全新、沒練習過的題型,比較接近「舉一反三」而不是背題庫。
Q5. 關於OSWorld 2.0(電腦操作能力的測驗)的結果,下列何者正確?
✅ 文章寫道Opus 5在任何成本下都贏過其他模型,而且只花Fable 5最佳成本「剛過三分之一」,就超越了Fable 5的最佳表現。

🃏 翻牌記憶卡(先想答案,再點開對答)

effort setting是什麼?點我翻面
讓使用者自己調整這次要模型「想多深」的旋鈕,想得越深通常越準,但也越花時間跟費用。
Frontier-Bench、GDPval-AA是在測什麼?點我翻面
衡量模型在真實軟體工程與知識型工作任務上的表現的評測基準。
ARC-AGI 3測的是哪種能力?點我翻面
解決從沒看過的全新問題的能力,比較接近「舉一反三」而非死背。
為什麼「同價格效能更好」比「跑分最高」更值得在意?點我翻面
因為實際採用決策看的是性價比——同樣成本能換到多少效能,而不是單純追求最高分。
Opus 5在哪一類任務還輸給Mythos 5?點我翻面
資安(cybersecurity)相關任務。
什麼是「電腦操作(computer use)」類的評測,例如OSWorld 2.0?點我翻面
衡量AI能不能直接操作電腦畫面、點選軟體介面來完成任務的測驗。

✅ 離開前自測(全勾=這課真的學會了)

0%