AI-LECTURER 速報課|2026-09-13|約 26 分鐘

AI寫程式最強戰績只有38.8%?Real-SWE戳破跑分神話

📍 真實場景
陳組長,中型SaaS公司的技術主管

老闆剛看完一篇「AI已經會自己寫程式」的新聞,要她評估能不能讓AI coding agent直接接手正式環境的計費系統維護工作,藉此省下工程師人力

😖 卡住的地方:她自己試用過幾個AI工具,demo看起來很厲害,但完全不知道那些漂亮的展示能不能套用在他們那套「每個客戶稅務規則都不一樣、還要串外部稅務服務商」的老舊計費系統上——萬一AI改錯稅金計算,那不是bug,而是真金白銀的營運事故
💡 這篇會讓她看懂,業界最新的Real-SWE數據顯示,目前最強的AI+工具組合在真實企業系統上也只有三到四成的成功率,以及該怎麼用這個數字,設計出「先讓AI幫忙、但風險可控」的導入方式,而不是被新聞標題牽著走

🧭 這到底是什麼(白話版)

你可能已經在新聞上看過「AI已經會自己寫程式,而且寫得比資淺工程師還快」這類說法。這次要講的Real-SWE,就是一群人特地做出來「驗證」這類說法到底有多真實的一套benchmark用來公平比較不同AI模型能力好壞的一套「測驗題庫」。它專門挑「企業內部真正在跑的正式營運程式碼」來出題,而不是像過去常見的題庫那樣,從GitHub上找公開的開源專案問題來測。

具體做法是這樣:Real-SWE的團隊跟幾家真正的公司「授權」拿到他們的private codebase只有公司內部看得到、沒有公開在網路上的原始碼倉庫,再從這些公司工程師「真的要處理的工單」裡挑題目——像是「帳務系統週一重新開帳後,發票全部漏收稅金,要修好,而且不能讓本來享有免稅的客戶被多收錢」這種題目。接著讓不同的coding agent不只會聊天回答問題,還能自己讀程式碼、動手寫程式、執行指令來完成任務的AI,包在不同的harness包住AI模型的「操作介面工具腰帶」,決定AI能怎麼呼叫終端機、怎麼讀寫檔案、怎麼規劃步驟裡面(例如Claude Code、Codex CLI、Gemini CLI這些不同的操作介面),去嘗試解決同一批題目。

最後用「這家公司原本內部就有的驗收標準」去檢查AI改得對不對,算出一個resolution rateAI真正把題目解決到通過驗收、而不是只有動手做而已的比例。結果顯示,目前排名第一的組合——Fable 5.1這個模型搭配Claude Code這套操作介面——也只解出38.8%的題目,再往下的模型跟介面組合,成功率一路下滑到16.2%。

🎯 為什麼值得你花時間

跑分漂亮,不代表能接手你家的系統公開的題庫通常用開源專案的題目,題目乾淨、邊界清楚,模型也可能在訓練資料裡看過類似解法;但企業內部系統充滿歷史包袱、跨服務串接、又跟商業規則綁死,這正是Real-SWE想戳破的落差——同一種能力,換到真實企業程式碼上,成績會掉很多。
帳算錯不是bug,是營運事故文中舉的計費/稅務例子就是最好的示範:如果AI改錯稅金計算,不是「程式跑不動」那麼單純,而是「多收錢的客戶投訴、少收稅的合規風險、免稅客戶被誤課稅的合約違約」,這種後果會直接衝擊公司營收與客戶信任,不能用「反正AI只是輔助」帶過。
每家公司都有自己的「潛規則」文中提到每家企業有自己的規矩和寫法,AI要先讀懂這家公司過去工程師約定俗成的做法、知道要串接哪個外部系統(像文中的外部稅務服務商),才有機會改對,這跟「看得懂程式語法」完全是兩回事。

⚙️ 它是怎麼運作的

1
跟真公司「借」程式碼Real-SWE團隊實際跟正在營運中的企業簽約、取得授權,使用他們正式在跑的私有系統程式碼來出題,而不是自己編造練習題。
2
題目來自工程師真正要處理的工單每一題都是這家公司工程師原本就要做的真實任務,帶著這家公司的規矩跟上下文,不是特地為了考AI而簡化過的題目。
3
換上不同AI+操作介面的組合出戰同一批題目,分別給Fable 5.1配Claude Code、GPT-6 Astra配Codex CLI、Gemini 3.8 Flash配Gemini CLI等八種組合去做,確保比較的是「整套工作流程」,而不只是單一模型。
4
用這家公司原本的驗收標準打分不是「看起來有改」就給分,而是要通過這家公司工程師原本就會用的驗證方式(測試、驗收條件)才算解決。
5
算出解題成功率、排出名次把每個模型+介面組合解出的題目比例算出來,變成文中那張排行榜,最高的Fable 5.1+Claude Code是38.8%。
Real-SWE 解題成功率排行榜(前8名)
排名模型工具介面(harness)解題成功率
1Fable 5.1Claude Code38.8%
2GPT-6 AstraCodex CLI33.8%
3Gemini 3.8 FlashGemini CLI31.2%
4GLM 5.3Claude Code28.8%
=5Grok 4.6Grok Build23.8%
=5Muse Spark 1.3Muse Code23.8%
7Kimi K3Kimi Code18.8%
8GPT-5.6 SolCodex CLI16.2%

🤔 這則沒有適合的實作——改用三個問題帶你想深

  1. 如果你是陳組長,你會建議公司從哪一類任務開始試著讓AI coding agent接手(例如:低風險的內部工具 vs. 高風險的正式計費系統)?為什麼?
  2. Real-SWE顯示「同一個模型換一套harness,名次會大風吹」(像GLM 5.3跟Fable 5.1都用Claude Code,成績卻差很多),這對企業選擇AI coding工具的策略,帶來什麼啟示?
  3. 如果你的團隊要做一份屬於自己公司的「迷你版Real-SWE」,用來決定要不要讓AI碰正式程式碼,你會挑哪三個最能代表「我們公司特有複雜度」的真實工單?為什麼選它們?

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 為什麼Real-SWE要用「跟真公司授權拿到的私有程式碼」,而不是像其他題庫一樣用GitHub上的開源issue?
公開題庫最大的風險是「資料汙染」——這些開源issue跟解法很可能早就出現在模型的訓練資料裡,導致分數虛高、失真。用私有企業程式碼可以避開這個問題,同時逼AI真正面對企業慣例、跨服務依賴、業務規則這些「教科書學不到」的複雜度。代價是:外部人無法公開驗證題目跟解法,方法論的可信度得靠第三方稽核或制度設計來補,這是「更真實」跟「更難驗證」之間的取捨。
🔭 為什麼排行榜是以「模型+harness」配對計分,而不是只比較模型本身?
表格裡可以看到,同樣用Claude Code這套操作介面,Fable 5.1拿38.8%、GLM 5.3只拿28.8%,可見同一套harness換模型表現不同;反過來同一個模型換harness,表現也會不同。這說明「agent能不能把事情做好」不是只看模型推理能力,還牽涉到怎麼讀取上下文、怎麼呼叫工具、怎麼規劃多步驟行動、怎麼自我驗證。對工程團隊的啟示是:選型時不能只看「模型排行榜」,要連同你會搭配的操作介面一起評估。
🔭 38.8%的成功率,對「要不要導入AI coding agent」這個決策來說,該怎麼解讀?
要先弄清楚這個數字是「通過該公司原本驗收標準」的成功率,不是「有動手做」的比例,所以38.8%代表六成以上的題目AI是解不對的。這意味著工程團隊不能把AI coding agent當成「自動完工機」,比較務實的設計是「AI先出草稿、人來把關」的流程,而且要依任務風險分級——像動錢、動稅這種任務,絕對不能無人看管地讓AI直接上正式環境。
🔭 為什麼這類benchmark特別挑「計費/稅務」這種題目當代表性任務?
計費與稅務規則的特色是「商業邏輯藏在程式碼裡、而且因客戶而異、還跟外部系統綁在一起」,改錯會有立即且具體的金錢後果。這類題目最能測出AI是不是真的理解「隱性商業邏輯」,而不只是語法正確、能跑得動——這正是企業真實工作跟公開題庫最大的落差所在。

📝 隨堂考(點選答案,立即回饋)

Q1. Real-SWE這個benchmark最主要想測試AI的什麼能力?
✅ Real-SWE的題目全部來自真公司正在營運的私有系統,考的是AI能不能真的接手工程師的工作,不是創意或聊天能力。
Q2. 目前排名第一的Fable 5.1+Claude Code這個組合,解題成功率大約是多少?
✅ 文中排行榜顯示Fable 5.1搭配Claude Code這套操作介面,解題成功率是38.8%,是目前8組當中最高的,但也代表六成多的題目仍然解不出來。
Q3. Real-SWE為什麼特別挑「計費/稅務」這類題目當代表性任務?
✅ 計費/稅務規則常常「每個客戶不一樣、還要串接外部服務」,改錯會直接造成多收錢、少收稅等營運事故,最能測出AI是否真的懂商業邏輯,而不只是語法正確。
Q4. 關於「解題成功率(resolution rate)」,以下何者正確?
✅ Real-SWE是拿「這家公司原本的驗收方式」去檢查AI改得對不對,不是寬鬆地看有沒有動手,所以數字才會掉到三、四成。
Q5. 為什麼Real-SWE要比較「模型+harness」的組合,而不是只比較AI模型本身?
✅ 表格裡GLM 5.3也是用Claude Code這套介面,卻只拿到28.8%,說明「AI能不能把事情做好」不只看模型聰不聰明,還要看包著它的操作介面怎麼幫它讀程式碼、下指令、驗證結果。

🃏 翻牌記憶卡(先想答案,再點開對答)

benchmark點我翻面
用來公平比較不同AI模型能力好壞的一套「測驗題庫」
coding agent點我翻面
不只會聊天回答問題,還能自己讀程式碼、動手寫程式、執行指令完成任務的AI
harness點我翻面
包住AI模型的操作介面/工具腰帶,決定它怎麼呼叫終端機、讀寫檔案、規劃步驟
resolution rate點我翻面
AI真正把題目解決到通過驗收標準的比例,不是有動手做就算
private codebase點我翻面
只有公司內部看得到、沒有公開在網路上的原始碼倉庫
Real-SWE目前最高分組合點我翻面
Fable 5.1模型+Claude Code操作介面,解題成功率38.8%

✅ 離開前自測(全勾=這課真的學會了)

0%