AI-LECTURER 速報課|2026-09-07|約 26 分鐘

GPT-6 Astra vs Claude Fable:AI操控機械手臂,贏在哪、又卡在哪?

取材:GPT-6 Astra on robot arms(Hacker News(AI 高人氣))
📍 真實場景
王課長,中小型自動化倉儲公司的產線導入負責人

正在幫客戶評估要導入哪一家的「AI 操控機械手臂」分揀方案

😖 卡住的地方:業務只丟給她幾支剪輯過的成功案例影片,她不知道背後真實的失敗率、每次要花多少錢、耗多久,更不知道遇到稍微複雜一點的組裝步驟會不會直接卡死,怕選錯方案讓產線停擺被老闆罵
💡 這課會教她用「階段式評分」+「成本/耗時/成功率」三個數字一起看穿漂亮 demo 背後的真相,還會讓她知道目前業界最強的兩家 AI 遇到精細操作時,其實卡在同一個共同瓶頸

🧭 這到底是什麼(白話版)

這篇文章其實是一場「機械手臂界的期中考」。研究團隊找來兩台一模一樣的機械手臂,套上同一套 agent policy讓 AI 決定下一步該怎麼操作機械手臂的「決策規則」,你可以想成是它的操作教戰手冊,然後讓 OpenAI 的新模型「GPT-6 Astra」跟 Anthropic 家的「Claude Fable 5」「Claude Fable 5.1」輪流上場,做同樣兩件事:把紅色積木放進碗裡(簡單任務),還有把圓形拼圖片插進板子上對應的凹槽(困難任務)。這不是純聊天測驗,而是真的要 AI 一步步指揮機械手臂完成 機械手臂操控(manipulation)讓 AI 控制實體機械手臂去抓、搬、放東西的任務類型,跟純打字聊天完全不同,多了物理世界的不確定性,手滑一下、角度差一點都可能失敗,比的是「AI 想的到,手做不做得到」。

結果很有戲劇性。簡單任務「積木入碗」,Astra 在 20 次裡成功 19 次(95%),Fable 5.1 只成功 8 次(40%),最舊的 Fable 5 幾乎只是在碰運氣(1 次)。而且 Astra 不只成功率高,花的錢跟時間還最少:平均每次只要 0.94 美元、2.5 分鐘,比 Fable 5.1 的 2.12 美元、6.8 分鐘又快又省一倍以上。

但換到困難任務「拼圖入槽」,畫風完全不一樣:Astra 跟 Fable 5.1 都只成功 2 次(10%),而且兩個都卡在「碰到凹槽但插不進去」的同一個步驟。這代表現在的 AI 操控手臂,遇到需要更精細力道跟角度控制的動作,還有一道共同卡住的天花板,不是換一家廠商就能跨過去。

為了公平比較誰真的比較強,評測團隊沒有用「成功 / 失敗」這種二選一的粗暴打分法,而是用 階段式評分(rubric)不是只看成功或失敗,而是把任務拆成好幾個檢查點,依做到哪一步給分,就算最後失敗,也能看出差在哪一步,而不是全部歸零,把每次嘗試依做到哪個步驟(碰到物體、舉起來、移到定位、放好)打 0 到 4 分。這樣才能看出「差多少」,而不是只有「有沒有」。

🎯 為什麼值得你花時間

AI 開始跨進「物理世界」的考試過去比的是誰聊天更聰明,這次比的是誰能把「腦袋想的」變成「手真的做到」,這是語言模型走向能操作實體世界的關鍵一步,跟你我生活中的自動化(倉儲分揀、餐飲備料、居家照護機器人)距離更近了。
便宜又快,不代表萬能Astra 在簡單任務上又快又便宜,很容易讓人誤以為它「什麼都行」,但拼圖任務證明它一樣會卡關,評估廠商方案時不能只看一支剪輯過的漂亮 demo 影片。
「同一個卡點」是產業級警訊兩家目前最強的 AI 都在同一步驟失敗,代表這可能是整個技術世代(不論哪家模型)共同的物理操作瓶頸,短期內不會因為換一家廠商就解決,這對任何想導入 AI 機械手臂的人都是重要的風險評估依據。

⚙️ 它是怎麼運作的

1
統一場地與規則兩台一模一樣的 YAM arms一款開源、雙臂協作的機械手臂硬體平台,這篇實驗中兩個 AI 用的是同一套硬體跟同一套操作規則,確保比的是「AI 的腦」而不是「手臂的好壞」,套用同一套 agent policy,排除「手臂比較好」這種變因,確保比較公平。
2
設計難易兩種任務「積木入碗」考驗基本的抓取跟放置;「拼圖入槽」多了一個要求——插入的角度跟深度要精準對準凹槽,難度明顯拉高,用來測試 AI 在「粗動作」跟「精細動作」上的表現差別。
3
人工逐次分階段評分每次嘗試都由真人評分員照 0~4 分的 rubric(無目的接近/碰到物體/舉離桌面/移到定位上方/完成放置)打分,就算失敗也留下「做到哪一步」的紀錄,而不是只寫「失敗」兩個字。
4
完成率、成本、耗時三個指標一起看每個模型每個任務都跑 20 次,算出 completion rate(完成率)在所有嘗試中,成功把任務做到最後一步的比例、平均耗時,以及用 output tokensAI 每次思考加下指令時吐出的文字量,字數愈多通常代表算越久、也越貴 換算出的 推論成本(inference cost)AI 每執行一次任務,呼叫模型運算所要付的雲端費用,三個數字合在一起看,才知道「贏得漂不漂亮」。
5
畫圖比較,找出共同瓶頸把六組(3 模型 × 2 任務)結果畫成圖表比較,發現困難任務上兩家 AI 卡在同一步,這個「共同卡點」比「誰輸誰贏」更值得業界關注。
三模型 × 兩任務 完整成績單
任務模型平均階段(0-4)完成率平均成本平均耗時
積木入碗Fable 51.305%$2.698.2分
積木入碗Fable 5.12.4040%$2.126.8分
積木入碗GPT-6 Astra3.9595%$0.942.5分
拼圖入槽Fable 51.500%$2.637.9分
拼圖入槽Fable 5.12.3510%$2.185.9分
拼圖入槽GPT-6 Astra2.0010%$1.363.4分

🛠️ 動手做:AI 機械手臂評測模擬器:用階段式評分看穿成功率/成本的真相

  1. 先選擇一個模型與一個任務(例如「GPT-6 Astra」+「積木入碗」)。
  2. 按下「模擬 1 次試驗」,看看這次模擬跑到第幾階段、花了多少錢。
  3. 改選「拼圖入槽」,比較困難任務跟簡單任務的差別在哪裡。
  4. 按「模擬 20 次」,讓模擬次數逼近文章原本的樣本數(每格 20 次),觀察平均值有沒有靠近下方的「文章原始統計」。
  5. 換另一個模型重複一次,比較三個模型在同一任務上的表現落差。
  6. 最後想一想:如果你是要幫公司選機械手臂方案的人,你會怎麼跟老闆報告這個結果?
👇 下面是活的,直接操作

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 為什麼評測要用 0-4 分的階段式 rubric,而不是簡單的成功/失敗?
二元評分只能告訴你「行不行」,工程上更想知道「差在哪、差多少」。階段式評分讓工程師能定位問題發生在感知(有沒有碰到)、抓取(有沒有舉起來)、路徑規劃(有沒有移到定位)還是精細操作(能不能插入)的哪一段,才知道該優化模型的哪個能力,而不是整個系統重練一次。這跟軟體工程裡「不要只看測試通過與否,要看失敗發生在哪一行」是同一種思維。
🔭 Astra 每次只用 2000 多顆 token,Fable 系列卻要 1 萬到 2 萬顆,這代表什麼設計取捨?
token 數幾乎等於「AI 邊做邊碎念的量」,念得越多通常代表用更多反覆確認去推理每一步,好處是可能更謹慎,壞處是又貴又慢,在需要即時反應的機械手臂控制上是明顯劣勢。但拼圖任務的結果顯示,Astra 就算話少,遇到真正需要精細操作的難題,還是跟話多的 Fable 5.1 打平,說明「輸出精簡」省的是成本與時間,卻不必然等於「操作能力更強」——這是兩個獨立的工程指標,選型時不能只看其中一個就下結論。
🔭 兩個廠商的 AI 在拼圖任務卡在同一步,這告訴評估導入方案的人什麼?
如果失敗點因廠商而異,換一家也許就能解決;但「同一步驟卡住」通常代表瓶頸不在「哪家的語言模型比較聰明」,而在更底層的東西:視覺定位精度、力回饋、或動作取樣頻率之類的共同限制。對工程決策者來說,這代表現階段不該把預算全押在「等更聰明的模型出來」,而該同時投資感測器精度或機構設計,才可能真正解開這個卡點。
🔭 為什麼要堅持「同一套手臂、同一套流程」做對照實驗?
這是典型的控制變因思維:如果兩家用不同的手臂或不同的操作介面,贏的一方可能只是硬體比較好、不是模型比較聰明。業界很多「我們的機器人更強」的行銷影片其實沒有做到這一點對照,讀技術報告時,先檢查「有沒有控制變因」,才不會被漂亮的 demo 影片誤導。

📝 隨堂考(點選答案,立即回饋)

Q1. 文章裡用來評分每次試驗的方法是?
✅ 文章明確說明用真人依五個階段(0無目的接近~4完成放置)評分,即使失敗也記錄做到哪一步。
Q2. 在「積木入碗」這個簡單任務上,哪個模型表現最好,且成本最低?
✅ Astra 完成率 95%、每次僅約 0.94 美元、2.5 分鐘,成功率最高且最省錢省時。
Q3. 在「拼圖入槽」困難任務上,Astra 和 Fable 5.1 的表現有什麼共同點?
✅ 兩者都只成功 2 次(10%),而且都「卡在同一個最後步驟」,顯示困難任務有共同瓶頸。
Q4. 這個實驗設計為什麼要用「同一組機械手臂+同一套 agent policy」?
✅ 控制硬體與流程一致,才能確保比較的公平性,讓觀察到的差異可以歸因於模型能力,而非其他因素。
Q5. 文章提到 Astra 的 output tokens 遠少於 Fable 系列,這跟它的成本與時間表現有什麼關係?
✅ output tokens 是計費與耗時的主要因素之一,Astra token 數少,對應了它更低的每次成本與更短的耗時。

🃏 翻牌記憶卡(先想答案,再點開對答)

完成率(completion rate)點我翻面
20 次嘗試中,成功做到最後一步(第 4 階段)的比例。
階段式評分(rubric)點我翻面
把任務拆成 0~4 分的檢查點,即使失敗也記錄做到哪一步,而非只有成功/失敗。
agent policy點我翻面
AI 決定下一步該怎麼操作機械手臂的決策規則/操作教戰手冊。
output tokens點我翻面
AI 每次思考與下指令吐出的文字量,通常和運算時間、成本成正比。
這次實驗最大的產業訊號是什麼?點我翻面
困難任務上兩家 AI 都卡在同一步驟,顯示目前是整個技術世代共同的物理操作瓶頸,不是換家廠商就能解決。
為什麼要控制手臂與流程一致?點我翻面
排除硬體/流程差異,確保比較的是模型本身的能力,這是公平實驗設計的基本要求。

✅ 離開前自測(全勾=這課真的學會了)

0%