AI-LECTURER 速報課|2026-07-22|約 26 分鐘

不需要一台機器人,你也能錄出訓練機器人的資料:Grabette 的手持錄製術

📍 真實場景
陳威宏,中小型電子代工廠的自動化工程師

老闆要他評估導入機械手臂做零件分揀與組裝,他知道現在的AI模型架構(VLA、diffusion policy)都很強,理論上機器人可以「看示範學動作」

😖 卡住的地方:工廠沒有多餘的機械手臂能拿來錄示範動作,用人力遙控機械手臂錄資料又貴又慢,一天錄不到幾十筆,換一個新任務又要重新架設,成本高到老闆直接打回票
💡 這堂課會讓他看到:不用機械手臂,只靠一支夾具、一支手、一台相機,也能錄出機器人學習模型看得懂的訓練資料

🧭 這到底是什麼(白話版)

先講一個很多人會誤會的地方:機器人學不會做事,通常不是因為AI技術不夠強。現在能訓練 VLA(視覺-語言-動作模型)一種輸入「畫面+文字指令」,直接輸出機械手臂該怎麼移動的AI模型diffusion policy(擴散策略模型)借用「AI畫圖」那種從雜訊一步步修出結果的技術,拿來一步步修出一連串機器人動作 的模型架構都已經有了,訓練用的GPU也不缺,真正卡住的是「資料」——要讓AI學會怎麼夾零件、怎麼疊東西,得先餵給它大量『實際操作』的示範紀錄,這種資料現在少得可憐。

傳統要收集這種資料,得靠 teleoperation(遙控操作)人用搖桿或手把之類的介面,遠端操控一台真的機械手臂去做動作,過程被記錄下來當成訓練資料:先要有一台機器人、要有懂操作的人、錄一筆資料常常要花好幾分鐘還未必成功,一天錄不了幾十筆,換個新任務又要重新架設。這對想擴大資料規模、涵蓋各種場景任務的人來說,幾乎是個死結。

Grabette 的解法是繞過「一定要有機器人」這個前提:它是一個手持的夾具,裝了相機,你直接用手拿著它做事——夾東西、搬東西、疊東西——動作全程被錄下來。裝置會用 SLAM(同步定位與地圖建構)一種邊移動邊用感測器資料,同時算出「自己在哪」和「環境長怎樣」的技術 從影像反推出夾具在空間中完整的移動軌跡,也就是它的 6自由度(6-DoF)描述一個物體在3D空間裡的完整姿態,包含三個方向的位移和三個方向的旋轉,一共六個數字 姿態變化,這份「軌跡+夾爪開合」的紀錄,就是機器人學習模型要吃的訓練資料。

這個做法不是憑空冒出來的,它師承史丹佛的 Universal Manipulation Interface(UMI)——同樣是手持夾具+魚眼相機+SLAM 這套組合,UMI已經證明這個方法行得通。Grabette 想做的,是把這套東西做到「效果好」還不夠,還要做到「人人都能上手」:接上開源生態系 LeRobot(資料集格式)和 Hugging Face Hub(分享平台),目標是集眾人之力,堆出一個「沒有任何一間實驗室能獨力建成」的大型機器人操作資料庫。

🎯 為什麼值得你花時間

解開機器人學習的資料荒現在不是模型不夠聰明,是餵給模型吃的『真實操作示範』不夠多、不夠雜。Grabette把收集示範資料的門檻壓到跟拍一段影片差不多,直接打中這個瓶頸。
把資料收集這件事『眾包化』以前錄示範資料是實驗室才玩得起的事,Grabette讓一般人、不同場域、不同任務的示範動作都能被錄下來、格式統一後彙整,形成一個沒有單一實驗室能獨力建成的協作資料庫。
縮短『我有個任務』到『我訓練出模型』的距離從發想一個操作任務,到真的錄出資料、訓練出能用的模型,中間不再需要先搞定一台機器人和一整套teleop硬體,門檻大幅降低。

⚙️ 它是怎麼運作的

1
拿起來,錄一段真人示範使用者直接手持Grabette做任務——夾這個、搬那個、疊起來——不用碰任何機器人,動作全程被機身上的相機錄下來。
2
兩顆相機各司其職側錄便宜的 魚眼相機視角很廣、畫面會有點扭曲的廣角相機,常裝在機器人手腕上,用來提供周邊環境的脈絡畫面 負責提供豐富的周邊畫面脈絡,RGBD相機除了一般彩色畫面(RGB)之外,還能量測每個畫素到相機距離(Depth)的相機 則專心做精準的姿態追蹤,兩者分工不是為了備援,是刻意把「脈絡」跟「精準定位」這兩件事拆開處理。
3
用 SLAM 反推出夾具的完整軌跡系統從RGBD相機拍到的畫面,用SLAM技術一步步算出夾具在空間裡怎麼移動、怎麼旋轉,重建出完整的6自由度軌跡,加上夾爪開合的時間點,就是一筆完整的操作示範。
4
在瀏覽器裡轉成 LeRobot 資料集格式使用者不用在自己電腦裝任何軟體,透過瀏覽器就能把原始錄製檔轉換成LeRobot這套機器人資料集的標準格式,方便後續各種模型直接讀取訓練。
5
上傳到 Hugging Face Hub,跟其他人的資料彙整轉好格式的資料集可以直接分享到Hugging Face Hub,跟其他人、其他裝置錄到的示範資料放在一起,逐漸堆疊成一個誰都能貢獻、誰都能取用的大型協作資料庫。
6
訓練出的模型部署到 Gripette 機械手臂上執行VLA、diffusion policy這類模型吃這份資料訓練完後,會被部署到Grabette的機器人版雙胞胎——Gripette機械手臂末端夾爪上,正式在真實世界執行學到的操作動作。
傳統遙控操作 vs Grabette 手持錄製,差在哪裡
比較項目傳統遙控操作(Teleoperation)Grabette 手持錄製
需要機械手臂?需要,先買一台機器人才能開始錄不需要,人手直接示範
收集速度慢,操控生疏、動作卡頓,一天錄不了太多筆快,跟平常做動作一樣自然,錄一段就是一筆
適合擴大規模嗎?難,每加一個場景或任務都要重新架設容易,帶著走就能到不同場地錄
資料精準度來源機器人自身關節/末端座標,較精確靠SLAM從影像重建,有一定誤差,靠雙相機設計弭補
上手門檻需要機器人、teleop硬體與操作訓練只要一支夾具、一台相機,任何人都能上手

🔍 程式碼漫遊(點有 ● 的行看白話講解)

這不是Grabette官方原始碼,而是把文章提到的『轉成LeRobot資料集格式』這件事,用一小段Python寫出資料長什麼樣子,讓你直接看懂——這就是後續VLA、diffusion policy這類模型真正在吃的資料格式。

episode_step = {
💬 代表這筆示範資料裡,「某一個時間點」發生的事,每一個時間點都會存成這樣一筆紀錄
"observation.images.wrist": fisheye_frame, # 脈絡用畫面
💬 來自魚眼相機那一幀畫面,給模型看「周圍環境長怎樣、手邊有什麼」
"observation.state": gripper_pose_6dof, # SLAM算出來的姿態
💬 由RGBD相機+SLAM重建出來的夾具六自由度姿態,代表「現在夾具在哪、朝哪個方向」
"observation.state.gripper_open": is_gripper_open,
💬 紀錄當下夾爪是開的還是合的,這是操作任務裡很關鍵的一個狀態
"action": next_gripper_pose_6dof, # 下一步要去哪
💬 模型真正要學的「答案」:看到目前狀態,下一步夾具應該移動到哪個姿態
"timestamp": t,
💬 這個時間點的時間戳,讓整段軌跡前後順序、速度都保留下來
}
💬 把一整段示範拆成一連串這樣的時間點紀錄,串起來就是一集(episode)完整的操作示範

🛠️ 動手做:手動錄一段「夾取-搬移-放下」,變成機器人可以照樣重演的軌跡

  1. 在左邊「錄製區」畫布上,把滑鼠移到黃色方塊附近
  2. 按住滑鼠左鍵不放(模擬夾爪夾住),把方塊拖到右邊藍框裡
  3. 放開滑鼠左鍵(模擬夾爪放開),如果方塊有進到藍框,畫面會顯示「錄製完成」
  4. 下方會秀出你剛剛錄到的前3筆資料,格式是x座標、y座標、夾爪開合狀態——這就是機器人學習模型要吃的資料格式
  5. 按右邊「▶ 回放錄製結果」,看機器人怎麼照著你剛剛錄的軌跡重演一次
  6. 想重錄就按「重新開始」
👇 下面是活的,直接操作

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 為什麼不直接找一台便宜機器人做teleop,卻要多繞一手做SLAM重建軌跡?
SLAM重建有雜訊,遠不如機器人自身編碼器讀出來的座標精準;但選擇Grabette是在做「資料取得成本」vs「資料精準度」的取捨——teleop機台一套動輒數十萬到數百萬,且只能待在實驗室;手持裝置成本低、可帶到任何場域、可讓非機器人專家的一般人貢獻資料,用「量」和「多樣性」去補「精準度」的不足,這是資料驅動時代常見的策略:先求資料規模上得去,模型訓練時的資料量與多樣性可以吸收一定程度的雜訊。
🔭 兩顆相機分工(便宜魚眼+高階RGBD)背後在解決什麼問題?
這是典型的「感測器職責分離」設計——魚眼相機的任務是給策略模型「脈絡」(它在夾什麼、旁邊有什麼),不需要精準深度,用便宜相機即可;RGBD相機的任務是精準重建6自由度軌跡,這需要深度資訊,成本較高。如果把兩個任務塞給同一顆相機,要嘛精度不夠、要嘛成本爆炸。把昂貴精密的元件只用在真正需要精度的環節,是硬體工程中常見的成本控制手法。
🔭 為什麼要把資料集綁定在LeRobot格式和Hugging Face Hub上,而不是各自輸出各自的格式?
統一資料格式是能不能形成「資料飛輪」的關鍵。如果Grabette輸出的是自己專屬的格式,其他實驗室的資料、UMI錄的資料、其他裝置錄的資料就沒辦法混在一起訓練同一個模型;統一成LeRobot格式並集中放上Hugging Face Hub,才能讓「任何人都能貢獻的協作資料集」這個願景成立——這跟開源軟體的網路效應是一樣的道理:標準化介面遠比單一裝置的效能更重要。
🔭 「錄示範」跟「部署到真機器人(Gripette)上執行」是兩件事,中間會不會有落差?
這正是機器人學習裡有名的「具身落差(embodiment gap)」——人手錄的軌跡跟真正機械手臂的動力學(重量、慣性、關節限制)不完全一樣,模型光靠這份資料訓練,部署到真機器人上時動作不見得完全對得上。這也是為什麼Grabette要特別搭配一個外型、抓取邏輯都盡量貼近真實機械手臂末端夾爪的Gripette使用——盡量讓錄製裝置的物理特性跟執行裝置一致,把這個落差縮到最小,而不是無限依賴模型自己去補。

📝 隨堂考(點選答案,立即回饋)

Q1. Grabette 最主要想解決機器人學習中的什麼問題?
✅ 文章開頭就講得很清楚:現在的模型架構(VLA、diffusion/flow-matching policy)和GPU都足夠了,卡住的是「大量、多樣的真實世界操作資料」——這是供給端問題,不是運算或模型架構問題。
Q2. Grabette 錄製示範時,靠什麼方法還原出夾具的六自由度軌跡?
✅ Grabette不靠機器人硬體,而是用相機影像做SLAM,從影像中反推出夾具在空間中移動的六自由度(位置+旋轉)軌跡。
Q3. Grabette 上的魚眼相機和 RGBD 相機,分工邏輯是什麼?
✅ 文章明講:wide fisheye 給脈絡豐富、類似手腕相機視角的畫面,RGBD做「robust 6-DoF tracking」的粗重工作,這是刻意的分工設計。
Q4. 為什麼 Grabette 團隊要把錄到的資料轉成 LeRobot 格式並放上 Hugging Face Hub?
✅ 文章的終極目標是打造「one no single lab could ever build alone」的大型協作操作資料集,統一格式與集中平台是讓不同人貢獻的資料能互通、彙整的關鍵。
Q5. Grabette 和它的機械手臂搭檔 Gripette 之間的關係是?
✅ 文章提到Grabette 用來錄資料,而它的「機器人版雙胞胎」Gripette則是機械手臂的末端夾爪,負責把訓練出來的模型部署執行。

🃏 翻牌記憶卡(先想答案,再點開對答)

VLA(視覺-語言-動作模型)點我翻面
一種吃「畫面+文字指令」、直接輸出機械手臂該怎麼動的AI模型
teleoperation(遙控操作)點我翻面
人用搖桿、手把之類的介面遠端操控機械手臂做動作,藉此錄下示範資料的傳統方法
6-DoF(六自由度)點我翻面
描述一個物體在3D空間中的完整姿態:三個方向的位移+三個方向的旋轉,共六個數字
SLAM(同步定位與地圖建構)點我翻面
邊移動邊用感測器資料,同時算出「自己在哪」和「環境長怎樣」的技術,Grabette用它從影像反推夾具軌跡
具身落差(embodiment gap)點我翻面
示範資料的錄製裝置跟實際執行的機器人硬體特性不完全一樣,導致模型學到的動作在真機器人上執行會有落差
LeRobot 資料集格式點我翻面
Hugging Face生態系裡,機器人示範資料的標準化格式,讓不同來源的資料能互通、拿去訓練同一個模型

✅ 離開前自測(全勾=這課真的學會了)

0%