老闆要他評估導入機械手臂做零件分揀與組裝,他知道現在的AI模型架構(VLA、diffusion policy)都很強,理論上機器人可以「看示範學動作」
先講一個很多人會誤會的地方:機器人學不會做事,通常不是因為AI技術不夠強。現在能訓練 VLA(視覺-語言-動作模型)一種輸入「畫面+文字指令」,直接輸出機械手臂該怎麼移動的AI模型、diffusion policy(擴散策略模型)借用「AI畫圖」那種從雜訊一步步修出結果的技術,拿來一步步修出一連串機器人動作 的模型架構都已經有了,訓練用的GPU也不缺,真正卡住的是「資料」——要讓AI學會怎麼夾零件、怎麼疊東西,得先餵給它大量『實際操作』的示範紀錄,這種資料現在少得可憐。
傳統要收集這種資料,得靠 teleoperation(遙控操作)人用搖桿或手把之類的介面,遠端操控一台真的機械手臂去做動作,過程被記錄下來當成訓練資料:先要有一台機器人、要有懂操作的人、錄一筆資料常常要花好幾分鐘還未必成功,一天錄不了幾十筆,換個新任務又要重新架設。這對想擴大資料規模、涵蓋各種場景任務的人來說,幾乎是個死結。
Grabette 的解法是繞過「一定要有機器人」這個前提:它是一個手持的夾具,裝了相機,你直接用手拿著它做事——夾東西、搬東西、疊東西——動作全程被錄下來。裝置會用 SLAM(同步定位與地圖建構)一種邊移動邊用感測器資料,同時算出「自己在哪」和「環境長怎樣」的技術 從影像反推出夾具在空間中完整的移動軌跡,也就是它的 6自由度(6-DoF)描述一個物體在3D空間裡的完整姿態,包含三個方向的位移和三個方向的旋轉,一共六個數字 姿態變化,這份「軌跡+夾爪開合」的紀錄,就是機器人學習模型要吃的訓練資料。
這個做法不是憑空冒出來的,它師承史丹佛的 Universal Manipulation Interface(UMI)——同樣是手持夾具+魚眼相機+SLAM 這套組合,UMI已經證明這個方法行得通。Grabette 想做的,是把這套東西做到「效果好」還不夠,還要做到「人人都能上手」:接上開源生態系 LeRobot(資料集格式)和 Hugging Face Hub(分享平台),目標是集眾人之力,堆出一個「沒有任何一間實驗室能獨力建成」的大型機器人操作資料庫。
| 比較項目 | 傳統遙控操作(Teleoperation) | Grabette 手持錄製 |
|---|---|---|
| 需要機械手臂? | 需要,先買一台機器人才能開始錄 | 不需要,人手直接示範 |
| 收集速度 | 慢,操控生疏、動作卡頓,一天錄不了太多筆 | 快,跟平常做動作一樣自然,錄一段就是一筆 |
| 適合擴大規模嗎? | 難,每加一個場景或任務都要重新架設 | 容易,帶著走就能到不同場地錄 |
| 資料精準度來源 | 機器人自身關節/末端座標,較精確 | 靠SLAM從影像重建,有一定誤差,靠雙相機設計弭補 |
| 上手門檻 | 需要機器人、teleop硬體與操作訓練 | 只要一支夾具、一台相機,任何人都能上手 |
這不是Grabette官方原始碼,而是把文章提到的『轉成LeRobot資料集格式』這件事,用一小段Python寫出資料長什麼樣子,讓你直接看懂——這就是後續VLA、diffusion policy這類模型真正在吃的資料格式。
episode_step = { "observation.images.wrist": fisheye_frame, # 脈絡用畫面 "observation.state": gripper_pose_6dof, # SLAM算出來的姿態 "observation.state.gripper_open": is_gripper_open, "action": next_gripper_pose_6dof, # 下一步要去哪 "timestamp": t,}