返回前沿新知
應用研究開發2026年9月14日 最近更新 2026年9月14日

Dyna:讓機器人用「預測影片」學會動作的模型

Dyna 屬於「世界-動作模型」路線,透過影片擴散模型同時預測未來畫面演變與機器人動作,利用龐大的人類第一人稱影片萃取手部姿態進行預訓練,打破傳統仰賴遙控機械手臂的資料瓶頸,讓模型學會物理世界變化的規律,僅需極少量的後訓練微調即可實現高度穩健且跨平台的機器人操控。

什麼是 Dyna

Dyna 是 world-action model(WAM)路線的代表。跟 VLA 不同,它不是「看懂語言再生動作」,而是用一個影片擴散模型同時預測「接下來的畫面會怎麼變」和「機器人下一步該怎麼動」,動作只是接在影片骨幹旁的一條淺分支。

為什麼要跟影片一起訓練

Dyna 的邏輯是:機器人缺的不是語言常識,而是對物理世界如何演變的直覺——手碰到東西會怎樣、繩子怎麼打結。這種知識,語言模型學不到,但人類第一人稱影片裡到處都是,而且量近乎無限,遠比遙控機械手臂錄示範便宜。他們從影片萃取手部姿態當成偽動作標籤來訓練。

實驗發現:只練動作、不生成影片的模型,換一個沒看過的機器人平台幾乎學不會遷移;一旦加上「同時預測未來影片」,零樣本表現大幅超越純動作訓練。甚至只是多餵沒有動作標籤、純粹拿來學影片生成的人類影片,機器人任務表現也會持續變好——影片本身成了新的擴增資料來源。

最近的發展

2025 年 4 月的 Unified World Models 與 2026 年初的 DreamZero 等工作,把世界模型與動作合成一個模型。2026 年 8 月,Dyna Robotics 發布 Dyna-2,預訓練規模衝上百萬小時人類第一人稱影片,首次驗證:人類資料規模擴大呈冪律改善,且首次觀察到「人到機器人的遷移擴展律」——模型沒看過任何機器人資料,光靠擴增人類影片,機器人任務的離線預測誤差就同步下降。實機上,僅用幾小時機器人示範做後訓練,百萬小時預訓練模型在雙臂、靈巧手、半人形平台都表現最佳,甚至只用十分鐘遙控資料就學會開瓶蓋,並展現對燈光變化、視覺遮蔽、持續干擾的高度穩健性。

Dyna 路線目前仍是少數團隊在探索,訓練成本更高,能否持續擴展到千萬小時規模也未知,但它給出了與 VLA 不同的答案:與其借語言常識,不如直接讓模型學會預測世界如何變化。

最耐人尋味的,是一個反直覺的細節:多餵純影片資料,對機器人任務持續有幫助,但對預測人類自己的動作幾乎沒用、甚至略微變差。同一批資料,對「跨到別的身體」有效,對「留在原本的身體」無效。這暗示影片預測學到的不是「怎麼動」,而是「世界會怎麼變」——人的手和夾爪長得完全不同,但杯子推倒會滾、繩子拉緊會繃直,這些規律對誰都一樣。若這條路走得通,機器人的資料瓶頸就從「有多少人願意去操控手臂」,變成「有多少人的生活被記錄下來」。而那也會帶出一個更難回答的問題:誰的生活,誰同意的?


🔗 延伸閱讀

本篇主角

世界模型 × 動作

對照組:VLA 路線

  • RT-2|開啟這條路線的起點
  • OpenVLA|開源實作,適合入門
  • π0|以 flow matching 生成連續動作
  • GR00T N1|NVIDIA 的人形機器人基礎模型

技術基礎

#dyna #world-action model #video prediction