什麼是 Dyna
Dyna 是 world-action model(WAM)路線的代表。跟 VLA 不同,它不是「看懂語言再生動作」,而是用一個影片擴散模型同時預測「接下來的畫面會怎麼變」和「機器人下一步該怎麼動」,動作只是接在影片骨幹旁的一條淺分支。
為什麼要跟影片一起訓練
Dyna 的邏輯是:機器人缺的不是語言常識,而是對物理世界如何演變的直覺——手碰到東西會怎樣、繩子怎麼打結。這種知識,語言模型學不到,但人類第一人稱影片裡到處都是,而且量近乎無限,遠比遙控機械手臂錄示範便宜。他們從影片萃取手部姿態當成偽動作標籤來訓練。
實驗發現:只練動作、不生成影片的模型,換一個沒看過的機器人平台幾乎學不會遷移;一旦加上「同時預測未來影片」,零樣本表現大幅超越純動作訓練。甚至只是多餵沒有動作標籤、純粹拿來學影片生成的人類影片,機器人任務表現也會持續變好——影片本身成了新的擴增資料來源。
最近的發展
2025 年 4 月的 Unified World Models 與 2026 年初的 DreamZero 等工作,把世界模型與動作合成一個模型。2026 年 8 月,Dyna Robotics 發布 Dyna-2,預訓練規模衝上百萬小時人類第一人稱影片,首次驗證:人類資料規模擴大呈冪律改善,且首次觀察到「人到機器人的遷移擴展律」——模型沒看過任何機器人資料,光靠擴增人類影片,機器人任務的離線預測誤差就同步下降。實機上,僅用幾小時機器人示範做後訓練,百萬小時預訓練模型在雙臂、靈巧手、半人形平台都表現最佳,甚至只用十分鐘遙控資料就學會開瓶蓋,並展現對燈光變化、視覺遮蔽、持續干擾的高度穩健性。
Dyna 路線目前仍是少數團隊在探索,訓練成本更高,能否持續擴展到千萬小時規模也未知,但它給出了與 VLA 不同的答案:與其借語言常識,不如直接讓模型學會預測世界如何變化。
最耐人尋味的,是一個反直覺的細節:多餵純影片資料,對機器人任務持續有幫助,但對預測人類自己的動作幾乎沒用、甚至略微變差。同一批資料,對「跨到別的身體」有效,對「留在原本的身體」無效。這暗示影片預測學到的不是「怎麼動」,而是「世界會怎麼變」——人的手和夾爪長得完全不同,但杯子推倒會滾、繩子拉緊會繃直,這些規律對誰都一樣。若這條路走得通,機器人的資料瓶頸就從「有多少人願意去操控手臂」,變成「有多少人的生活被記錄下來」。而那也會帶出一個更難回答的問題:誰的生活,誰同意的?
🔗 延伸閱讀
本篇主角
- Dyna-2 技術報告|Dyna Robotics, 2026
世界模型 × 動作
- Unified World Models|影片與動作擴散的耦合預訓練
- DreamZero|World Action Models are Zero-shot Policies
- EgoScale|以第一人稱人類影片擴展靈巧操作
對照組:VLA 路線
技術基礎
- Flow Matching|兩條路線目前都在用的生成方法