[{"data":1,"prerenderedAt":395},["ShallowReactive",2],{"insights-list-zh":3},[4,202,319],{"id":5,"title":6,"affiliation":7,"audiences":8,"author":12,"body":13,"date":187,"description":188,"draft":189,"extension":190,"featured":189,"meta":191,"navigation":192,"path":193,"seo":194,"stem":195,"tags":196,"updatedAt":187,"urlname":200,"__hash__":201},"insights/insights/dyna：讓機器人用「預測影片」學會動作的模型.md","Dyna：讓機器人用「預測影片」學會動作的模型","國立清華大學資訊工程學系",[9,10,11],"application","researcher","developer","張宛琪",{"type":14,"value":15,"toc":179},"minimark",[16,24,28,33,36,39,44,67,70,73,76,82,87,98,103,125,130,164,169],[17,18,20],"h2",{"id":19},"什麼是-dyna",[21,22,23],"strong",{},"什麼是 Dyna",[25,26,27],"p",{},"Dyna 是 world-action model（WAM）路線的代表。跟 VLA 不同，它不是「看懂語言再生動作」，而是用一個影片擴散模型同時預測「接下來的畫面會怎麼變」和「機器人下一步該怎麼動」，動作只是接在影片骨幹旁的一條淺分支。",[17,29,31],{"id":30},"為什麼要跟影片一起訓練",[21,32,30],{},[25,34,35],{},"Dyna 的邏輯是：機器人缺的不是語言常識，而是對物理世界如何演變的直覺——手碰到東西會怎樣、繩子怎麼打結。這種知識，語言模型學不到，但人類第一人稱影片裡到處都是，而且量近乎無限，遠比遙控機械手臂錄示範便宜。他們從影片萃取手部姿態當成偽動作標籤來訓練。",[25,37,38],{},"實驗發現：只練動作、不生成影片的模型，換一個沒看過的機器人平台幾乎學不會遷移；一旦加上「同時預測未來影片」，零樣本表現大幅超越純動作訓練。甚至只是多餵沒有動作標籤、純粹拿來學影片生成的人類影片，機器人任務表現也會持續變好——影片本身成了新的擴增資料來源。",[17,40,42],{"id":41},"最近的發展",[21,43,41],{},[25,45,46,47,54,55,60,61,66],{},"2025 年 4 月的 ",[48,49,53],"a",{"href":50,"rel":51},"https://arxiv.org/abs/2504.02792",[52],"nofollow","Unified World Models"," 與 2026 年初的 ",[48,56,59],{"href":57,"rel":58},"https://arxiv.org/abs/2602.15922",[52],"DreamZero"," 等工作，把世界模型與動作合成一個模型。2026 年 8 月，Dyna Robotics 發布 ",[48,62,65],{"href":63,"rel":64},"https://www.dyna.co/dyna-2",[52],"Dyna-2","，預訓練規模衝上百萬小時人類第一人稱影片，首次驗證：人類資料規模擴大呈冪律改善，且首次觀察到「人到機器人的遷移擴展律」——模型沒看過任何機器人資料，光靠擴增人類影片，機器人任務的離線預測誤差就同步下降。實機上，僅用幾小時機器人示範做後訓練，百萬小時預訓練模型在雙臂、靈巧手、半人形平台都表現最佳，甚至只用十分鐘遙控資料就學會開瓶蓋，並展現對燈光變化、視覺遮蔽、持續干擾的高度穩健性。",[25,68,69],{},"Dyna 路線目前仍是少數團隊在探索，訓練成本更高，能否持續擴展到千萬小時規模也未知，但它給出了與 VLA 不同的答案：與其借語言常識，不如直接讓模型學會預測世界如何變化。",[25,71,72],{},"最耐人尋味的，是一個反直覺的細節：多餵純影片資料，對機器人任務持續有幫助，但對預測人類自己的動作幾乎沒用、甚至略微變差。同一批資料，對「跨到別的身體」有效，對「留在原本的身體」無效。這暗示影片預測學到的不是「怎麼動」，而是「世界會怎麼變」——人的手和夾爪長得完全不同，但杯子推倒會滾、繩子拉緊會繃直，這些規律對誰都一樣。若這條路走得通，機器人的資料瓶頸就從「有多少人願意去操控手臂」，變成「有多少人的生活被記錄下來」。而那也會帶出一個更難回答的問題：誰的生活，誰同意的？",[74,75],"hr",{},[17,77,79],{"id":78},"延伸閱讀",[21,80,81],{},"🔗 延伸閱讀",[25,83,84],{},[21,85,86],{},"本篇主角",[88,89,90],"ul",{},[91,92,93,97],"li",{},[48,94,96],{"href":63,"rel":95},[52],"Dyna-2 技術報告","｜Dyna Robotics, 2026",[25,99,100],{},[21,101,102],{},"世界模型 × 動作",[88,104,105,111,117],{},[91,106,107,110],{},[48,108,53],{"href":50,"rel":109},[52],"｜影片與動作擴散的耦合預訓練",[91,112,113,116],{},[48,114,59],{"href":57,"rel":115},[52],"｜World Action Models are Zero-shot Policies",[91,118,119,124],{},[48,120,123],{"href":121,"rel":122},"https://arxiv.org/abs/2602.16710",[52],"EgoScale","｜以第一人稱人類影片擴展靈巧操作",[25,126,127],{},[21,128,129],{},"對照組：VLA 路線",[88,131,132,140,148,156],{},[91,133,134,139],{},[48,135,138],{"href":136,"rel":137},"https://arxiv.org/abs/2307.15818",[52],"RT-2","｜開啟這條路線的起點",[91,141,142,147],{},[48,143,146],{"href":144,"rel":145},"https://arxiv.org/abs/2406.09246",[52],"OpenVLA","｜開源實作，適合入門",[91,149,150,155],{},[48,151,154],{"href":152,"rel":153},"https://arxiv.org/abs/2410.24164",[52],"π0","｜以 flow matching 生成連續動作",[91,157,158,163],{},[48,159,162],{"href":160,"rel":161},"https://arxiv.org/abs/2503.14734",[52],"GR00T N1","｜NVIDIA 的人形機器人基礎模型",[25,165,166],{},[21,167,168],{},"技術基礎",[88,170,171],{},[91,172,173,178],{},[48,174,177],{"href":175,"rel":176},"https://arxiv.org/abs/2210.02747",[52],"Flow Matching","｜兩條路線目前都在用的生成方法",{"title":180,"searchDepth":181,"depth":181,"links":182},"",2,[183,184,185,186],{"id":19,"depth":181,"text":23},{"id":30,"depth":181,"text":30},{"id":41,"depth":181,"text":41},{"id":78,"depth":181,"text":81},"2026-09-14","Dyna 屬於「世界-動作模型」路線，透過影片擴散模型同時預測未來畫面演變與機器人動作，利用龐大的人類第一人稱影片萃取手部姿態進行預訓練，打破傳統仰賴遙控機械手臂的資料瓶頸，讓模型學會物理世界變化的規律，僅需極少量的後訓練微調即可實現高度穩健且跨平台的機器人操控。",false,"md",{},true,"/insights/dyna",{"title":6,"description":188},"insights/dyna：讓機器人用「預測影片」學會動作的模型",[197,198,199],"dyna","world-action model","video prediction","dyna-world-action-model-video-prediction","8zGywuS4zlp8QBjUDnMsY9z8KFImz2V3kpgAJguSzwg",{"id":203,"title":204,"affiliation":205,"audiences":206,"author":207,"body":208,"date":309,"description":310,"draft":189,"extension":190,"featured":189,"meta":311,"navigation":192,"path":312,"seo":313,"stem":314,"tags":315,"updatedAt":309,"urlname":317,"__hash__":318},"insights/insights/agent-skills：讓-ai-學會可重複使用的專業技能.md","Agent Skills：讓 AI 學會可重複使用的專業技能","國立臺北大學統計學系",[9,10,11],"黃暐宸",{"type":14,"value":209,"toc":303},[210,216,226,232,243,249,260,266],[17,211,213],{"id":212},"agent-skills",[21,214,215],{},"Agent Skills",[25,217,218,219,225],{},"近期 Agentic AI 值得關注的發展之一，是 ",[48,220,223],{"href":221,"rel":222},"https://www.anthropic.com/engineering/equipping-agents-for-the-real-world-with-agent-skills",[52],[21,224,215],{},"。過去使用生成式 AI，常需要每次重新輸入 Prompt、背景資料與工作要求；Agent Skills 則可以把一套工作方法、規則、參考資料與工具封裝成可重複使用的「技能」，讓 AI 在遇到適合的任務時自行載入並執行。這使 AI 不只是回答問題，而是能依照既定流程完成較複雜、重複性高的工作，也讓個人或組織能逐步累積自己的 AI 工作能力。對企業來說，同一套技能也能讓不同人使用相近流程，降低重複教學與操作差異。",[17,227,229],{"id":228},"progressive-disclosure",[21,230,231],{},"Progressive Disclosure",[25,233,234,235,242],{},"Skill 的重要概念之一是 ",[48,236,239],{"href":237,"rel":238},"https://blog.aihao.tw/2026/05/20/llm-knowledge-base/",[52],[21,240,241],{},"Progressive Disclosure（漸進式披露）","。AI 不需要一開始就讀取所有 Skills 的完整內容，而是先知道目前有哪些技能，再根據任務判斷需要哪一項，之後才載入相關指令、文件、範例與其他資源。這種方式可以減少 Context 與 Token 的浪費，也避免一次塞入過多資訊影響模型判斷。當 Skills 數量愈來愈多時，這種「需要時才載入」的設計，也讓 Agent 更容易擴充不同領域的專業能力。",[17,244,246],{"id":245},"一般人也能使用skill",[21,247,248],{},"一般人也能使用Skill",[25,250,251,252,255,256,259],{},"更重要的是，",[21,253,254],{},"Skill 不只適合開發者","。一般使用者也能把經常重複的工作整理成 Skill，例如依公司格式製作會議紀錄、按照固定規則整理研究論文、修改英文履歷、產生每週工作報告，甚至整理旅遊規劃或個人學習流程。使用者主要需要把操作步驟、規則、範例與參考資料整理清楚，不一定要會複雜程式設計，也可以直接使用別人建立好的 Skill，再依自己的需求調整內容。未來使用 AI 的能力可能不只是「會下 Prompt」，而是",[21,257,258],{},"懂得把自己的知識與工作流程整理成 AI 可以反覆使用的 Skill","，讓 AI 真正成為可持續累積能力的工作助手。",[17,261,263],{"id":262},"agent-skills-推薦",[21,264,265],{},"Agent Skills 推薦",[25,267,268,269,276,277,280,281,276,288,291,292,276,299,302],{},"如果想實際體驗 Agent Skills，可以先從 GitHub 上熱門且用途廣泛的專案開始。例如 ",[48,270,273],{"href":271,"rel":272},"https://github.com/anthropics/skills?utm_source=chatgpt.com",[52],[21,274,275],{},"Anthropic 官方 Skills"," 約有 ",[21,278,279],{},"17.1 萬顆星","，其中包含 PDF、PowerPoint、Word、Excel 等文件處理 Skills，適合日常辦公與資料整理，也是了解 Skill 設計方式最直接的範例。另外，",[48,282,285],{"href":283,"rel":284},"https://github.com/mvanhorn/last30days-skill?utm_source=chatgpt.com",[52],[21,286,287],{},"Last30Days",[21,289,290],{},"5.9 萬顆星","，可以自動搜尋 Reddit、X、YouTube、TikTok、Hacker News 與網路資料，整理某個主題近期的討論與趨勢，很適合做市場調查或新知蒐集。而 ",[48,293,296],{"href":294,"rel":295},"https://github.com/blader/humanizer?utm_source=chatgpt.com",[52],[21,297,298],{},"Humanizer",[21,300,301],{},"3.8 萬顆星","，主要功能是協助修改文字中常見的 AI 寫作痕跡，讓文章語氣更自然，對報告、文章與一般文書工作都相當實用。這些案例也顯示，Agent Skills 已不只是開發者的工具，而是逐漸延伸到研究、寫作與日常辦公等一般使用情境。",{"title":180,"searchDepth":181,"depth":181,"links":304},[305,306,307,308],{"id":212,"depth":181,"text":215},{"id":228,"depth":181,"text":231},{"id":245,"depth":181,"text":248},{"id":262,"depth":181,"text":265},"2026-08-31","Agent Skills 將工作流程、規則與領域知識封裝成可重複使用的 AI 能力，使模型能透過「漸進式披露」機制執行複雜任務，同時避免佔用過多上下文空間。",{},"/insights/agent-skills-ai",{"title":204,"description":310},"insights/agent-skills：讓-ai-學會可重複使用的專業技能",[215,231,316,287,298],"Anthropic","agent-skills-progressive-disclosure","1uwbvK8pSat--FHnc5-gHilQqFjFBktdgEq7Vtc1sWE",{"id":320,"title":321,"affiliation":322,"audiences":323,"author":324,"body":325,"date":382,"description":383,"draft":189,"extension":190,"featured":189,"meta":384,"navigation":192,"path":385,"seo":386,"stem":387,"tags":388,"updatedAt":392,"urlname":393,"__hash__":394},"insights/insights/vla-robot-language-models.md","VLA：讓機器人聽懂人話的模型","國立清華大學 資訊工程學系",[9,11,10],"李達安",{"type":14,"value":326,"toc":377},[327,331,334,337,341,344,347,350,352,355,374],[17,328,330],{"id":329},"什麼是-vla","什麼是 VLA",[25,332,333],{},"VLA 是 Vision-Language-Action 的縮寫。它的輸入是攝影機畫面加上一句自然語言指令，例如「把番茄醬放進籃子裡」；輸出則是機器人下一步該怎麼動——手臂的關節角度、夾爪的開合。",[25,335,336],{},"過去的機器人，一個任務要工程師手刻一套程式，或訓練一個專用模型，換個場景就得重來。VLA 想做的是「一個模型、多種任務、多種機器人」，成為機器人的通用大腦。",[17,338,340],{"id":339},"為什麼要用-vlm-當-backbone","為什麼要用 VLM 當 backbone",[25,342,343],{},"關鍵在資料量。網路上有數兆字的文本與數十億張圖片，但機器人操作資料得靠真人遙控機械手臂一筆一筆錄下來，數量少了好幾個量級。從零開始訓練，模型只會死背示範動作，換一個沒看過的杯子就失敗。",[25,345,346],{},"而視覺語言模型（VLM）已經在網路規模的資料上，學會了「番茄醬長什麼樣」「紅色的球在左邊」「杯子要抓把手」這類視覺常識與語言理解。VLA 的做法就是直接接手這顆大腦，在後面加上一個「動作專家」，把動作當成另一種要生成的語言來預測。",[25,348,349],{},"這樣一來，機器人的泛化能力是從網路資料繼承來的，而不是從稀少的機器人資料硬學。面對沒見過的物體、沒聽過的講法，才有機會做對。",[17,351,41],{"id":41},[25,353,354],{},"2023 年的 RT-2 首次證明這條路可行，2024 年的 OpenVLA 開源讓學術界也能開始使用。2025 年之後開始走向產品化：Physical Intelligence 的 π0 / π0.5 用 flow matching 生成連續且高頻的動作；NVIDIA GR00T 與 Google Gemini Robotics 則採「快慢雙系統」——慢的 VLM 負責理解與規劃，快的動作專家負責即時控制。",[25,356,357,358,361,362,365,366,369,370,373],{},"2026 年的幾條主線包括：",[21,359,360],{},"效率","，七十億參數的模型推理速度離即時控制還差一個量級，因此出現大量蒸餾、量化和 token 剪枝的方法；",[21,363,364],{},"推理","，讓模型先「想一步」再動作；",[21,367,368],{},"資料擴張","，例如用數萬小時的人類第一人稱影片做預訓練，並發現靈巧度也存在 scaling law；以及",[21,371,372],{},"與世界模型結合","，讓模型一邊預測接下來會發生什麼，一邊決定要怎麼動。",[25,375,376],{},"VLA 還沒解決所有問題：泛化仍然脆弱，真機評估依然昂貴。但方向已經很清楚——把語言模型的成功配方，搬進物理世界。",{"title":180,"searchDepth":181,"depth":181,"links":378},[379,380,381],{"id":329,"depth":181,"text":330},{"id":339,"depth":181,"text":340},{"id":41,"depth":181,"text":41},"2026-08-19","把語言模型的成功配方搬進物理世界——VLA 如何讓機器人理解沒見過的物體與沒聽過的指令。",{},"/insights/vla-robot-language-models",{"title":321,"description":383},"insights/vla-robot-language-models",[389,390,391],"VLA","VLM","機器人",null,"vla-robot-language-models","yqzYajLXWmcu8GABLlbDvSEm241nq5CeFxFd94MMe5A",1790125405179]