什麼是 VLA
VLA 是 Vision-Language-Action 的縮寫。它的輸入是攝影機畫面加上一句自然語言指令,例如「把番茄醬放進籃子裡」;輸出則是機器人下一步該怎麼動——手臂的關節角度、夾爪的開合。
過去的機器人,一個任務要工程師手刻一套程式,或訓練一個專用模型,換個場景就得重來。VLA 想做的是「一個模型、多種任務、多種機器人」,成為機器人的通用大腦。
為什麼要用 VLM 當 backbone
關鍵在資料量。網路上有數兆字的文本與數十億張圖片,但機器人操作資料得靠真人遙控機械手臂一筆一筆錄下來,數量少了好幾個量級。從零開始訓練,模型只會死背示範動作,換一個沒看過的杯子就失敗。
而視覺語言模型(VLM)已經在網路規模的資料上,學會了「番茄醬長什麼樣」「紅色的球在左邊」「杯子要抓把手」這類視覺常識與語言理解。VLA 的做法就是直接接手這顆大腦,在後面加上一個「動作專家」,把動作當成另一種要生成的語言來預測。
這樣一來,機器人的泛化能力是從網路資料繼承來的,而不是從稀少的機器人資料硬學。面對沒見過的物體、沒聽過的講法,才有機會做對。
最近的發展
2023 年的 RT-2 首次證明這條路可行,2024 年的 OpenVLA 開源讓學術界也能開始使用。2025 年之後開始走向產品化:Physical Intelligence 的 π0 / π0.5 用 flow matching 生成連續且高頻的動作;NVIDIA GR00T 與 Google Gemini Robotics 則採「快慢雙系統」——慢的 VLM 負責理解與規劃,快的動作專家負責即時控制。
2026 年的幾條主線包括:效率,七十億參數的模型推理速度離即時控制還差一個量級,因此出現大量蒸餾、量化和 token 剪枝的方法;推理,讓模型先「想一步」再動作;資料擴張,例如用數萬小時的人類第一人稱影片做預訓練,並發現靈巧度也存在 scaling law;以及與世界模型結合,讓模型一邊預測接下來會發生什麼,一邊決定要怎麼動。
VLA 還沒解決所有問題:泛化仍然脆弱,真機評估依然昂貴。但方向已經很清楚——把語言模型的成功配方,搬進物理世界。