如果今天工廠突然跟你說:
「明天開始,這台機器人不要裝 A 零件了。」
「改成另外一種零件。」
「順序也換一下。」
對人來說,
可能就是主管站旁邊做一次給你看。
你看懂之後,
開始試。
但對很多機器人來說,
事情沒有這麼簡單。
機器人最麻煩的地方,不是它不會動
現在的機器手臂,
其實早就可以:
拿東西。
放東西。
搬運。
堆疊。
組裝。
問題是:
工作一改,它常常就要重新學。
Skild AI 在介紹 S1 時直接指出,
傳統機器人要部署一個新的操作任務,
通常得先蒐集數小時的 Teleoperation 示範資料,
再針對這個工作做 Task-specific Fine-tuning。
如果想讓一個陌生的長流程工作變得更可靠,
需要的示範甚至可能更多。
這在實驗室裡或許還可以。
但真正的工廠不會永遠不變。
工廠最常發生的事情,就是「又改了」
供應商換了一個零件。
工作站重新排列。
產品改版。
組裝順序改掉。
包裝方式換了。
只要流程一變,
原本調好的機器人,
就可能又要重新處理。
Skild 自己最近談實際部署經驗時也說得很直接:
如果每次改變都必須重新收資料、再 Post-training,
那等於機器人只要在工廠工作一天,
你就必須永遠持續替它重新訓練。
這很難規模化。
所以 Skild 想解決的,
其實不是「怎麼讓機器人的手再靈活一點」。
而是:
怎麼讓它更快學會一件以前沒做過的事。
Skild 的答案:不要重新訓練,先做一次給它看
Skild 最新的機器人 Foundation Model 叫做:
S1。
它最大的不同,
是把我們已經很熟悉的 AI 概念:
In-context Learning
搬進了機器人。
我們現在用 ChatGPT 時,
如果要它照某個格式寫東西,
不一定要重新訓練一個 ChatGPT。
你可以直接給它一個範例。
然後說:
「照這個做。」
S1 想把同樣的事情,
帶進真實世界。
只是它看的 Prompt,
不是文字。
而是:
影片。
例如:我要教它種一盆植物
你準備:
一個盆子。
一些土。
一株植物。
一個澆水壺。
然後真的做一次。
先放土。
挖出位置。
把植物放進去。
補土。
最後澆水。
攝影機把整段過程錄下來。
過去,
這段影片可能只是拿去當:
訓練資料。
接下來還要整理資料。
再訓練模型。
再測試。
再修改。
但 S1 的做法不同。
這支影片本身就是 Prompt。
它直接進入模型的 Context。
模型不去修改原本的 Weight,
也不替這一個新工作另外 Fine-tune。
那它是在照抄影片嗎?
也不是。
這點非常重要。
因為如果只是把影片裡:
手往左 10 公分。
再往下 5 公分。
全部原封不動重播,
那其實沒有太大價值。
真實世界不可能永遠一模一樣。
盆栽位置可能換了。
杯子可能放到另一邊。
工具可能不是同一個。
所以 S1 要做的是:
從影片裡理解:
人在完成什麼目標。
哪些東西有什麼功能。
步驟之間是什麼關係。
現在做到哪一步。
接下來應該做什麼。
再把這些資訊,
轉成眼前這台機器人的動作。
Skild 表示,同一個 S1 Model Weight 可以處理看過與沒看過的任務,不需要針對每個新任務重新 Fine-tune。
最吸引人的數字是 11 分鐘
Skild 做過一個種盆栽測試。
晚上 9:16,
開始準備錄影。
9:22,
錄完一支人類示範影片。
9:27,
S1 已經開始在真正的 Robot Hardware 上自己執行。
也就是:
從示範影片錄完,到機器開始自己做,只花大約 11 分鐘。
這就是這個故事真正重要的地方。
不是:
「機器人終於會種盆栽了。」
種盆栽本身沒有那麼重要。
重要的是:
教它一個新工作的時間,可能開始大幅縮短。
而且不是只有三秒鐘的小動作
很多 Robot Demo 很漂亮。
拿起杯子。
放下一個零件。
開一個抽屜。
影片看起來很厲害,
但可能幾秒就結束。
真正困難的是:
把很多動作串在一起。
因為流程越長,
出錯的機會越多。
前面一個東西沒放好,
後面可能全部亂掉。
Skild 展示的 S1 任務最長可以做到約 10 分鐘,
包含:
種盆栽。
煎鬆餅。
手沖咖啡。
組裝套件。
這些工作可以包含幾十個操作步驟,
而且都是模型在 Pre-training 時沒有做過的完整任務。
翻鬆餅其實就是一個很好的例子
如果我跟你說:
「把鬆餅翻面。」
人類大概知道意思。
但對機器人來說,
語言裡沒有告訴它:
鍋鏟要從哪裡插。
角度是多少。
手腕要怎麼轉。
力道怎麼控制。
鬆餅翻到空中時,
接下來怎麼接。
有些身體動作,
真的很難只靠一句話解釋。
這就是為什麼 Skild 認為,
對複雜的 Physical Task,
直接「做給它看」可能比「用文字告訴它」更有效。
但現在還不能說它「看一次就一定會」
這裡一定要講清楚。
Skild 做了一組陌生多步驟任務測試。
當 Pre-training 資料規模增加到 10 萬小時時,
使用影片示範做 In-context Learning 的模型,
平均累積每步成功率約為:
66%。
對照的 Language-prompted VLA Policy,
則約為:
9%。
66% 比 9% 高非常多。
但 66% 也不是 100%。
也就是說:
今天還不能把 S1 理解成:
「拿手機拍一下,工廠明天就完全不用工程師了。」
距離真正大規模、長時間、高可靠度的生產,
還有很多問題要解決。
甚至 Skild 自己的評估還允許人工恢復
Skild 在比較陌生長流程任務時,
為了讓整個任務可以完整跑到底並計算每一步表現,
測試過程在失敗後可以由人介入,
讓流程恢復後繼續往下測。
這也代表那個 66%:
不是「機器可以完全無人監督地完成 66% 的整個任務」。
而是平均的 cumulative per-step success rate。
這兩個概念不能混在一起。
那為什麼這件事還是很重要?
因為真正的比較不是:
66% 跟完美的 100%。
而是:
教一個新工作的成本到底可以降多少。
Skild 另外做了一個測試。
如果走傳統 Post-training 路線,
要讓對照模型達到跟 S1 單一影片示範接近的 66% 表現,
大約需要:
380 次 Post-training 示範。
而這些 4~10 分鐘的長流程 Demo,
蒐集起來大約需要:
50~100 小時 Teleoperation。
S1 使用的則是:
一個影片示範。
差別就在這裡。
機器人正在出現自己的「Prompt 時代」
以前生成式 AI 最大的改變之一,
就是普通人不需要重新訓練一個模型。
你只需要告訴它:
我要什麼。
給它一些 Context。
給它範例。
它就開始做。
現在 Physical AI 也正在嘗試走同一條路。
未來工廠主管或技術人員,
可能不需要每次流程改變,
就先成立一個新的 Robot Training Project。
有些工作也許只需要:
把新流程做一次。
錄下來。
交給機器。
讓它先試。
然後人再看哪裡出錯。
這才可能真正改變機器人進工廠的速度
工廠一直都不是缺會重複做一件事的機器。
傳統機械手臂,
早就非常會做固定工作。
真正麻煩的是:
一變就不會。
零件移動了。
不會。
流程改了。
重新設定。
新產品來了。
重新訓練。
如果未來機器真的能從一次示範快速適應,
真正被改變的就不是某一台機器手臂。
而是:
工廠教機器工作的方式。
這也可能讓「人的示範能力」變得更重要
以前我們常問:
未來人要不要學寫 Prompt?
如果 Physical AI 繼續往這個方向走,
工廠裡可能還會多一種 Prompt:
你親手做給它看。
因為機器看到的示範越清楚,
工作目標越明確,
它越有機會理解:
你到底想完成什麼。
到那時,
真正重要的能力可能不只是會操作機器。
而是:
會把工作拆清楚。
知道正確順序。
知道哪個步驟最關鍵。
知道怎麼示範一個好的流程。
這些其實本來就是熟練工人的經驗。
只是未來,
他們可能不只是在教新人。
還會開始:
教機器。
所以 Skild S1 真正有意思的,不是它會煎鬆餅
煎鬆餅很吸睛。
種盆栽很好拍。
手沖咖啡也很適合 Demo。
但真正值得看的,
其實是這件事:
機器人學新工作的入口,正在從「重新訓練模型」,慢慢變成「給它一個 Context」。
今天還只有大約 66% 的陌生任務每步成功率。
離真正可靠還有距離。
但如果這條路繼續進步,
未來工廠裡很可能出現一個以前很少看到的畫面:
一名熟練工人站在工作台前。
做一次。
旁邊的機器看一次。
然後換它開始做。
到那個時候,
我們教 AI 的方式,
就真的從鍵盤上的 Prompt,
走進了真實世界。
你覺得未來最有價值的人,
會不會不是「跟機器比誰做得快」,
而是「最知道該怎麼把工作教給機器的人」?
今天,和 AI 一起進步一點。
每天學會一個 AI 技巧。
每天節省一點時間。
每天提升一點能力。
SasaDaily,陪你一起成長。
推薦閱讀
AI 不只活在螢幕裡:日本正把實體 AI 帶進工廠、醫療與生活現場