如果今天工廠突然跟你說:

「明天開始,這台機器人不要裝 A 零件了。」

「改成另外一種零件。」

「順序也換一下。」

對人來說,

可能就是主管站旁邊做一次給你看。

你看懂之後,

開始試。

但對很多機器人來說,

事情沒有這麼簡單。

機器人最麻煩的地方,不是它不會動

現在的機器手臂,

其實早就可以:

拿東西。

放東西。

搬運。

堆疊。

組裝。

問題是:

工作一改,它常常就要重新學。

Skild AI 在介紹 S1 時直接指出,

傳統機器人要部署一個新的操作任務,

通常得先蒐集數小時的 Teleoperation 示範資料,

再針對這個工作做 Task-specific Fine-tuning。

如果想讓一個陌生的長流程工作變得更可靠,

需要的示範甚至可能更多。

這在實驗室裡或許還可以。

但真正的工廠不會永遠不變。

工廠最常發生的事情,就是「又改了」

供應商換了一個零件。

工作站重新排列。

產品改版。

組裝順序改掉。

包裝方式換了。

只要流程一變,

原本調好的機器人,

就可能又要重新處理。

Skild 自己最近談實際部署經驗時也說得很直接:

如果每次改變都必須重新收資料、再 Post-training,

那等於機器人只要在工廠工作一天,

你就必須永遠持續替它重新訓練。

這很難規模化。

所以 Skild 想解決的,

其實不是「怎麼讓機器人的手再靈活一點」。

而是:

怎麼讓它更快學會一件以前沒做過的事。

Skild 的答案:不要重新訓練,先做一次給它看

Skild 最新的機器人 Foundation Model 叫做:

S1。

它最大的不同,

是把我們已經很熟悉的 AI 概念:

In-context Learning

搬進了機器人。

我們現在用 ChatGPT 時,

如果要它照某個格式寫東西,

不一定要重新訓練一個 ChatGPT。

你可以直接給它一個範例。

然後說:

「照這個做。」

S1 想把同樣的事情,

帶進真實世界。

只是它看的 Prompt,

不是文字。

而是:

影片。

例如:我要教它種一盆植物

你準備:

一個盆子。

一些土。

一株植物。

一個澆水壺。

然後真的做一次。

先放土。

挖出位置。

把植物放進去。

補土。

最後澆水。

攝影機把整段過程錄下來。

過去,

這段影片可能只是拿去當:

訓練資料。

接下來還要整理資料。

再訓練模型。

再測試。

再修改。

但 S1 的做法不同。

這支影片本身就是 Prompt。

它直接進入模型的 Context。

模型不去修改原本的 Weight,

也不替這一個新工作另外 Fine-tune。

那它是在照抄影片嗎?

也不是。

這點非常重要。

因為如果只是把影片裡:

手往左 10 公分。

再往下 5 公分。

全部原封不動重播,

那其實沒有太大價值。

真實世界不可能永遠一模一樣。

盆栽位置可能換了。

杯子可能放到另一邊。

工具可能不是同一個。

所以 S1 要做的是:

從影片裡理解:

人在完成什麼目標。

哪些東西有什麼功能。

步驟之間是什麼關係。

現在做到哪一步。

接下來應該做什麼。

再把這些資訊,

轉成眼前這台機器人的動作。

Skild 表示,同一個 S1 Model Weight 可以處理看過與沒看過的任務,不需要針對每個新任務重新 Fine-tune。

最吸引人的數字是 11 分鐘

Skild 做過一個種盆栽測試。

晚上 9:16,

開始準備錄影。

9:22,

錄完一支人類示範影片。

9:27,

S1 已經開始在真正的 Robot Hardware 上自己執行。

也就是:

從示範影片錄完,到機器開始自己做,只花大約 11 分鐘。

這就是這個故事真正重要的地方。

不是:

「機器人終於會種盆栽了。」

種盆栽本身沒有那麼重要。

重要的是:

教它一個新工作的時間,可能開始大幅縮短。

而且不是只有三秒鐘的小動作

很多 Robot Demo 很漂亮。

拿起杯子。

放下一個零件。

開一個抽屜。

影片看起來很厲害,

但可能幾秒就結束。

真正困難的是:

把很多動作串在一起。

因為流程越長,

出錯的機會越多。

前面一個東西沒放好,

後面可能全部亂掉。

Skild 展示的 S1 任務最長可以做到約 10 分鐘,

包含:

種盆栽。

煎鬆餅。

手沖咖啡。

組裝套件。

這些工作可以包含幾十個操作步驟,

而且都是模型在 Pre-training 時沒有做過的完整任務。

翻鬆餅其實就是一個很好的例子

如果我跟你說:

「把鬆餅翻面。」

人類大概知道意思。

但對機器人來說,

語言裡沒有告訴它:

鍋鏟要從哪裡插。

角度是多少。

手腕要怎麼轉。

力道怎麼控制。

鬆餅翻到空中時,

接下來怎麼接。

有些身體動作,

真的很難只靠一句話解釋。

這就是為什麼 Skild 認為,

對複雜的 Physical Task,

直接「做給它看」可能比「用文字告訴它」更有效。

但現在還不能說它「看一次就一定會」

這裡一定要講清楚。

Skild 做了一組陌生多步驟任務測試。

當 Pre-training 資料規模增加到 10 萬小時時,

使用影片示範做 In-context Learning 的模型,

平均累積每步成功率約為:

66%。

對照的 Language-prompted VLA Policy,

則約為:

9%。

66% 比 9% 高非常多。

但 66% 也不是 100%。

也就是說:

今天還不能把 S1 理解成:

「拿手機拍一下,工廠明天就完全不用工程師了。」

距離真正大規模、長時間、高可靠度的生產,

還有很多問題要解決。

甚至 Skild 自己的評估還允許人工恢復

Skild 在比較陌生長流程任務時,

為了讓整個任務可以完整跑到底並計算每一步表現,

測試過程在失敗後可以由人介入,

讓流程恢復後繼續往下測。

這也代表那個 66%:

不是「機器可以完全無人監督地完成 66% 的整個任務」。

而是平均的 cumulative per-step success rate。

這兩個概念不能混在一起。

那為什麼這件事還是很重要?

因為真正的比較不是:

66% 跟完美的 100%。

而是:

教一個新工作的成本到底可以降多少。

Skild 另外做了一個測試。

如果走傳統 Post-training 路線,

要讓對照模型達到跟 S1 單一影片示範接近的 66% 表現,

大約需要:

380 次 Post-training 示範。

而這些 4~10 分鐘的長流程 Demo,

蒐集起來大約需要:

50~100 小時 Teleoperation。

S1 使用的則是:

一個影片示範。

差別就在這裡。

機器人正在出現自己的「Prompt 時代」

以前生成式 AI 最大的改變之一,

就是普通人不需要重新訓練一個模型。

你只需要告訴它:

我要什麼。

給它一些 Context。

給它範例。

它就開始做。

現在 Physical AI 也正在嘗試走同一條路。

未來工廠主管或技術人員,

可能不需要每次流程改變,

就先成立一個新的 Robot Training Project。

有些工作也許只需要:

把新流程做一次。

錄下來。

交給機器。

讓它先試。

然後人再看哪裡出錯。

這才可能真正改變機器人進工廠的速度

工廠一直都不是缺會重複做一件事的機器。

傳統機械手臂,

早就非常會做固定工作。

真正麻煩的是:

一變就不會。

零件移動了。

不會。

流程改了。

重新設定。

新產品來了。

重新訓練。

如果未來機器真的能從一次示範快速適應,

真正被改變的就不是某一台機器手臂。

而是:

工廠教機器工作的方式。

這也可能讓「人的示範能力」變得更重要

以前我們常問:

未來人要不要學寫 Prompt?

如果 Physical AI 繼續往這個方向走,

工廠裡可能還會多一種 Prompt:

你親手做給它看。

因為機器看到的示範越清楚,

工作目標越明確,

它越有機會理解:

你到底想完成什麼。

到那時,

真正重要的能力可能不只是會操作機器。

而是:

會把工作拆清楚。

知道正確順序。

知道哪個步驟最關鍵。

知道怎麼示範一個好的流程。

這些其實本來就是熟練工人的經驗。

只是未來,

他們可能不只是在教新人。

還會開始:

教機器。

所以 Skild S1 真正有意思的,不是它會煎鬆餅

煎鬆餅很吸睛。

種盆栽很好拍。

手沖咖啡也很適合 Demo。

但真正值得看的,

其實是這件事:

機器人學新工作的入口,正在從「重新訓練模型」,慢慢變成「給它一個 Context」。

今天還只有大約 66% 的陌生任務每步成功率。

離真正可靠還有距離。

但如果這條路繼續進步,

未來工廠裡很可能出現一個以前很少看到的畫面:

一名熟練工人站在工作台前。

做一次。

旁邊的機器看一次。

然後換它開始做。

到那個時候,

我們教 AI 的方式,

就真的從鍵盤上的 Prompt,

走進了真實世界。

你覺得未來最有價值的人,

會不會不是「跟機器比誰做得快」,

而是「最知道該怎麼把工作教給機器的人」?

今天,和 AI 一起進步一點。

每天學會一個 AI 技巧。

每天節省一點時間。

每天提升一點能力。

SasaDaily,陪你一起成長。

推薦閱讀

AI 不只活在螢幕裡:日本正把實體 AI 帶進工廠、醫療與生活現場

中國人形機器人明明會打拳、跑百米,為什麼進工廠反而還比傳統機械手臂難用?

工廠明明都在等人形機器人,為什麼 Harmoni 只把一台平板吸在舊機器旁邊?