如果今天工厂突然跟你说:

「明天开始,这台机器人不要装 A 零件了。」

「改成另外一种零件。」

「顺序也换一下。」

对人来说,

可能就是主管站旁边做一次给你看。

你看懂之后,

开始试。

但对很多机器人来说,

事情没有这么简单。

机器人最麻烦的地方,不是它不会动

现在的机器手臂,

其实早就可以:

拿东西。

放东西。

搬运。

堆栈。

组装。

问题是:

工作一改,它常常就要重新学。

Skild AI 在介绍 S1 时直接指出,

传统机器人要部署一个新的操作任务,

通常得先搜集数小时的 Teleoperation 示范数据,

再针对这个工作做 Task-specific Fine-tuning。

如果想让一个陌生的长流程工作变得更可靠,

需要的示范甚至可能更多。

这在实验室里或许还可以。

但真正的工厂不会永远不变。

工厂最常发生的事情,就是「又改了」

供应商换了一个零件。

工作站重新排列。

产品改版。

组装顺序改掉。

包装方式换了。

只要流程一变,

原本调好的机器人,

就可能又要重新处理。

Skild 自己最近谈实际部署经验时也说得很直接:

如果每次改变都必须重新收数据、再 Post-training,

那等于机器人只要在工厂工作一天,

你就必须永远持续替它重新训练。

这很难规模化。

所以 Skild 想解决的,

其实不是「怎么让机器人的手再灵活一点」。

而是:

怎么让它更快学会一件以前没做过的事。

Skild 的答案:不要重新训练,先做一次给它看

Skild 最新的机器人 Foundation Model 叫做:

S1。

它最大的不同,

是把我们已经很熟悉的 AI 概念:

In-context Learning

搬进了机器人。

我们现在用 ChatGPT 时,

如果要它照某个格式写东西,

不一定要重新训练一个 ChatGPT。

你可以直接给它一个范例。

然后说:

「照这个做。」

S1 想把同样的事情,

带进真实世界。

只是它看的 Prompt,

不是文字。

而是:

视频。

例如:我要教它种一盆植物

你准备:

一个盆子。

一些土。

一株植物。

一个浇水壶。

然后真的做一次。

先放土。

挖出位置。

把植物放进去。

补土。

最后浇水。

摄影机把整段过程录下来。

过去,

这段视频可能只是拿去当:

训练数据。

接下来还要整理数据。

再训练模型。

再测试。

再修改。

但 S1 的做法不同。

这支视频本身就是 Prompt。

它直接进入模型的 Context。

模型不去修改原本的 Weight,

也不替这一个新工作另外 Fine-tune。

那它是在照抄视频吗?

也不是。

这点非常重要。

因为如果只是把视频里:

手往左 10 公分。

再往下 5 公分。

全部原封不动重播,

那其实没有太大价值。

真实世界不可能永远一模一样。

盆栽位置可能换了。

杯子可能放到另一边。

工具可能不是同一个。

所以 S1 要做的是:

从视频里理解:

人在完成什么目标。

哪些东西有什么功能。

步骤之间是什么关系。

现在做到哪一步。

接下来应该做什么。

再把这些信息,

转成眼前这台机器人的动作。

Skild 表示,同一个 S1 Model Weight 可以处理看过与没看过的任务,不需要针对每个新任务重新 Fine-tune。

最吸引人的数字是 11 分钟

Skild 做过一个种盆栽测试。

晚上 9:16,

开始准备录像。

9:22,

录完一支人类示范视频。

9:27,

S1 已经开始在真正的 Robot Hardware 上自己运行。

也就是:

从示范视频录完,到机器开始自己做,只花大约 11 分钟。

这就是这个故事真正重要的地方。

不是:

「机器人终于会种盆栽了。」

种盆栽本身没有那么重要。

重要的是:

教它一个新工作的时间,可能开始大幅缩短。

而且不是只有三秒钟的小动作

很多 Robot Demo 很漂亮。

拿起杯子。

放下一个零件。

开一个抽屉。

视频看起来很厉害,

但可能几秒就结束。

真正困难的是:

把很多动作串在一起。

因为流程越长,

出错的机会越多。

前面一个东西没放好,

后面可能全部乱掉。

Skild 展示的 S1 任务最长可以做到约 10 分钟,

包含:

种盆栽。

煎松饼。

手冲咖啡。

组装套件。

这些工作可以包含几十个操作步骤,

而且都是模型在 Pre-training 时没有做过的完整任务。

翻松饼其实就是一个很好的例子

如果我跟你说:

「把松饼翻面。」

人类大概知道意思。

但对机器人来说,

语言里没有告诉它:

锅铲要从哪里插。

角度是多少。

手腕要怎么转。

力道怎么控制。

松饼翻到空中时,

接下来怎么接。

有些身体动作,

真的很难只靠一句话解释。

这就是为什么 Skild 认为,

对复杂的 Physical Task,

直接「做给它看」可能比「用文字告诉它」更有效。

但现在还不能说它「看一次就一定会」

这里一定要讲清楚。

Skild 做了一组陌生多步骤任务测试。

当 Pre-training 数据规模增加到 10 万小时时,

使用视频示范做 In-context Learning 的模型,

平均累积每步成功率约为:

66%。

对照的 Language-prompted VLA Policy,

则约为:

9%。

66% 比 9% 高非常多。

但 66% 也不是 100%。

也就是说:

今天还不能把 S1 理解成:

「拿手机拍一下,工厂明天就完全不用工程师了。」

距离真正大规模、长时间、高可靠度的生产,

还有很多问题要解决。

甚至 Skild 自己的评估还允许人工恢复

Skild 在比较陌生长流程任务时,

为了让整个任务可以完整跑到底并计算每一步表现,

测试过程在失败后可以由人介入,

让流程恢复后继续往下测。

这也代表那个 66%:

不是「机器可以完全无人监督地完成 66% 的整个任务」。

而是平均的 cumulative per-step success rate。

这两个概念不能混在一起。

那为什么这件事还是很重要?

因为真正的比较不是:

66% 跟完美的 100%。

而是:

教一个新工作的成本到底可以降多少。

Skild 另外做了一个测试。

如果走传统 Post-training 路线,

要让对照模型达到跟 S1 单一视频示范接近的 66% 表现,

大约需要:

380 次 Post-training 示范。

而这些 4~10 分钟的长流程 Demo,

搜集起来大约需要:

50~100 小时 Teleoperation。

S1 使用的则是:

一个视频示范。

差别就在这里。

机器人正在出现自己的「Prompt 时代」

以前生成式 AI 最大的改变之一,

就是普通人不需要重新训练一个模型。

你只需要告诉它:

我要什么。

给它一些 Context。

给它范例。

它就开始做。

现在 Physical AI 也正在尝试走同一条路。

未来工厂主管或技术人员,

可能不需要每次流程改变,

就先成立一个新的 Robot Training Project。

有些工作也许只需要:

把新流程做一次。

录下来。

交给机器。

让它先试。

然后人再看哪里出错。

这才可能真正改变机器人进工厂的速度

工厂一直都不是缺会重复做一件事的机器。

传统机械手臂,

早就非常会做固定工作。

真正麻烦的是:

一变就不会。

零件移动了。

不会。

流程改了。

重新设置。

新产品来了。

重新训练。

如果未来机器真的能从一次示范快速适应,

真正被改变的就不是某一台机器手臂。

而是:

工厂教机器工作的方式。

这也可能让「人的示范能力」变得更重要

以前我们常问:

未来人要不要学写 Prompt?

如果 Physical AI 继续往这个方向走,

工厂里可能还会多一种 Prompt:

你亲手做给它看。

因为机器看到的示范越清楚,

工作目标越明确,

它越有机会理解:

你到底想完成什么。

到那时,

真正重要的能力可能不只是会操作机器。

而是:

会把工作拆清楚。

知道正确顺序。

知道哪个步骤最关键。

知道怎么示范一个好的流程。

这些其实本来就是熟练工人的经验。

只是未来,

他们可能不只是在教新人。

还会开始:

教机器。

所以 Skild S1 真正有意思的,不是它会煎松饼

煎松饼很吸睛。

种盆栽很好拍。

手冲咖啡也很适合 Demo。

但真正值得看的,

其实是这件事:

机器人学新工作的入口,正在从「重新训练模型」,慢慢变成「给它一个 Context」。

今天还只有大约 66% 的陌生任务每步成功率。

离真正可靠还有距离。

但如果这条路继续进步,

未来工厂里很可能出现一个以前很少看到的画面:

一名熟练工人站在工作台前。

做一次。

旁边的机器看一次。

然后换它开始做。

到那个时候,

我们教 AI 的方式,

就真的从键盘上的 Prompt,

走进了真实世界。

你觉得未来最有价值的人,

会不会不是「跟机器比谁做得快」,

而是「最知道该怎么把工作教给机器的人」?

今天,和 AI 一起进步一点。

每天学会一个 AI 技巧。

每天节省一点时间。

每天提升一点能力。

SasaDaily,陪你一起成长。

推荐阅读

AI 不只活在屏幕里:日本正把实体 AI 带进工厂、医疗与生活现场

中国人形机器人明明会打拳、跑百米,为什么进工厂反而还比传统机械手臂难用?

工厂明明都在等人形机器人,为什么 Harmoni 只把一台平板吸在旧机器旁边?