如果今天工厂突然跟你说:
「明天开始,这台机器人不要装 A 零件了。」
「改成另外一种零件。」
「顺序也换一下。」
对人来说,
可能就是主管站旁边做一次给你看。
你看懂之后,
开始试。
但对很多机器人来说,
事情没有这么简单。
机器人最麻烦的地方,不是它不会动
现在的机器手臂,
其实早就可以:
拿东西。
放东西。
搬运。
堆栈。
组装。
问题是:
工作一改,它常常就要重新学。
Skild AI 在介绍 S1 时直接指出,
传统机器人要部署一个新的操作任务,
通常得先搜集数小时的 Teleoperation 示范数据,
再针对这个工作做 Task-specific Fine-tuning。
如果想让一个陌生的长流程工作变得更可靠,
需要的示范甚至可能更多。
这在实验室里或许还可以。
但真正的工厂不会永远不变。
工厂最常发生的事情,就是「又改了」
供应商换了一个零件。
工作站重新排列。
产品改版。
组装顺序改掉。
包装方式换了。
只要流程一变,
原本调好的机器人,
就可能又要重新处理。
Skild 自己最近谈实际部署经验时也说得很直接:
如果每次改变都必须重新收数据、再 Post-training,
那等于机器人只要在工厂工作一天,
你就必须永远持续替它重新训练。
这很难规模化。
所以 Skild 想解决的,
其实不是「怎么让机器人的手再灵活一点」。
而是:
怎么让它更快学会一件以前没做过的事。
Skild 的答案:不要重新训练,先做一次给它看
Skild 最新的机器人 Foundation Model 叫做:
S1。
它最大的不同,
是把我们已经很熟悉的 AI 概念:
In-context Learning
搬进了机器人。
我们现在用 ChatGPT 时,
如果要它照某个格式写东西,
不一定要重新训练一个 ChatGPT。
你可以直接给它一个范例。
然后说:
「照这个做。」
S1 想把同样的事情,
带进真实世界。
只是它看的 Prompt,
不是文字。
而是:
视频。
例如:我要教它种一盆植物
你准备:
一个盆子。
一些土。
一株植物。
一个浇水壶。
然后真的做一次。
先放土。
挖出位置。
把植物放进去。
补土。
最后浇水。
摄影机把整段过程录下来。
过去,
这段视频可能只是拿去当:
训练数据。
接下来还要整理数据。
再训练模型。
再测试。
再修改。
但 S1 的做法不同。
这支视频本身就是 Prompt。
它直接进入模型的 Context。
模型不去修改原本的 Weight,
也不替这一个新工作另外 Fine-tune。
那它是在照抄视频吗?
也不是。
这点非常重要。
因为如果只是把视频里:
手往左 10 公分。
再往下 5 公分。
全部原封不动重播,
那其实没有太大价值。
真实世界不可能永远一模一样。
盆栽位置可能换了。
杯子可能放到另一边。
工具可能不是同一个。
所以 S1 要做的是:
从视频里理解:
人在完成什么目标。
哪些东西有什么功能。
步骤之间是什么关系。
现在做到哪一步。
接下来应该做什么。
再把这些信息,
转成眼前这台机器人的动作。
Skild 表示,同一个 S1 Model Weight 可以处理看过与没看过的任务,不需要针对每个新任务重新 Fine-tune。
最吸引人的数字是 11 分钟
Skild 做过一个种盆栽测试。
晚上 9:16,
开始准备录像。
9:22,
录完一支人类示范视频。
9:27,
S1 已经开始在真正的 Robot Hardware 上自己运行。
也就是:
从示范视频录完,到机器开始自己做,只花大约 11 分钟。
这就是这个故事真正重要的地方。
不是:
「机器人终于会种盆栽了。」
种盆栽本身没有那么重要。
重要的是:
教它一个新工作的时间,可能开始大幅缩短。
而且不是只有三秒钟的小动作
很多 Robot Demo 很漂亮。
拿起杯子。
放下一个零件。
开一个抽屉。
视频看起来很厉害,
但可能几秒就结束。
真正困难的是:
把很多动作串在一起。
因为流程越长,
出错的机会越多。
前面一个东西没放好,
后面可能全部乱掉。
Skild 展示的 S1 任务最长可以做到约 10 分钟,
包含:
种盆栽。
煎松饼。
手冲咖啡。
组装套件。
这些工作可以包含几十个操作步骤,
而且都是模型在 Pre-training 时没有做过的完整任务。
翻松饼其实就是一个很好的例子
如果我跟你说:
「把松饼翻面。」
人类大概知道意思。
但对机器人来说,
语言里没有告诉它:
锅铲要从哪里插。
角度是多少。
手腕要怎么转。
力道怎么控制。
松饼翻到空中时,
接下来怎么接。
有些身体动作,
真的很难只靠一句话解释。
这就是为什么 Skild 认为,
对复杂的 Physical Task,
直接「做给它看」可能比「用文字告诉它」更有效。
但现在还不能说它「看一次就一定会」
这里一定要讲清楚。
Skild 做了一组陌生多步骤任务测试。
当 Pre-training 数据规模增加到 10 万小时时,
使用视频示范做 In-context Learning 的模型,
平均累积每步成功率约为:
66%。
对照的 Language-prompted VLA Policy,
则约为:
9%。
66% 比 9% 高非常多。
但 66% 也不是 100%。
也就是说:
今天还不能把 S1 理解成:
「拿手机拍一下,工厂明天就完全不用工程师了。」
距离真正大规模、长时间、高可靠度的生产,
还有很多问题要解决。
甚至 Skild 自己的评估还允许人工恢复
Skild 在比较陌生长流程任务时,
为了让整个任务可以完整跑到底并计算每一步表现,
测试过程在失败后可以由人介入,
让流程恢复后继续往下测。
这也代表那个 66%:
不是「机器可以完全无人监督地完成 66% 的整个任务」。
而是平均的 cumulative per-step success rate。
这两个概念不能混在一起。
那为什么这件事还是很重要?
因为真正的比较不是:
66% 跟完美的 100%。
而是:
教一个新工作的成本到底可以降多少。
Skild 另外做了一个测试。
如果走传统 Post-training 路线,
要让对照模型达到跟 S1 单一视频示范接近的 66% 表现,
大约需要:
380 次 Post-training 示范。
而这些 4~10 分钟的长流程 Demo,
搜集起来大约需要:
50~100 小时 Teleoperation。
S1 使用的则是:
一个视频示范。
差别就在这里。
机器人正在出现自己的「Prompt 时代」
以前生成式 AI 最大的改变之一,
就是普通人不需要重新训练一个模型。
你只需要告诉它:
我要什么。
给它一些 Context。
给它范例。
它就开始做。
现在 Physical AI 也正在尝试走同一条路。
未来工厂主管或技术人员,
可能不需要每次流程改变,
就先成立一个新的 Robot Training Project。
有些工作也许只需要:
把新流程做一次。
录下来。
交给机器。
让它先试。
然后人再看哪里出错。
这才可能真正改变机器人进工厂的速度
工厂一直都不是缺会重复做一件事的机器。
传统机械手臂,
早就非常会做固定工作。
真正麻烦的是:
一变就不会。
零件移动了。
不会。
流程改了。
重新设置。
新产品来了。
重新训练。
如果未来机器真的能从一次示范快速适应,
真正被改变的就不是某一台机器手臂。
而是:
工厂教机器工作的方式。
这也可能让「人的示范能力」变得更重要
以前我们常问:
未来人要不要学写 Prompt?
如果 Physical AI 继续往这个方向走,
工厂里可能还会多一种 Prompt:
你亲手做给它看。
因为机器看到的示范越清楚,
工作目标越明确,
它越有机会理解:
你到底想完成什么。
到那时,
真正重要的能力可能不只是会操作机器。
而是:
会把工作拆清楚。
知道正确顺序。
知道哪个步骤最关键。
知道怎么示范一个好的流程。
这些其实本来就是熟练工人的经验。
只是未来,
他们可能不只是在教新人。
还会开始:
教机器。
所以 Skild S1 真正有意思的,不是它会煎松饼
煎松饼很吸睛。
种盆栽很好拍。
手冲咖啡也很适合 Demo。
但真正值得看的,
其实是这件事:
机器人学新工作的入口,正在从「重新训练模型」,慢慢变成「给它一个 Context」。
今天还只有大约 66% 的陌生任务每步成功率。
离真正可靠还有距离。
但如果这条路继续进步,
未来工厂里很可能出现一个以前很少看到的画面:
一名熟练工人站在工作台前。
做一次。
旁边的机器看一次。
然后换它开始做。
到那个时候,
我们教 AI 的方式,
就真的从键盘上的 Prompt,
走进了真实世界。
你觉得未来最有价值的人,
会不会不是「跟机器比谁做得快」,
而是「最知道该怎么把工作教给机器的人」?
今天,和 AI 一起进步一点。
每天学会一个 AI 技巧。
每天节省一点时间。
每天提升一点能力。
SasaDaily,陪你一起成长。
推荐阅读
AI 不只活在屏幕里:日本正把实体 AI 带进工厂、医疗与生活现场