2026年8月26日,北美具身智能公司 Skild AI 发布机器人基础模型 S1。这款模型的卖点是上下文学习(in-context learning,ICL):机器人不需要针对新任务做后训练,只要看一段人类示范视频,就能直接执行训练数据里从未出现过的复杂操作。官方演示中,S1 完成了煎饼、手冲咖啡、植物换盆、设备组装四类长程任务,单次任务最长约 10 分钟;在未见过(OOD)的任务上,S1 的成功率达到 66%,而用语言提示的传统 VLA 模型同期只有 9%。
一次演示,学会十分钟的陌生任务
S1 的上下文学习把单次任务长度拉到了 10 分钟级别。官方展示的四个任务——植物换盆、煎饼、手冲咖啡、设备组装——都不在 S1 的训练数据里,每个任务包含几十个连续操作步骤。以植物换盆为例,官方记录的时间线是:晚上 8 点 54 分物料到位,9 点 16 分开始布置场景,9 点 22 分录制一段第一视角演示视频,9 点 27 分 S1 开始自主执行,从演示到自主执行约 11 分钟。
执行长任务时,机器人不仅要模仿动作,还要跟踪任务进度、在技能之间切换、出错后自我恢复。官方博客称,S1 全程没有改模型权重——没有微调、没有后训练,同一套权重完成了博客里展示的全部任务。
机器人学习仍处于「BERT 时代」
Skild 把机器人学习的现状类比为大模型的 BERT 阶段:预训练学会基础能力后,每遇到一个新任务,仍要重新收集数据、再做一轮后训练。机器人和大模型的数据成本不同:大模型的后训练数据可以从互联网快速获取甚至自动生成,机器人的预训练和后训练数据都依赖真实世界采集,一个中等复杂任务的后训练数据往往要几十到几百小时真机操作。
这也引出 Skild 提出的问题:如果每学一个新任务都要重新后训练,预训练的意义是什么?他们的答案是上下文学习——让机器人像 GPT-3 之后的大模型一样,不改权重,只靠上下文(这里是动作视频)就学会新任务。
实验对照:数据越多,ICL 优势越大
Skild 在 1000 到 10 万小时的预训练数据规模上对比了 ICL 视频提示与语言提示 VLA,两者架构和数据完全相同,只有提示方式不同。结果有三点:
- 1000 小时规模时,语言提示略优(53% 对 43%);数据规模越大,ICL 反超越明显。
- 10 万小时规模时,在训练见过的任务上 ICL 达 96%,语言提示为 89%;在真正关键的未见过任务上,ICL 为 66%,语言提示只有 9%,差距超过 7 倍。
- 传统 VLA 后训练需要约 380 次任务演示(对应 50-100 小时遥操采集)才能追平 S1 只看一次演示的效果;堆到 2000 次演示,传统后训练能到 86%。
此外,在测试场景逐步偏离训练条件的扰动实验中,语言提示 VLA 的性能下降幅度最高达到 ICL 的 3 倍。
Skild AI 是谁
Skild 成立于 2023 年,创始人是卡内基梅隆大学机器人研究所的两位教授 Deepak Pathak 和 Abhinav Gupta。两人 2022 年合作过 WHIRL 项目,让机器人通过观看人类视频做一次示教模仿,S1 的路线延续自这条线索。公司 2024 年走出隐身模式时完成 3 亿美元 A 轮融资、估值 15 亿美元;2026 年 1 月完成 14 亿美元 C 轮融资,估值超过 140 亿美元,软银领投,英伟达、贝索斯跟投。
Skild 的口号是「Any robot, any task, one brain」,目标是让同一套模型跑在机械臂、四足、人形等不同形态的机器人上。数据策略上,它不押注单一来源,而是同时规模化真机遥操、UMI、第一视角人类视频和仿真数据四类来源。
结论:机器人学新技能,正在从「教几百遍」变成「看一遍」
S1 的发布把一个具体问题摆到台面上:机器人学新技能的成本能否从「教几百遍」降为「你做一遍、它看一遍」。目前 S1 在未见过任务上的一次性成功率是 66%,距离可靠商用仍有距离;但实验显示这条曲线随数据规模持续走强。对行业来说,无论 S1 最终表现如何,上下文学习已经让「机器人技能开发像给模型写提示词」这个方向第一次有了可对照的量化数据。