一段视频教会机器人10分钟任务:Skild AI发布S1基础模型,打破机器人训练范式

Skild AI于2026年8月25日发布S1机器人基础模型,该模型可从单段视频示例中学习长达10分钟的复杂物理任务,无需任何微调或后训练即可实时执行。内部基准测试中,S1在未见任务上的成功率达66%,是同等算力下语言提示型VLA模型(9%)的7倍以上。这一结果标志着机器人训练范式的实质性转变——从依赖海量标注数据的微调模式,转向基于单次视频提示的上下文学习。

2026年8月25日,Skild AI正式发布S1机器人基础模型。根据该公司官方博客披露,S1可从单段人类操作视频中学习长达10分钟的多步骤物理任务,无需微调(fine-tuning)或任何形式的后训练(post-training),即可在真实机器人上实时执行——包括手冲咖啡、给植物换盆、煎翻薄饼等从未在训练数据中出现过的任务。

一个细节最能说明问题:当S1第一次尝试翻薄饼时,Skild团队检索了整个预训练数据集,发现其中根本没有任何"翻饼"示例。S1依然从一段示范视频中推断出这一超出分布范围的动作,并成功执行。这不是工程调优的结果,而是真正的泛化。

66% vs 9%:数字背后的范式断层

Skild官方博客公布了核心性能数据:在使用相同10万小时预训练数据的条件下,S1在从未见过的任务上成功率达到66%,而同等规模的语言提示型视觉-语言-行动模型(VLA)成功率仅为9%,差距超过7倍。

另一组数据更直接:一段视频提示的效果,相当于约380个任务专项后训练示例。对于机器人行业而言,这是一个巨大的实用意义——采集机器人训练数据的成本极高,每小时遥操作数据往往需要专业人员长时间配合,且Skild自己披露的质量控制投入比例是数据采集费用的3倍。单次视频提示若能替代数百条专项示范,意味着新任务的部署成本将发生数量级变化。

需要指出的是,这66%的成功率来自Skild内部基准,尚未经过独立第三方评测机构验证。机器人基准测试中任务设定和环境条件对结果影响极大,这一数字的普适性仍有待更多真实场景数据支撑。

技术路线:为何视频比语言更适合教机器人

当前主流的机器人基础模型,如π0、RT-2、OpenVLA,大多延续了语言模型的提示逻辑:用自然语言描述任务,再让模型生成动作序列。这条路线的天然局限在于,语言天生是模糊的。"把杯子放到桌上"这句话,不包含如何调整抓握角度、在哪一刻松开手指的物理细节。

S1选择了不同的技术路线。Skild官方博客将其描述为将视频示范作为"程序"(treating video as the program)——模型在预训练阶段就以片段式数据(episodic data)为核心,始终通过上下文示范来指定任务,而非语言标签。这迫使模型在底层学会推断"示范者的意图""功能对应关系"和"任务进度",而不是记忆语言-动作的统计映射。

更关键的是规模化后的行为差异。Skild的内部测试显示:在预训练数据量较少(1000小时)时,语言提示型策略甚至略优于上下文学习(53% vs 43%)。但当数据量扩展到10万小时时,上下文学习的优势出现爆发式增长,语言提示型模型在分布偏移(distribution shift)较大的L5条件下的性能下降速度是S1的3倍。这种规模化优势,与大语言模型在参数量增长后涌现能力的逻辑高度相似。

公司背景:144亿美元估值,CMU实验室走出的豪赌

Skild AI由卡内基梅隆大学(CMU)教授Deepak Pathak和Abhinav Gupta于2023年创立,两人均是机器人学习领域的学术重量级人物。据The Robot Report报道,公司在2024年7月完成3亿美元A轮融资,由Lightspeed Venture Partners、Coatue、SoftBank和贝佐斯旗下Bezos Expeditions领投,估值达15亿美元。

2026年1月,Skild完成由SoftBank领投的14亿美元C轮融资,参与方包括Nvidia旗下NVentures、三星、LG、施耐德电气和Salesforce Ventures,估值超过140亿美元。从2023年成立到估值140亿,不到三年。

这条融资路径本身就说明资本对机器人基础模型赛道的判断:软件层的基础模型将成为下一代机器人产业的控制权争夺点。Skild的战略定位不是造机器人,而是成为"给别人机器人装大脑的平台"——这与当年Android之于智能手机的逻辑相似,也意味着它面临的竞争不仅来自Figure AI、Boston Dynamics这类整机厂商,还包括英伟达、谷歌DeepMind这类掌握训练基础设施的巨头。

真正的异常信号:泛化能力来自哪里

S1最值得深究的技术点,不是它能做什么,而是泛化能力的来源。

传统机器人学习的瓶颈从未是算法,而是数据分布的脆弱性——在实验室里训练的模型换一个桌子、换一种光线就会失灵。S1展现的"场景扰动鲁棒性"和"物品替换鲁棒性"(Skild博客原文:robustness to scene perturbations and object substitutions),以及偶尔能"改进有缺陷的示范",指向的是更深层的环境建模能力,而非简单的模式匹配。

Skild的预训练数据来源包括:遥操作数据、UMI机器人数据、第一人称视角视频和仿真数据。仿真数据部分的规模被描述为"数万亿个物理模拟片段"——这是关键。仿真数据天然具有多样性和随机化特性,大规模仿真预训练是S1能够从单次真实视频中泛化的底层解释之一。这一技术路径与DeepMind的模拟训练加速思路一脉相承,但S1将其推进到了实时上下文学习的应用层。

仍然存在的不确定性

S1的发布演示选择的任务类型值得注意:咖啡、薄饼、植物——这些是强调手部灵巧性(dexterity)的桌面操作场景,而非高速生产线、危险环境或需要长距离移动规划的任务。当前公开的测试范围对于评估S1在工业级真实场景中的表现仍然有限。

此外,S1的66%成功率是Skild内部测试数据。在机器人基准测试领域,任务设计、成功标准的定义和测试环境的选择会对结果产生决定性影响,独立复现和第三方评测是验证这一数字可靠性的必要步骤。

判断

S1的意义不在于它能替代现有机器人训练流程,而在于它第一次用具体数字说清楚了一件事:在足够大规模的仿真预训练基础上,机器人的上下文学习能力可以从语言时代的VLA身上实现真正的跨越。

语言提示型机器人策略的根本问题,是语言本身无法编码物理世界的精细约束;而视频示范作为"任务程序"的思路,绕开了语言这一有损中间层。S1的核心技术赌注是:规模化仿真数据+上下文学习,可以实现比语言VLA更高效的野外(in-the-wild)泛化。这一点,它在内部基准上已经给出了有说服力的初步证明。

对于机器人行业来说,接下来需要回答的问题不是"in-context learning能不能用于机器人",而是"66%的成功率在什么条件下能达到,何时能推进到90%以上的生产级可靠性"。这是Skild接下来必须在真实客户场景中兑现的承诺,也是140亿美元估值能否站稳的核心考验。

Sources: - [Introducing S1: In-Context Learning for Robotics | Skild AI](https://www.skild.ai/blogs/s1) - [Skild AI Raises $1.4B to Build 'Omni-Bodied' Robot Brain - The Robot Report](https://www.therobotreport.com/skild-ai-raises-1-4b-building-omni-bodied-robot-skild-brain/) - [Skild AI S1 Model Learns 10 Minute Robot Tasks From One Video, Replacing 380 Examples | HuggingNews](https://huggingnews.com/ai/skild-ai-s1-model-learns-10-minute-robot-tasks-from-one-video-replacing-ce34c26a) - [Skild AI Presents S1 Model for One-Video Robot Tasks | Digg](https://digg.com/tech/rbnvscse) - [AI Startup That Builds a Brain for Robots Valued at $14 Billion | AI Business](https://aibusiness.com/robotics/skild-ai-startup-builds-robot-brain)