伯恩斯坦:Figure AI Helix 2.5仅“场景泛化”而非“任务泛化”,成功率水平离商用还有距离

Figure AI 的 Helix 2.5 证明人形机器人的“大脑”可以从人类数据中学会通用技能,但它跨越的只是“场景”,还不是“任务”。

智通财经APP获悉,伯恩斯坦全球自动化团队 Jay Huang、Dien Wang、Elsa Fu 撰写最新专题报告,以 Figure AI 本周发布的 Helix 2.5 为切口,讨论机器人“大脑模型”的最新进展。伯恩斯坦给出了一个克制但明确的判断:Figure AI 的 Helix 2.5 证明人形机器人的“大脑”可以从人类数据中学会通用技能,但它跨越的只是“场景”,还不是“任务”——机器人仍要靠专门训练才能干活,而 56% 的成功率离商用还差得远。

30 个陌生家庭、420 次试验:56% 的成功率

据 Figure 官方发布(当地时间 9 月 17 日)与伯恩斯坦报告,Helix 2.5 在旧金山湾区 30 个此前从未见过的家庭中执行了三项长时序全身作业:整理客厅、叠毛巾、铺床。整个过程中,Figure 未在这些环境中采集数据、微调或做任何适配。

此前,机器人演示通常发生在训练过、熟悉的环境里。Helix 02 在今年 2 月曾展示自主完成多分钟洗碗机卸载,并曾让物流任务自主运行 200 小时,但那些系统依赖“在机器人实际作业地点采集的数据”学习。Helix 2.5 要回答的是更难的题目:人形机器人能否在从未见过的房子里,用全身自主立即开工?

结果是一份“有进步、也有明显差距”的成绩单。据报道,30 个家庭共完成 420 次试验、237 次成功,整体成功率 56%,且采用全有全无判定——任务必须完整做完才算成功。分项看,伯恩斯坦引用 Figure 数据:叠毛巾 62%、铺床 67%、整理客厅 40%。整理客厅(报告中亦称“客厅整理”)是最难的一项,成功率仅四成。伯恩斯坦在报告中还提到一项信号:机器人在陌生环境中展现出自我纠错——后退重新定位、改变站姿、或绕到床的另一侧继续铺床。这份全有全无口径也意味着另一面:接近一半的试验以失败告终。

Index 预训练:零样本成功率从 9% 提到 56%

报告把 Helix 2.5 的进步归因于数据范式的变化。Helix 2.5 从一开始就在 Index 上预训练——这是 Figure 自有的第一视角人类任务视频数据集。

伯恩斯坦强调,在任务专用数据、模型架构、训练与评测条件全部保持不变的前提下,仅“是否使用 Index 预训练”这一个变量,就把零样本成功率从 9% 提升到 56%。这意味着提升不是“多给了几个家务例子”的结果。Figure 还披露,没有任何一项被评测任务的数据占到 Index 预训练数据的 1.90% 以上。与此同时,Helix 2.5 只用了 Helix 02 某项行为一半的任务专用数据,就达到了相近表现,并把该行为泛化到 30 个陌生家庭。

更被看重的是规模化效应。报告写道,Figure 已获得初步证据:随着“人类到机器人”预训练数据扩张,动作预测损失(action-prediction loss)持续下降——把 Index 预训练数据反复翻倍,下游机器人动作预测的改善平滑到可以在训练前把最大规模那一次运行的损失预测到小数点后四位。Figure 官网称这是首次在人形平台上测得的“人类到人形机器人”迁移规模化定律。不过报告也提醒,该实验衡量的是动作预测损失,并非真实场景的完成率。

e08c96a6ce18e8cd04e4bf05ab3e8bf.png

数据引擎本身在复利式扩张。据伯恩斯坦报告,截至 2026 年 8 月,Index 含 2300 万条视频,每秒新增约 35 分钟人类经验(另一处披露为每天约 5.75 年人类经验,两者是同一数据的两种表述);每 1000 小时采集数据对应 373 项任务、1146 个操作对象与 116 个环境;其中 100 万小时视频包含 37.3 万个独立任务、110 万个独立操作对象;数据贡献者的周活跃人数已达 4.4 万,较 5 月初的不足百人快速攀升。Index 于 8 月 25 日上线,下载量已超 26.4 万次;Figure 已向数据贡献者支付 1500 万美元,并承诺投入 35 亿美元算力资源训练 Helix 系列。

关键分歧:场景泛化了,任务还没有

伯恩斯坦给这次进展的定性是“场景泛化”(scene generalization),而非“任务泛化”。报告指出,Figure 的机器人是针对这三项任务专门训练的,而且 30 个家庭中的物体及其摆放方式变化有限。因此报告认为,真正的零样本任务泛化“仍有很长的路要走”。

报告把 Helix 2.5 与公司此前一篇题为《皇帝的新大脑与 AlphaGo 时刻》的笔记相衔接,认为它支持了三个判断:一是模型进步大幅拓宽了训练数据的范围,尤其第一视角人类视频在预训练中越来越可用,规模化定律证据增多(“越多越好”);二是真实机器人数据仍有价值,但遥操作(teleoperation)因缺乏可扩展性很可能被逐步淘汰;三是“大脑与数据”的整合在加深——Helix 02 那种直接继承固定权重视觉语言模型(VLM)的做法,正被基于自有数据从零训练的模型取代。

行业内的其他进展被视为同一趋势的印证,包括智元机器人(AgiBot)近期发布的世界动作模型 GE-ACT 2.0、以 100 万小时人类视频训练的 Dyna 2.0,以及 Physical Intelligence 的 π0.7——后者展示了组成式任务泛化,即由相关技能组合出的、未经专门训练的新技能涌现。

下一个考验:从 56% 到 99%

报告向 Figure AI 提出了两项具体期待。第一是“可迁移技能”的证据:在一项任务上训练后,能不加额外训练就完成相似任务;第二是真正的“数据飞轮”——在训练后与部署环节出现性能自动提升。伯恩斯坦直言,56% 的整体成功率“远不足以商用”,“熟能生巧”在机器人领域尚未成立:预训练通常能把成功率带到 50%-60%,而从这一水平到 99% 的高效路径,将是下一个大考。

报告的结论落在行业节奏而非时点上:Figure、智元、Physical Intelligence、Dyna 等公司的进展传递出一致信息——通用任务与少数应用之外的大规模部署都还不会很快到来,但人形机器人技术、尤其是大脑模型,正以“每季度都有可感知进步”的速度推进。报告用一句话概括当下的位置:“最坏的时代,也是最好的时代。”

投资含义:自动化标的评级与目标价

在这份全球自动化报告中,伯恩斯坦给出的评级为:基恩士、康耐视(CGNX.US)、发那科、哈默纳科与汇川技术(300124.SZ)均为跑赢大盘评级。

伯恩斯坦行情表(2026 年 9 月 18 日收盘价、目标价均为报告口径):

5a588431cfffc0a2d903b56d487c4da.png

智通声明:本内容为作者独立观点,不代表智通财经立场。未经允许不得转载,文中内容仅供参考,不作为实际操作建议,交易风险自担。更多最新最全港美股资讯,请点击下载智通财经App
分享
微信
分享
QQ
分享
微博
收藏