您当前位置>首页 > 热点资讯 > 自变量为机器人构建的虚拟训练平台
发表时间:2026-08-28
浏览次数:2564
我最近对机器人的相关消息感到非常兴奋。这周以来,机器人接连打破人类的百米跑记录,以近三米的高度“原地起飞”,还有那种“害羞跑”的姿势在海外风靡一时,比赛中的赛博张三丰则成功完成了540°的腾空外摆。今年的世界人形机器人运动会吸引了全球的目光,共有来自六大洲16个国家的666支队伍带着2056台机器人聚集在北京,比赛项目从田径、武术拓展到了家庭、酒店、工业以及应急救援等现实场景。
然而,机器人在赛场上的失误往往只是让人轻松一笑,但当这些机器人真实地进入家庭环境时,情况可能会变得不那么简单。它们可能会意外地打翻水杯、撞到家具,或者把刚整理好的衣物再次弄乱。在现实生活中,没有固定的跑道和规范化的道具,一些小的变化,比如杯子被移动,或者桌面上多出的一块抹布,都可能导致原本训练好的动作失效。
为了解决这一问题,将机器人在物理世界中的试错过程转移到虚拟环境中,正是目前很多世界模型的目标。它们力求还原一个符合物理规律的虚拟环境,让机器人在实际操作前进行预演:例如,手若向左偏移一点,是否会导致抓取失败;夹爪提前闭合又是否会碰倒杯子。然而,现实中很多世界模型却无法进行可靠的“虚拟测试”。虽然它们能够解读画面,但在执行动作时却往往不够精确。随着推演时间的增加,物体与位置的偏移显著,虚拟世界中表现良好的策略在真实环境中未必能够奏效。
在这一背景下,自变量机器人推出了自回归世界模型WALL-SS。这个虚拟训练场的构建终于打破了世界模型的限制,能够真实检验动作是否能够改变结果,任务的连续性是否能够得到保持,以及虚拟成绩是否可以在物理世界中得到验证。WALL-SS可以推演60秒的倒水和整理物品的任务,以测试不同动作的结果:例如,按照不同方式抓水杯,究竟是抓空、碰倒水杯,还是能够成功抓起。
研究团队还将多套机器人策略放入WALL-SS与实际场景测试,结果发现在虚拟环境中效果极佳的动作策略,在物理世界中同样也会带来良好的结果。这启示我们,机器人的“梦”如今能够用于训练和筛选真实动作。
世界模型是当今具身智能领域备受关注的方向之一,它可以被视为机器人脑海中的预演系统。当机器人获得当前画面和一组待执行动作时,它将预测接下来可能发生的情况。例如,机械手臂向左移动一厘米,杯子会被抓住还是碰倒?抽屉已打开,下一步是继续取东西,还是先调整手腕的角度?机器人能够对比多个未来情况,从中选择最优的动作路径。机器人公司也可以将不同版本的动作策略放入世界模型中进行测试,最终选择表现最佳的方案在真实设备上实施,从而节省在实际环境中测试动作效果所需的高昂成本。
然而,许多世界模型在实际应用中却未能避免偏差。因为训练数据多以成功示范为主,模型在看到大量夹爪闭合后都紧跟着物体被成功抓起的画面时,容易产生错误认知:只要夹爪闭合,物体就应该被抓住。即使夹爪与物体间有明显的空隙,模型中的图像可能仍然错误地渲染物体靠近夹爪。这种情况在较大动作中尚可忽略,但在细致操作时却可能直接导致失败。夹爪与杯把之间只差几毫米,机器人就可能抓空;插头若与接口之间存在轻微的偏差,也会导致无法顺利插入。
机器人从“会做”到“真正做到”往往在最后几毫米的距离上卡住。若世界模型直接抹去这些微小差距,生成的流畅预测将使机器人高估动作的可靠性。同时,随着推演时间的延长,小误差会不断累积,物体可能逐渐偏离原位置,而夹爪与杯子的接触关系也将受到影响。若模型仅保留最近几帧,将可能忘记之前的动作历史;而若保留全部历史,计算的复杂性与显存需求也将大幅提升。
视频看似真实,并不意味着模型所选的策略真正更佳。机器人研发需要明白,在虚拟测试中表现出色的策略,能否在实机测试中继续保持领先。世界模型需确保不同动作确实对应不同结果,流畅的画面仅仅实现了最表面的展现。
WALL-SS在预测接下来几秒画面时,首先会生成一个“低清预览”。在这一预览中,模型会先确定机械臂大致的运动方向和物体的移动轨迹。随之,它逐层提升画面的清晰度,补充物体外形、夹爪的开合与接触点。文中将这一由粗到细的过程称作“尺度”。已生成的画面与动作将成为后续预测的历史,这就是“下一尺度自回归”。随着画面逐渐清晰,动作同样会再次影响未来的发展。手臂朝左或右移动,首先会在低清画面中改变运动方向,而夹爪何时闭合则会继续影响清晰画面中是否能够成功接触到杯子。在一小段未来生成完毕后,它会与已经执行的动作共同进入记忆,作为模型继续推演的依据。