发布日期:2026-07-29 浏览:10
机器人在执行任务时的“卡顿”与“犹豫”,并非源于硬件性能不足,而是因为它们的“大脑”在思考时,身体不得不停下来等待。麻省理工学院(MIT)的研究团队近日发布了一项名为VLASH的新技术,使机器人在执行任务时无需在动作序列之间暂停——通过预测机器人“即将到达的位置”而非依赖“当前的位置”进行规划,将反应延迟降低30倍,使机器人能够在执行当前动作的同时计算下一步。在拾取与放置、堆叠、分类等任务中,机器人速度提升了一倍;在乒乓球、打地鼠等高度动态的交互场景中,机器人的响应也更加流畅。这项研究已于2026年7月在《IEEE Transactions on Robotics》上发表。
问题的根源:机器人“边看边动”的延迟循环
当前最先进的机器人控制系统越来越多地采用视觉-语言-动作(VLA)模型作为“大脑”。这类模型能够处理视觉信息、理解自然语言指令并生成动作序列。但在实际操作中,VLA模型的计算延迟是一个被忽视的瓶颈:机器人通过摄像头捕捉环境图像,将其与任务指令结合,生成一串动作并执行。当这串动作完成后,系统才会处理新的观测数据,再规划下一段动作。这个“感知-规划-执行-再感知”的循环会引入数十到数百毫秒的停顿。对于需要连续、流畅运动的任务而言,这些停顿会累积为肉眼可见的卡顿。
VLASH的解决方案:预测未来,而非等待现在
VLASH的核心创新在于改变了规划的参照系。传统方法基于“机器人当前在哪里、周围环境当前是什么样”来规划下一步。而VLASH利用机器人当前的运动状态和规划中的动作序列,通过动力学模型预测机器人在完成当前动作块后会到达的位置,并据此提前计算下一组动作。这一方法使机器人能够在执行当前动作的同时,完成对下一步动作的规划。研究人员发现,仅此一项技术改进就能将反应速度提升30倍以上。研究团队进一步通过“动作量化”方法生成更大块的运动序列,使机器人完成任务的速度整体提升2至3倍。
更少的训练数据,更高的效率
研究团队还开发了一种训练增强技术,通过重组和重用现有训练数据,使VLA模型无需额外计算开销即可有效利用“未来状态”信息,训练时间减少5倍。
在仿真测试中,VLASH在各种任务中均实现了更快的运动速度,同时保持了操控精度。在物理机器人测试中,VLASH在拾取与放置、堆叠、分类任务中均表现出明显改善。在分类任务中,VLASH将机器人完成速度提升至基准系统的两倍,同时保持90%的准确率。系统还能处理高动态交互场景,包括乒乓球和打地鼠游戏。研究人员表示,未来将探索将VLASH与生成式AI世界模型相结合,使系统能够预测实际环境的动态变化,进一步拓展其在更复杂机器人应用中的潜力。
从行业视角来看,这项研究在感知和规划之间开辟了实时预测的中间层,把VLA模型的“思考时间”藏在了“动作执行时间”里。机器人的反应速度从此不再受限于VLA模型的推理延迟,而取决于动作的物理执行时长——这为高速动态场景中的机器人控制打开了一扇新的大门。