你有没有想过,一个机器人为什么会记不住三秒钟前发生的事? 这听起来像个笑话,但2025年之前几乎所有顶尖的机器人操作模型都是这样的健忘症患者。你让机器人玩"猜猜哪个杯子藏着球"的 ...
当VLA(视觉—语言—动作模型)理解语言、感知环境并直接生成机器人动作时,一个更基础的问题开始浮现:机器人如何理解一个持续变化的物理世界?物体从哪里移动而来、杯子此前遮住了 ...
当 VLA 模型理解语言、感知环境并直接生成机器人动作,一个更基础的问题开始浮现:机器人如何理解一个持续变化的物理世界?物体从哪里移动而来、杯子此前遮住了什么、机械臂正在接近 ...
当 VLA 模型理解语言、感知环境并直接生成机器人动作,一个更基础的问题开始浮现:机器人如何理解一个持续变化的物理世界?物体从哪里移动而来、杯子此前遮住了什么、机械臂正在接近 ...
StreamPI最关键的设计,叫做指令锚定的时序建模(instruction-anchored temporal modeling)。 具体做法是,不再把"过去所有帧"和"一句指令"分开处理,而是把每一个时间步的视觉观察和语言指令打包成一个不可分割的整体,论文里称之为 原子时序单元 (atomic temporal unit)。
【TechWeb】8月28日消息,近日,大晓机器人联合香港大学发布全新的连续物理智能研究成果 StreamPI(Streaming Multimodal Temporal Modeling for Vision-Language-Action Models),直指 VLA 长期存在的“单帧智能 ...