[论文解读] Learning Visually Guided Latent Actions for Assistive Teleoperation
本文提出了一种视觉引导的潜在动作框架,通过利用预训练目标检测器提供的视觉上下文,对学习到的潜在动作进行条件化,从而实现对高自由度辅助机器人的直观、低维远程操作。利用YOLO-v5编码目标身份与位置,系统在新物体和新任务上实现了稳健的少样本泛化,真实用户实验中在成功率和用户偏好方面显著优于基线控制策略。
It is challenging for humans -- particularly those living with physical disabilities -- to control high-dimensional, dexterous robots. Prior work explores learning embedding functions that map a human's low-dimensional inputs (e.g., via a joystick) to complex, high-dimensional robot actions for assistive teleoperation; however, a central problem is that there are many more high-dimensional actions than available low-dimensional inputs. To extract the correct action and maximally assist their human controller, robots must reason over their context: for example, pressing a joystick down when interacting with a coffee cup indicates a different action than when interacting with knife. In this work, we develop assistive robots that condition their latent embeddings on visual inputs. We explore a spectrum of visual encoders and show that incorporating object detectors pretrained on small amounts of cheap, easy-to-collect structured data enables i) accurately and robustly recognizing the current context and ii) generalizing control embeddings to new objects and tasks. In user studies with a high-dimensional physical robot arm, participants leverage this approach to perform new tasks with unseen objects. Our results indicate that structured visual representations improve few-shot performance and are subjectively preferred by users.
研究动机与目标
- 为解决使用低维输入控制高维、灵巧机械臂的挑战,特别是针对身体功能受限用户。
- 通过将视觉上下文融入学习到的潜在动作嵌入,提升辅助远程操作中的泛化能力与鲁棒性。
- 评估结构化视觉表征(特别是目标检测输出)相较于端到端视觉编码或无视觉输入的优越性。
- 在包含未见物体和任务的真实远程操作场景中,评估用户偏好与性能。
提出的方法
- 训练一个条件变分自编码器(CAE),将1-DoF操纵杆输入映射为7-DoF机器人动作,条件基于视觉状态表征。
- 使用在每类物体约75–100张标注图像的小型、低成本数据集上预训练的YOLO-v5目标检测器生成视觉状态表征。
- 每轮任务仅使用单帧视觉编码,避免实时推理循环,以保持低延迟控制。
- 视觉编码器集成到潜在动作模型中,从一维潜在空间解码为完整的7-DoF动作,实现直观的远程操作。
- 通过仅使用3次示范,框架支持少样本适应,将学习到的嵌入泛化至新物体。
- 用户研究对比了三种控制策略:末端执行器控制、仅定位(最优分类)和基于YOLO-v5的结构化视觉表征。
实验结果
研究问题
- RQ1基于目标检测器的结构化视觉表征能否提升潜在动作基远程操作中的少样本泛化能力?
- RQ2在辅助机器人控制中,引入视觉上下文如何影响用户表现与主观偏好?
- RQ3预训练目标检测器是否能在极少标注数据下实现稳健且准确的上下文识别?
- RQ4在真实环境中,基于检测器的潜在动作模型相较于端到端视觉模型或无视觉输入的性能如何?
- RQ5当通过视觉上下文引导时,用户在多大程度上能直观地控制高自由度机器人?
主要发现
- 基于YOLO-v5的结构化视觉表征在基础任务上实现了100%的成功率,显著优于仅定位基线(在4项少样本任务中有3项失败)。
- YOLO-v5模型在仅使用3次示范的情况下,对未见物体实现了90%的成功率,展现出强大的少样本泛化能力。
- 用户报告称YOLO-v5策略显著更直观、自然且有帮助,100%的参与者表示愿意再次使用。
- 末端执行器控制策略在已知任务上成功率高,但产生锯齿状、不自然的运动,可用性与直观性评分较低。
- 仅定位基线在50%的试验中未能正确定位物体,导致需要精确物体交互的任务成功率为0%。
- 轨迹的视觉检查确认,YOLO-v5生成了平滑、类人运动,而末端执行器控制产生了块状、非直观的移动。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。