[论文解读] Disentangled Relational Representations for Explaining and Learning from Demonstration
该论文提出了一种解耦的关联表征学习框架,通过变分自编码器结合辅助损失,将抽象的空间概念(如'在...左侧'或'在...上方')在高维感官数据中进行具象化。通过优化解耦性与人类常识性概念的一致性,该方法实现了从示范中进行可解释的符号规划和精确的末端执行器位姿预测,在逼真的合成环境和真实世界机器人操作任务中表现出稳健性能。
Learning from demonstration is an effective method for human users to instruct desired robot behaviour. However, for most non-trivial tasks of practical interest, efficient learning from demonstration depends crucially on inductive bias in the chosen structure for rewards/costs and policies. We address the case where this inductive bias comes from an exchange with a human user. We propose a method in which a learning agent utilizes the information bottleneck layer of a high-parameter variational neural model, with auxiliary loss terms, in order to ground abstract concepts such as spatial relations. The concepts are referred to in natural language instructions and are manifested in the high-dimensional sensory input stream the agent receives from the world. We evaluate the properties of the latent space of the learned model in a photorealistic synthetic environment and particularly focus on examining its usability for downstream tasks. Additionally, through a series of controlled table-top manipulation experiments, we demonstrate that the learned manifold can be used to ground demonstrations as symbolic plans, which can then be executed on a PR2 robot.
研究动机与目标
- 使机器人能够利用人类提供的示范和自然语言指令,学习并推理空间关系。
- 解决将抽象语言符号(例如'在...左侧'、'在...上方')在低层次感官观测中具象化的问题,通过解耦表征实现。
- 构建一个对人类可解释且对下游机器人任务(如符号规划推理和动作执行)有用的潜在空间。
- 在合成环境和真实世界设置中评估该框架,证明其对遮挡的鲁棒性以及在不同任务间的泛化能力。
提出的方法
- 使用深层变分自编码器并引入解耦潜在空间,将高维视觉观测映射到低维、可解释的流形。
- 引入两种辅助损失:重建损失以保留输入信息,关系对比损失以强制解耦空间关系(例如左右、前后)。
- 采用独立的分类器头预测物体标签和关系概念,确保解耦性在人类可解释的空间关系上得到显式优化。
- 将学习到的表征应用于基于时间聚类和符号具象化的计划分割模块,从第三人称示范中推断符号规划。
- 通过回归头将推断出的符号规划映射到末端执行器位姿,实现在PR2机器人上的执行。
- 在逼真的合成环境(积木世界)中进行训练,并在PR2机器人的真实世界遥操作数据上进行微调。
实验结果
研究问题
- RQ1深度生成模型能否从原始感官输入和弱人类标注中学习到解耦的、对人类可解释的物体间空间关系表征?
- RQ2所学习的潜在空间在多大程度上能够支持从非结构化示范中进行符号规划推理?
- RQ3所具象化的符号规划在多大程度上可用于预测机器人任务执行的精确末端执行器轨迹?
- RQ4通过辅助损失强制解耦是否能提升下游任务(如计划分割和位姿预测)的鲁棒性与准确性?
主要发现
- 同时包含重建损失和关系对比损失的模型在计划分割任务中表现最佳,重复示范的准确率达到100%,链式示范达到90%。
- 所学习的潜在空间能够可靠地推断符号规划,随着观察到的示范增多,其编辑距离趋近真实值,尤其在多步任务中表现显著。
- 推断出的符号规划用于预测末端执行器位姿时,平均绝对误差较低:放置任务为0.04 m,面对杯子任务为0.05 m,放入任务为0.03 m。
- 模型学习到任务特定的位姿回归,对任务成功相关轴向的误差更低(例如,放置任务为X/Y/Z轴,方向调整任务为Roll/Pitch轴)。
- 解耦表征成功捕捉了互斥的空间关系(例如左右 vs. 前后),与人类常识一致。
- 该框架在未见过的示范中表现出泛化能力,即使存在物体遮挡,也得益于解耦潜在空间的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。