[论文解读] Learning Environment-Aware Affordance for 3D Articulated Object Manipulation under Occlusions
本文提出了一种环境感知的可操作性框架,用于在遮挡条件下对3D关节物体进行操作,通过点级表征和对比学习方法,实现对复杂遮挡物组合的泛化。通过在局部建模遮挡效应,并在单遮挡物场景中进行数据高效的对比训练,该方法即使在新型多遮挡物环境中也能实现高精度的动作操作点预测,优于模拟和真实世界扫描中的基线方法。
Perceiving and manipulating 3D articulated objects in diverse environments is essential for home-assistant robots. Recent studies have shown that point-level affordance provides actionable priors for downstream manipulation tasks. However, existing works primarily focus on single-object scenarios with homogeneous agents, overlooking the realistic constraints imposed by the environment and the agent's morphology, e.g., occlusions and physical limitations. In this paper, we propose an environment-aware affordance framework that incorporates both object-level actionable priors and environment constraints. Unlike object-centric affordance approaches, learning environment-aware affordance faces the challenge of combinatorial explosion due to the complexity of various occlusions, characterized by their quantities, geometries, positions and poses. To address this and enhance data efficiency, we introduce a novel contrastive affordance learning framework capable of training on scenes containing a single occluder and generalizing to scenes with complex occluder combinations. Experiments demonstrate the effectiveness of our proposed approach in learning affordance considering environment constraints. Project page at https://chengkaiacademycity.github.io/EnvAwareAfford/
研究动机与目标
- 解决在具有遮挡和物理约束的真实环境中操作3D关节物体的挑战。
- 克服由于遮挡物数量、几何形状、位置和姿态变化导致的场景复杂性组合爆炸问题。
- 学习融合以物体为中心的动作先验、环境约束和机器人形态的点级可操作性。
- 实现在单遮挡物训练场景到复杂多遮挡物测试场景的泛化,且具有高数据效率。
- 通过预测兼顾外部遮挡物和自遮挡的碰撞感知可操作性,提升真实场景中的操作成功率。
提出的方法
- 引入环境感知可操作性作为点级表征,编码动作先验,同时考虑环境约束和机器人形态。
- 利用仅局部区域的遮挡物显著影响操作的洞察,降低场景理解的有效复杂度。
- 提出一种新颖的对比可操作性学习框架,用于在单遮挡物场景中训练,并泛化至多遮挡物组合。
- 引入遮挡场(OF)模块,建模机器人、目标物体与遮挡物之间的空间关系,提升碰撞感知预测能力。
- 使用基于SAPIEN、PartNet-Mobility和ShapeNet数据集构建的合成交互环境训练神经网络。
- 采用双头预测头输出可操作性分数和不确定性估计,提升在新场景中的鲁棒性。
实验结果
研究问题
- RQ1在简单单遮挡物场景中训练的模型能否泛化至3D关节物体操作中的复杂多遮挡物场景?
- RQ2如何使点级可操作性对环境约束(如遮挡物几何形状、位置和机器人位姿)保持敏感?
- RQ3在组合式场景复杂性存在的情况下,实现环境感知可操作性的数据高效学习,哪些组件是必不可少的?
- RQ4对比学习在多大程度上提升了模型在遮挡条件下区分可操作点与不可操作点的能力?
- RQ5该模型能否在真实世界扫描场景中预测出避免外部碰撞和自遮挡的可操作性?
主要发现
- 所提方法在复杂遮挡场景下的推拉任务中分别实现了43.52%的操纵准确率和36.19%的拉拽准确率,优于所有基线方法。
- 在新型遮挡物组合上,推任务的F1分数达到86.11%,平均精度为83.58%;拉任务的F1分数为75.96%,平均精度为75.18%。
- 消融实验表明,若移除遮挡场(Ours w/o OF),在新型推任务上的F1分数降至69.02%,平均精度降至66.94%,表明其对碰撞感知的重要性。
- 若移除对比学习(Ours w/o CL),预测的置信度降低,新型推任务上的F1分数为74.02%,平均精度为71.62%,表明其在区分能力中的关键作用。
- 该模型能有效泛化至真实世界扫描场景,生成合理的可操作性预测,避免自碰撞和外部遮挡物,如图7所示验证。
- 同一场景中不同机器人位姿导致不同的可操作性预测(图6),证实了模型对智能体位姿和环境上下文的敏感性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。