Skip to main content
QUICK REVIEW

[论文解读] Learning About Objects by Learning to Interact with Them

Martin Lohmann, Jordi Salvador|arXiv (Cornell University)|Jun 16, 2020
Advanced Image and Video Retrieval Techniques参考文献 65被引用 4
一句话总结

本文提出一种自监督智能体,通过在物理仿真虚拟环境(AI2thor)中与物体交互,利用推挤和操作物体后的视觉反馈,学习发现物体并估计其几何范围和相对质量。该模型在无任何外部监督的情况下,实现了对新物体类别和实例的强零样本泛化能力,在某些自监督设置下优于完全监督基线方法。

ABSTRACT

Much of the remarkable progress in computer vision has been focused around fully supervised learning mechanisms relying on highly curated datasets for a variety of tasks. In contrast, humans often learn about their world with little to no external supervision. Taking inspiration from infants learning from their environment through play and interaction, we present a computational framework to discover objects and learn their physical properties along this paradigm of Learning from Interaction. Our agent, when placed within the near photo-realistic and physics-enabled AI2-THOR environment, interacts with its world and learns about objects, their geometric extents and relative masses, without any external guidance. Our experiments reveal that this agent learns efficiently and effectively; not just for objects it has interacted with before, but also for novel instances from seen categories as well as novel object categories.

研究动机与目标

  • 开发一种基于环境交互的自监督框架,用于物体发现与物理属性学习,受婴儿学习过程启发。
  • 使智能体仅通过交互的视觉反馈学习物体的几何范围和相对质量,无需任何标注数据。
  • 评估模型在训练中未见的新物体类别和实例上的泛化能力。
  • 探究来自交互的自监督信号(尽管存在噪声)是否能在该设置下优于或匹配完全监督方法。

提出的方法

  • 智能体通过选择交互点并施加力的方式与AI2thor环境中的物体交互,使用基于CNN的策略网络预测交互点和力。
  • 利用交互的视觉反馈计算自监督损失:用于交互点预测、力估计,以及将协同移动的点聚类为潜在物体。
  • 采用带有优先采样的记忆库以稳定训练并提高样本效率,受优先经验回放和自 paced 学习的启发。
  • 模型使用超像素后处理作为视觉先验,以改善掩码监督,并应用对比损失将移动点聚类为单一物体。
  • 该框架通过交互的原始观测序列端到端训练,无需真实边界框或质量标签。
  • 该方法利用物理引擎模拟真实的物体动力学,包括质量、摩擦力和弹性,以提供有意义的交互反馈。

实验结果

研究问题

  • RQ1智能体是否仅通过交互即可学习发现物体并估计其质量、范围等物理属性,而无需任何外部监督?
  • RQ2该模型在已见类别中的新物体实例以及完全全新的物体类别上的泛化能力如何?
  • RQ3在该设置下,来自交互视觉反馈的噪声自监督学习是否优于或匹配完全监督方法?
  • RQ4带有优先采样的记忆库在稳定训练和提高训练效率方面起到什么作用?
  • RQ5利用运动和位移的视觉反馈在聚类一致物体部分方面有多有效?

主要发现

  • 该模型在新物体类别上的物体检测和质量预测任务中,平均类别准确率达到50.79%,平均精度(AP)为11.85%,显著优于无监督基线方法。
  • 使用交互视觉反馈的自监督方法在掩码监督方面表现优于光流或基于PCA的方法,后者未能有效发现物体。
  • 该模型展现出强大的零样本泛化能力:在已见类别中的新实例上表现良好,甚至在训练中未见过的全新类别上也表现良好。
  • 出人意料的是,即使使用更大的ResNet-18主干网络,真实掩码的完全监督方法也未能超越自监督方法,表明噪声可能有助于模型聚焦于更可预测、更具交互性的物体。
  • 消融实验证实,视觉先验(超像素)和带有优先采样的记忆库对性能至关重要,移除任一组件均导致准确率大幅下降。
  • 定性结果表明,该模型能够在杂乱场景中检测多个物体,并合理区分轻、中、重物体,但对极小或极大物体因运动信号过弱而表现不佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。