Skip to main content
QUICK REVIEW

[论文解读] Learning Long-term Visual Dynamics with Region Proposal Interaction Networks

Haozhi Qi, Xiaolong Wang|arXiv (Cornell University)|Aug 5, 2020
Multimodal Machine Learning Applications参考文献 65被引用 18
一句话总结

该论文提出区域提议交互网络(RPIN),一种新颖的方法,通过利用区域提议特征和卷积交互网络,从原始图像中建模长期视觉动态。通过在具有空间上下文的潜在特征空间中推理物体轨迹,RPIN在长时程预测与规划任务中达到最先进性能,在PHYRE基准测试的同任务与跨任务泛化设置下,AUCCESS指标最高提升8个百分点。

ABSTRACT

Learning long-term dynamics models is the key to understanding physical common sense. Most existing approaches on learning dynamics from visual input sidestep long-term predictions by resorting to rapid re-planning with short-term models. This not only requires such models to be super accurate but also limits them only to tasks where an agent can continuously obtain feedback and take action at each step until completion. In this paper, we aim to leverage the ideas from success stories in visual recognition tasks to build object representations that can capture inter-object and object-environment interactions over a long-range. To this end, we propose Region Proposal Interaction Networks (RPIN), which reason about each object's trajectory in a latent region-proposal feature space. Thanks to the simple yet effective object representation, our approach outperforms prior methods by a significant margin both in terms of prediction quality and their ability to plan for downstream tasks, and also generalize well to novel environments. Code, pre-trained models, and more visualization results are available at https://haozhi.io/RPIN.

研究动机与目标

  • 开发一种数据驱动的视觉动态模型,实现在不依赖重规划的情况下实现准确的长期预测。
  • 通过直接从原始图像学习以物体为中心的表征,弥合像素级预测与抽象状态空间动态之间的差距。
  • 在长时间范围内建模物体间及物体与环境之间的交互,以支持有效的下游规划。
  • 在新环境和未见任务中实现有效泛化,特别是在仅允许初始一个动作的场景中。

提出的方法

  • 该方法使用RoIPooling从帧级特征中提取物体特征,同时捕捉物体和环境上下文。
  • 提出卷积交互网络,通过用卷积层替代MLP来扩展交互网络,以保留物体特征中的空间结构。
  • 通过在潜在区域提议特征空间中推理交互关系,预测未来物体位置和形状变化。
  • 训练分类器以连接物体特征轨迹,预测任务成功,从而实现从视觉输入端到端的规划。
  • 采用交叉熵损失在成功标签上进行端到端训练,预测时间步长为T_train = 10。
  • 推理阶段,基于预测的特征轨迹对动作进行评分并排序,用于规划。

实验结果

研究问题

  • RQ1在原始图像上训练的视觉动态模型是否能在不重规划的情况下泛化到长时程任务?
  • RQ2带有空间上下文的以物体为中心的表征在多大程度上能捕捉物体间及物体与环境之间的随时间演变的交互?
  • RQ3学习到的动态模型在未见环境中的规划中能提供多大程度的有效支持?
  • RQ4通过卷积实现的空间推理是否相比基于MLP的交互模型能提升长期预测的准确性?

主要发现

  • 在PHYRE基准测试的跨任务泛化中,RPIN相比DQN基线提升6个百分点,AUCCESS达到74.3。
  • 在同任务泛化中,RPIN相比DQN基线提升8个百分点,AUCCESS达到82.1。
  • 定性结果表明,RPIN在10秒时程内生成准确且具备碰撞意识的轨迹,而基线方法则表现出穿透与不稳定性。
  • 在SimB任务中,RPIN在台球目标状态和击打任务中均取得最佳性能,展现出强大的规划能力。
  • 该模型在真实世界环境(RealB)和合成场景(SS)中均表现出良好泛化能力,预测结果在多样化设置下合理且一致。
  • 该方法在无需实例分割图或预定义物体掩码的情况下,优于当前最先进基线,仅依赖学习到的区域提议。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。