Skip to main content
QUICK REVIEW

[论文解读] Plan2Vec: Unsupervised Representation Learning by Latent Plans

Ge Yang, Amy Zhang|arXiv (Cornell University)|May 7, 2020
Domain Adaptation and Few-Shot Learning参考文献 52被引用 6
一句话总结

Plan2Vec 提出了一种无监督表示学习方法,通过在局部构建的图上进行潜在规划,从图像数据中提炼全局度量嵌入。通过在最近邻图上使用启发式搜索生成价值目标,该方法在无需环境交互的情况下学习到目标条件化的、长时程的距离度量,在模拟和真实世界视觉任务(包括导航和可变形物体操作)中实现了最先进性能。

ABSTRACT

In this paper we introduce plan2vec, an unsupervised representation learning approach that is inspired by reinforcement learning. Plan2vec constructs a weighted graph on an image dataset using near-neighbor distances, and then extrapolates this local metric to a global embedding by distilling path-integral over planned path. When applied to control, plan2vec offers a way to learn goal-conditioned value estimates that are accurate over long horizons that is both compute and sample efficient. We demonstrate the effectiveness of plan2vec on one simulated and two challenging real-world image datasets. Experimental results show that plan2vec successfully amortizes the planning cost, enabling reactive planning that is linear in memory and computation complexity rather than exhaustive over the entire state space.

研究动机与目标

  • 从离线图像数据中学习结构化、基于度量的表征,且无需强化学习环境交互。
  • 通过学习的全局嵌入摊销规划成本,实现高效、响应迅速的规划。
  • 通过路径积分蒸馏方法,从局部图像相似性构建全局度量。
  • 在具有挑战性的现实世界视觉数据集(如 Street Learn 和绳索操作)上展示有效性。
  • 即使底层图是拓扑结构而非几何结构,也能学习到可解释的、类似度量的表征。

提出的方法

  • 使用学习到的局部度量 d(xi, xj) 构建加权有向图,以定义近邻图像之间的边。
  • 在图上使用启发式搜索(如 A*)生成最优长时程路径,并将路径积分值作为目标信号。
  • 通过回归图搜索结果中的最短路径距离,训练全局度量网络 Dφ(o, og) = ||φ(o) - φ(og)||p。
  • 采用两种变体:一种基于规划轨迹的回归,另一种基于拟合值迭代进行值函数学习。
  • 使用孪生网络或基于 ResNet 的编码器,将观测嵌入到潜在空间,使距离反映语义或导航相似性。
  • 利用半监督学习原理,真实转移作为标注数据,图结构为泛化提供归纳偏置。

实验结果

研究问题

  • RQ1能否从离线图像数据中学习到无需环境交互的全局、目标条件化度量?
  • RQ2在局部构建的图上进行潜在规划,是否能产生比纯局部度量更准确、更具泛化能力的表征?
  • RQ3使用启发式搜索生成的路径积分目标,是否能提升长时程规划的效率与准确性?
  • RQ4学习到的表征能否支持响应式、线性复杂度的规划,而非穷举搜索?
  • RQ5即使图是拓扑结构而非几何准确,该表征是否仍包含可解释的度量地图?

主要发现

  • 在开放域的 1 步邻居预测任务中,Plan2Vec 达到了 98.6% ± 0.7 的测试准确率,表明其局部度量具有强大的泛化能力。
  • 在绳索操作数据集上,Plan2Vec 达到了 96.6% ± 0.9 的训练准确率和 92.4% ± 1.5 的测试准确率,证明其在具有挑战性的现实世界视觉控制任务中的有效性。
  • 在 Street Learn 数据集上,Plan2Vec 达到了 99.2% ± 0.5 的训练准确率,并成功从原始 Street View 图像中学习到可导航、可解释的度量地图,且无需 GPS 数据。
  • 该方法实现了线性内存和计算复杂度的响应式规划,避免了对完整状态空间的穷举搜索。
  • 尽管底层图是拓扑结构,学习到的表征仍捕捉到了与导航距离一致的度量结构。
  • 在 k 步前瞻规划任务中,该方法在规划成功率上优于基线方法,尤其当使用图搜索作为采样策略时表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。