Skip to main content
QUICK REVIEW

[论文解读] Learning Actionable Representations from Visual Observations

Debidatta Dwibedi, Jonathan Tompson|arXiv (Cornell University)|Aug 2, 2018
Human Pose and Action Recognition参考文献 39被引用 16
一句话总结

本文提出多帧时间对比网络(mfTCN),一种自监督方法,通过联合嵌入多帧视频图像来学习同时包含静态与运动属性的鲁棒视觉表征。通过改进位置和速度估计,mfTCN 实现了仅使用像素观测的连续控制任务中的有效策略学习,在模拟和真实世界基准测试中性能可与基于状态的策略相媲美。

ABSTRACT

In this work we explore a new approach for robots to teach themselves about the world simply by observing it. In particular we investigate the effectiveness of learning task-agnostic representations for continuous control tasks. We extend Time-Contrastive Networks (TCN) that learn from visual observations by embedding multiple frames jointly in the embedding space as opposed to a single frame. We show that by doing so, we are now able to encode both position and velocity attributes significantly more accurately. We test the usefulness of this self-supervised approach in a reinforcement learning setting. We show that the representations learned by agents observing themselves take random actions, or other agents perform tasks successfully, can enable the learning of continuous control policies using algorithms like Proximal Policy Optimization (PPO) using only the learned embeddings as input. We also demonstrate significant improvements on the real-world Pouring dataset with a relative error reduction of 39.4% for motion attributes and 11.1% for static attributes compared to the single-frame baseline. Video results are available at https://sites.google.com/view/actionablerepresentations .

研究动机与目标

  • 开发一种自监督视觉表征学习方法,从视频观测中捕捉静态与运动属性,且无需标注状态或奖励信号。
  • 解决单帧方法(如 TCN)在有效编码速度与时间动态方面的局限性。
  • 通过学习与本体感知状态输入同样信息量的表征,实现从像素端到端的强化学习。
  • 在真实世界机器人控制任务中提升泛化能力与鲁棒性,尤其是在领域偏移或遇到新物体的情况下。
  • 证明自监督视觉表征可在连续控制环境中达到与基于状态的策略相当的性能。

提出的方法

  • 将时间对比网络(TCN)扩展为在单次前向传播中联合处理多个连续帧,形成多帧嵌入。
  • 使用对比损失函数,将来自同一事件但不同视角的视频片段视为正样本对,而将来自不同时序的片段视为负样本对。
  • 训练网络使时间对齐的片段(来自同一事件的不同视角)在嵌入空间中彼此接近,而时间错位的片段则被相互推开。
  • 利用时间上下文建模帧间变化,以提升对运动属性(如速度、加速度)的编码能力。
  • 将学习到的嵌入作为输入,用于近端策略优化(PPO)训练,直接从像素观测端到端训练连续控制策略。
  • 通过下游任务评估嵌入质量:对静态与运动属性进行最近邻分类,以及同步视频视角之间的时序对齐误差。

实验结果

研究问题

  • RQ1与单帧表征相比,多帧视觉表征是否能学习到更精确的位置与速度估计?
  • RQ2仅从视频中学习的自监督视觉表征,是否能在无法访问真实状态信息的情况下,实现连续控制任务中的有效策略学习?
  • RQ3与单帧基线相比,多帧提供的时序上下文在运动属性编码方面有何改进?
  • RQ4mfTCN 表征在真实世界机器人控制任务(如液体倾倒)中的泛化能力如何?
  • RQ5基于 mfTCN 的策略是否能达到与基于真实本体感知状态观测训练的策略相当的性能?

主要发现

  • 在真实世界的 Pouring 数据集上,与单帧 TCN 基线相比,mfTCN 将运动属性分类误差降低 39.4%,静态属性误差降低 11.1%。
  • 使用 13 帧输入窗口的模型(mfTCN 13)表现最佳,将运动属性误差从 TCN 基线的 30.2% 降低至 18.3%。
  • 引入时序上下文不仅提升了运动属性识别能力,也改善了静态属性分类,尤其对“有液体”和“液体流动”等属性效果显著。
  • 最大输入窗口(29 帧)实现了最低的时序对齐误差,表明嵌入空间中片段的可区分性更强。
  • 在 DeepMind Control Suite 上,使用 mfTCN 嵌入训练的策略性能与基于真实状态表示训练的策略相当,证明了所学特征的可操作性。
  • 该方法实现了直接从像素进行有效策略学习,优于从零开始的像素端到端训练以及先前的自监督方法(如 PVE)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。