[论文解读] Robust Policies via Mid-Level Visual Representations: An Experimental Study in Manipulation and Navigation
本文提出使用异步训练的中级视觉表征——从传统计算机视觉目标中学习得到——作为深度强化学习(RL)策略的感知输入。通过用这些不变且语义有意义的特征替代原始像素,该方法显著提升了样本效率、在分布偏移(包括仿真到现实的迁移)下的泛化能力,以及在具有挑战性的操作与导航任务中的性能,优于从零开始训练和领域随机化方法,尤其在困难或未见过的环境中表现更优。
Vision-based robotics often separates the control loop into one module for perception and a separate module for control. It is possible to train the whole system end-to-end (e.g. with deep RL), but doing it "from scratch" comes with a high sample complexity cost and the final result is often brittle, failing unexpectedly if the test environment differs from that of training. We study the effects of using mid-level visual representations (features learned asynchronously for traditional computer vision objectives), as a generic and easy-to-decode perceptual state in an end-to-end RL framework. Mid-level representations encode invariances about the world, and we show that they aid generalization, improve sample complexity, and lead to a higher final performance. Compared to other approaches for incorporating invariances, such as domain randomization, asynchronously trained mid-level representations scale better: both to harder problems and to larger domain shifts. In practice, this means that mid-level representations could be used to successfully train policies for tasks where domain randomization and learning-from-scratch failed. We report results on both manipulation and navigation tasks, and for navigation include zero-shot sim-to-real experiments on real robots.
研究动机与目标
- 探究中级视觉表征是否能提升视觉强化学习中的泛化能力和样本效率,尤其是在分布偏移的情况下。
- 评估中级特征是否在存在显著视觉领域偏移的困难任务中,优于从零开始训练或领域随机化方法。
- 评估中级表征在复杂、连续控制操作与导航任务中的可扩展性。
- 分析使用中级特征训练的策略在物理机器人上零样本仿真到现实部署中的鲁棒性。
- 比较中级表征与领域随机化等其他不变性编码方法在训练稳定性与最终性能方面的表现。
提出的方法
- 在中级视觉任务(如深度估计、表面法线预测、曲率、语义分割)上使用监督或自监督目标预训练特征编码器,该过程独立于强化学习训练。
- 将预训练的特征编码器冻结,并用作感知主干网络,从原始观测中提取视觉表征,再输入到深度强化学习策略中。
- 使用这些中级特征作为输入,端到端训练强化学习策略,部署期间不进行任何额外微调或适应。
- 在多个任务上评估该方法:操作任务(如抓取与放置)和导航任务(如在Habitat和Gibson仿真器中),包括零样本仿真到现实迁移。
- 将性能与基线方法进行比较:使用原始像素训练、使用真实低维状态,以及领域随机化方法。
- 对所有方法进行超参数搜索以确保公平比较,并在各种领域偏移(如新物体、光照、纹理)下测试泛化能力。
实验结果
研究问题
- RQ1与从原始像素训练相比,使用中级视觉表征是否能提升在困难操作与导航任务中的策略性能与泛化能力?
- RQ2中级表征是否能降低样本复杂度并提升视觉强化学习中的训练稳定性?
- RQ3在处理分布偏移,尤其是仿真到现实迁移时,中级表征方法与领域随机化相比表现如何?
- RQ4与端到端像素训练相比,中级特征是否能带来更好的零样本现实世界迁移性能?
- RQ5中级表征的性能在不同环境和任务中是否具有鲁棒性,还是严重依赖于所使用的特定特征?
主要发现
- 使用中级表征训练的策略在某些测试环境中实现了100%的成功率,而从零开始训练和领域随机化方法则完全失败(训练与测试均0%成功率)。
- 中级表征方法的训练速度接近使用真实低维状态的水平,显著优于从原始像素训练的样本效率。
- 在仿真到现实的零样本迁移中,使用中级特征的智能体表现优于从零开始训练的智能体,其中性能最佳的特征(如曲率)在仿真与真实机器人上表现几乎一致。
- 仿真环境与真实环境之间特征性能的Spearman等级相关系数为ρ = 0.77,表明尽管存在领域差距,特征效用仍保持稳定。
- 中级表征在多种领域偏移(如新物体、纹理)下提升了泛化能力,而领域随机化在更困难任务中反而降低了性能(如训练成功率从100%降至70%)。
- 特征排名在不同环境中保持稳定,但在不同任务间不稳定,表明特征效用依赖于任务结构,因此选择与任务相关的特征对成功至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。