Skip to main content
QUICK REVIEW

[论文解读] Gradient-free Policy Architecture Search and Adaptation

Sayna Ebrahimi, Anna Rohrbach|arXiv (Cornell University)|Oct 16, 2017
Reinforcement Learning in Robotics参考文献 21被引用 12
一句话总结

本文提出了一种无梯度策略架构搜索与适配方法,通过联合利用专家示范和环境奖励,学习安全且高性能的自动驾驶策略。通过仅使用目标域奖励来优化网络架构并适应域偏移,该方法显著减少了累积碰撞次数,并在性能上优于基线方法。

ABSTRACT

We develop a method for policy architecture search and adaptation via gradient-free optimization which can learn to perform autonomous driving tasks. By learning from both demonstration and environmental reward we develop a model that can learn with relatively few early catastrophic failures. We first learn an architecture of appropriate complexity to perceive aspects of world state relevant to the expert demonstration, and then mitigate the effect of domain-shift during deployment by adapting a policy demonstrated in a source domain to rewards obtained in a target environment. We show that our approach allows safer learning than baseline methods, offering a reduced cumulative crash metric over the agent's lifetime as it learns to drive in a realistic simulated environment.

研究动机与目标

  • 为解决自动驾驶策略训练期间因探索不安全而导致的早期灾难性失败问题。
  • 在无需目标域示范的情况下,提升策略在不同域偏移(如光照、天气)下的泛化能力。
  • 通过结合专家示范与环境奖励,联合优化策略架构与参数,以实现更安全、高效的训练。
  • 仅通过奖励反馈,实现从源域策略到视觉上明显不同的新目标环境的有效适配。

提出的方法

  • 一种受[16]启发的无梯度优化算法,通过改进噪声生成方式以实现更精确和高效的梯度估计。
  • 采用进化搜索在可变长度神经网络结构上进行架构搜索,以找到感知与控制任务的最优策略架构。
  • 在目标域中联合训练策略网络,结合专家示范的模仿学习与环境奖励的强化学习。
  • 通过基于奖励的微调,将预训练的源域策略适配到目标域,无需目标域中的对齐或示范。
  • 使用复合奖励函数,在架构搜索过程中平衡模型精度与参数量。
  • 在GTA5仿真环境中进行端到端训练,以评估转向、制动和油门预测的性能。

实验结果

研究问题

  • RQ1与固定或人工设计的架构相比,无梯度架构搜索是否能提升自动驾驶策略的性能与安全性?
  • RQ2联合利用示范与环境奖励进行学习,在策略训练期间是否能有效减少碰撞?
  • RQ3在仅使用奖励反馈的情况下,能否将一个在某一领域学习到的策略有效适配到视觉上明显不同的新领域?
  • RQ4同时优化策略架构的性能与紧凑性,是否能带来更好的泛化能力与安全性?

主要发现

  • 与仅依赖示范或奖励的基线方法相比,所提方法在训练过程中显著减少了累积碰撞次数。
  • 适配后的策略在训练53小时后(第832集)达到100%的平均奖励,优于表现欠佳的基线方法(其奖励在97.3%处趋于稳定)。
  • 在行人横穿等复杂场景中,适配模型正确预测了制动(0.956)与油门(0.052),而行为克隆模型错误地持续前进(制动:0.191)。
  • 使用源域与目标域奖励联合训练的大规模网络在目标域上测试损失为3×10⁻⁵,显著优于Bojarski等人[3]的1.85×10⁻⁴。
  • 所有配置下,模型的转向角预测损失接近10⁻⁵,表明该控制信号具有极强的鲁棒性。
  • 即使初始化时远离示范分布,该方法仍展现出有效的适应能力,凸显其对域偏移的强鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。