[论文解读] MEGA-DAgger: Imitation Learning with Multiple Imperfect Experts
MEGA-DAgger 是一种用于从多个不完美专家处进行交互式模仿学习的新型 DAgger 变体,采用安全感知数据过滤器以移除不安全的示范,并利用基于度量的专家评估系统来解决标签冲突。该方法学习到的策略在自主赛车任务中表现优于所有单个专家和当前最先进基线方法,在碰撞规避和超车方面分别实现了 13.6% 和 13.2% 的平均性能提升。
Imitation learning has been widely applied to various autonomous systems thanks to recent development in interactive algorithms that address covariate shift and compounding errors induced by traditional approaches like behavior cloning. However, existing interactive imitation learning methods assume access to one perfect expert. Whereas in reality, it is more likely to have multiple imperfect experts instead. In this paper, we propose MEGA-DAgger, a new DAgger variant that is suitable for interactive learning with multiple imperfect experts. First, unsafe demonstrations are filtered while aggregating the training data, so the imperfect demonstrations have little influence when training the novice policy. Next, experts are evaluated and compared on scenarios-specific metrics to resolve the conflicted labels among experts. Through experiments in autonomous racing scenarios, we demonstrate that policy learned using MEGA-DAgger can outperform both experts and policies learned using the state-of-the-art interactive imitation learning algorithms such as Human-Gated DAgger. The supplementary video can be found at \url{https://youtu.be/wPCht31MHrw}.
研究动机与目标
- 为了解决现有交互式模仿学习方法假设可访问单一完美专家的局限性。
- 在多个不完美专家(各自存在不安全或冲突行为)提供示范时,实现有效的模仿学习。
- 开发一种框架,可在交互式训练过程中过滤不安全的专家示范,并解决专家之间的动作冲突。
- 学习一种新手策略,在端到端自主赛车任务中,其安全性与性能均优于所有单个专家。
提出的方法
- 基于控制障碍函数的安全评分器用于在数据聚合过程中评估并过滤不安全的专家示范。
- 双分值评估机制为每位专家计算安全性和进度度量,以在发生冲突时对动作进行排序并选择最优动作。
- 该框架在类似 DAgger 的交互式循环中整合专家反馈,每次专家干预后重新训练新手策略。
- 采用数据截断策略,基于学习到的安全阈值(实验中 β = 70 步)移除专家轨迹中的不安全片段。
- 当多个专家在相同观测下提供冲突动作时,通过选择综合安全与进度得分最高的动作来解决冲突。
- 该方法应用于端到端自主赛车任务,其中安全性和进度均为关键性能指标。
实验结果
研究问题
- RQ1当专家示范包含不安全行为时,交互式模仿学习能否有效利用多个不完美专家?
- RQ2在策略训练过程中,如何解决多个专家提供的冲突动作,以避免性能下降?
- RQ3使用多个不完美专家训练出的策略能否在安全性和性能上均优于所有单个专家?
- RQ4过滤不安全示范对最终策略的安全性与泛化能力有何影响?
- RQ5所提出的专家评估与选择机制与简单平均或随机选择专家动作相比有何差异?
主要发现
- 与最佳单个专家相比,MEGA-DAgger 平均将碰撞率降低 13.6%,碰撞比例为 0.212 ± 0.019。
- 与最佳专家相比,MEGA-DAgger 在超车性能上提升 13.2%,超车率为 0.781 ± 0.016。
- 通过 MEGA-DAgger 学习到的策略在碰撞规避与超车指标上均优于原始 HG-DAgger 及采用数据过滤的 HG-DAgger。
- 在超车与碰撞规避方面,该方法相比原始 HG-DAgger 实现 45% 的平均性能提升,相比采用数据过滤的 HG-DAgger 提升 15%。
- 所训练策略表现出更高的稳定性,其在各次试验中的性能标准差小于单个专家。
- 可视化结果证实,该策略从不同专家处学习到互补的安全行为,避免了单个专家常见的高碰撞风险区域。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。