Skip to main content
QUICK REVIEW

[论文解读] MESA: Offline Meta-RL for Safe Adaptation and Fault Tolerance

Michael Luo, Ashwin Balakrishna|arXiv (Cornell University)|Dec 7, 2021
Anomaly Detection Techniques and Applications被引用 5
一句话总结

MESA 提出了一种离线元强化学习框架,能够将来自多样化离线数据集的安全知识从不同环境迁移至新环境,从而在具有未见过动力学特性的环境中快速适应风险度量。通过元学习一个可迁移的安全评论家并使用极少的测试数据进行微调,MESA 在模拟环境中的五个连续控制领域内将约束违反减少了高达50%,同时保持了任务性能。

ABSTRACT

Safe exploration is critical for using reinforcement learning (RL) in risk-sensitive environments. Recent work learns risk measures which measure the probability of violating constraints, which can then be used to enable safety. However, learning such risk measures requires significant interaction with the environment, resulting in excessive constraint violations during learning. Furthermore, these measures are not easily transferable to new environments. We cast safe exploration as an offline meta-RL problem, where the objective is to leverage examples of safe and unsafe behavior across a range of environments to quickly adapt learned risk measures to a new environment with previously unseen dynamics. We then propose MEta-learning for Safe Adaptation (MESA), an approach for meta-learning a risk measure for safe RL. Simulation experiments across 5 continuous control domains suggest that MESA can leverage offline data from a range of different environments to reduce constraint violations in unseen environments by up to a factor of 2 while maintaining task performance. See https://tinyurl.com/safe-meta-rl for code and supplementary material.

研究动机与目标

  • 为解决在风险敏感强化学习环境中因在线交互导致昂贵失败的风险探索问题。
  • 实现在具有此前未见动力学特性(如部分执行器故障或系统参数变化)的新环境中的安全适应。
  • 通过利用来自多样化训练环境的离线数据集,减少对在线交互以学习风险度量的依赖。
  • 开发一种可在无需测试阶段任务特定数据的情况下,实现跨环境安全知识迁移的方法。
  • 在未见环境中的适应过程中,保持高任务性能的同时最小化约束违反。

提出的方法

  • MESA 将安全强化学习形式化为一个离线元强化学习问题,其中元训练在来自具有不同动力学特性的多个训练环境的离线数据集上进行。
  • 它元学习一个安全评论家 $Q^{ ext{risk}}_{\pi}$,用于估计在多样化环境中约束违反的风险。
  • 在适应阶段,使用来自具有此前未见动力学特性的新环境的小型离线测试数据集对元学习得到的安全评论家进行微调。
  • 然后将微调后的安全评论家与恢复策略结合,以在测试环境中实现安全的在线学习,遵循恢复强化学习范式。
  • 该方法依赖对比学习目标,以对齐不同环境中的风险估计,提升对分布外动力学的泛化能力。
  • 它采用多头网络架构,联合预测任务回报和风险,从而实现共享表示的端到端训练。

实验结果

研究问题

  • RQ1离线元强化学习能否将来自多样化环境的安全知识迁移至新环境,以实现在具有未见动力学特性的环境中快速适应?
  • RQ2在仍能实现有效安全适应且约束违反最少的前提下,测试数据集可小至何种程度?
  • RQ3与基线方法相比,MESA 在具有显著不同动力学特性的环境(如部分关节故障)中的泛化能力如何?
  • RQ4MESA 在适应过程中减少约束违反的同时,其任务性能保持程度如何?
  • RQ5MESA 是否能在无需在线交互或测试环境中任务特定数据的情况下实现安全适应?

主要发现

  • 即使使用极少的测试数据,MESA 在未见环境中的约束违反也比以往的离线强化学习方法减少了最多两倍。
  • 该方法在显著优于多任务学习基线方法的安全性和样本效率的同时,仍保持了强大的任务性能。
  • MESA 对具有部分关节故障的环境具有良好的泛化能力,其性能优于多任务学习方法,且约束违反更少。
  • 当测试数据集减少至原始大小的1/16(10K个转移)时性能才出现下降,表明其对小规模测试数据具有鲁棒性。
  • 当测试数据集为原始大小的1/4(10K个转移)时,MESA 仍能保持高性能,表明其可使用比训练数据少至40倍的测试数据运行。
  • 消融实验确认,MESA 的元学习风险度量能很好地泛化到分布外的动力学特性(如元训练期间未见的部分执行器故障)。”

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。