Skip to main content
QUICK REVIEW

[论文解读] When to Ask for Help: Proactive Interventions in Autonomous Reinforcement Learning

Annie Xie, Fahim Tajwar|arXiv (Cornell University)|Oct 19, 2022
Reinforcement Learning in Robotics被引用 4
一句话总结

本文提出PAINT,一种用于自主强化学习的主动干预框架,通过学习检测并避免不可逆状态,减少对人工监控的依赖。通过仅在必要时使用标签高效的二分查找查询可逆性标签,并结合分类器预测不可逆状态,PAINT在连续控制任务中实现了高达15倍的干预次数减少——在300万步训练中仅需约100次干预,同时保持了高样本效率和干预效率。

ABSTRACT

A long-term goal of reinforcement learning is to design agents that can autonomously interact and learn in the world. A critical challenge to such autonomy is the presence of irreversible states which require external assistance to recover from, such as when a robot arm has pushed an object off of a table. While standard agents require constant monitoring to decide when to intervene, we aim to design proactive agents that can request human intervention only when needed. To this end, we propose an algorithm that efficiently learns to detect and avoid states that are irreversible, and proactively asks for help in case the agent does enter them. On a suite of continuous control environments with unknown irreversible states, we find that our algorithm exhibits better sample- and intervention-efficiency compared to existing methods. Our code is publicly available at https://sites.google.com/view/proactive-interventions

研究动机与目标

  • 通过使智能体能够自主检测并请求帮助以应对不可逆状态,减少强化学习中的人员监控。
  • 最小化训练过程中所需获取的可逆性标签数量,这些标签通常从人工监督者处获取成本较高。
  • 设计一种结合高效标签获取与主动干预的框架,提升在具有不可逆动力学的真实世界强化学习场景中的自主性。
  • 评估该方法在标签噪声和随机转移下的鲁棒性,确保其具备实际可部署性。

提出的方法

  • 提出一种可逆性感知的Q值函数,对访问不可逆状态进行惩罚,从而在学习过程中促使智能体避免这些状态。
  • 采用基于二分查找的标签标注方案,使用最多O(log T)次查询确定轨迹中状态的可逆性,相比标准安全强化学习中的O(T)次查询显著减少。
  • 引入批量标注策略,仅在长轨迹结束时查询可逆性标签,从而减少实时监督需求。
  • 训练一个分类器,利用标注数据预测状态的可逆性,从而在检测到高不确定性或高风险状态时主动发起干预请求。
  • 结合置信度估计和集成不确定性估计方法,仅在预测置信度较低时才查询标签,进一步减少标签查询次数。
  • 实现一种鲁棒变体,通过使用相邻状态的滑动窗口对标签取平均,提高对人工提供的可逆性标签中噪声的容忍度。

实验结果

研究问题

  • RQ1强化学习智能体能否在极少人工监督下学会检测不可逆状态?
  • RQ2如何高效获取可逆性标签,以减少训练过程中的人员查询次数?
  • RQ3分类器在多大程度上能够预测不可逆状态,从而实现主动干预,减少对实时监控的依赖?
  • RQ4该方法对噪声可逆性标签和随机环境动力学的鲁棒性如何?
  • RQ5该框架能否在具有未知不可逆状态的多样化连续控制任务中保持高样本效率和干预效率?

主要发现

  • PAINT将300万次训练步长内的干预次数减少至约100次,相比先前算法最多减少15倍。
  • 标签高效的二分查找方案将每条轨迹的可逆性标签查询次数从O(T)降低至O(log T),显著减轻了人工标注负担。
  • 通过置信度驱动的查询机制,PAINT将标签数量减少至不足100个(相比标准PAINT的3,000个),同时保持了高成功率。
  • 采用集成不确定性查询机制时,当不确定性阈值设为0.0001时,PAINT仅使用约750个标签即可实现高性能。
  • PAINT的鲁棒变体在窗口大小为10时,可容忍高达20%的误报或漏报标签,同时保持60–80%的成功率。
  • PAINT在噪声水平σ = 0.5以内的随机转移下仍保持鲁棒,但当噪声超过动作幅值(σ = 1.0)时失效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。