[论文解读] Situational Awareness by Risk-Conscious Skills
该论文提出SARiCoS,一种新颖的分层强化学习算法,通过在概率目标半马尔可夫决策过程(PG-SMDP)中优化风险敏感目标,学习风险感知技能。该方法使智能体能够表现出类似人类的情境意识——例如在足球比赛中拖延时间——通过学习具有不同风险态度的技能,有效缓解基于奖励的模型误设问题,并在胜负两种游戏状态下均实现更优性能。
Hierarchical Reinforcement Learning has been previously shown to speed up the convergence rate of RL planning algorithms as well as mitigate feature-based model misspecification (Mankowitz et. al. 2016a,b, Bacon 2015). To do so, it utilizes hierarchical abstractions, also known as skills -- a type of temporally extended action (Sutton et. al. 1999) to plan at a higher level, abstracting away from the lower-level details. We incorporate risk sensitivity, also referred to as Situational Awareness (SA), into hierarchical RL for the first time by defining and learning risk aware skills in a Probabilistic Goal Semi-Markov Decision Process (PG-SMDP). This is achieved using our novel Situational Awareness by Risk-Conscious Skills (SARiCoS) algorithm which comes with a theoretical convergence guarantee. We show in a RoboCup soccer domain that the learned risk aware skills exhibit complex human behaviors such as `time-wasting' in a soccer game. In addition, the learned risk aware skills are able to mitigate reward-based model misspecification.
研究动机与目标
- 为解决分层强化学习(H-RL)中缺乏风险敏感性的问题,特别是缓解基于奖励的模型误设问题。
- 通过风险敏感目标函数,将情境意识(SA)——即基于时间或空间的风险态度——整合到H-RL中。
- 开发一个框架,使智能体能够学习具有不同风险态度(如风险规避或风险寻求行为)的风险感知技能(RASs)。
- 设计一种算法,在PG-SMDP中同时学习技能间策略与RASs的风险感知参数(RAPs)。
- 证明风险感知技能学习可产生复杂且类似人类的行为,如在RoboCup足球等动态环境中拖延时间。
提出的方法
- 论文提出概率目标半马尔可夫决策过程(PG-SMDP),以建模具有时间与风险依赖目标的任务。
- 引入风险感知技能(RASs),即带有额外风险感知参数(RAP)的参数化选项,用于控制风险态度。
- SARiCoS算法通过优化风险敏感目标(如条件风险价值CVaR)来学习技能间策略与RASs的RAPs。
- 在标准策略梯度方法假设下,该算法理论上保证收敛至局部最优解。
- 该框架支持灵活的风险准则,包括指数风险、CVaR与VaR,可适应不同风险偏好。
- 该方法在RoboCup足球环境中进行了评估,智能体根据游戏状态与风险敏感性,学会在进攻与拖延时间行为间切换。
实验结果
研究问题
- RQ1在分层强化学习中,风险敏感目标能否诱导出复杂且类似人类的行为,如足球比赛中拖延时间?
- RQ2风险感知技能学习能否缓解基于奖励的模型误设问题,即错误的奖励设计导致次优策略?
- RQ3优化风险敏感目标(如CVaR)是否能使智能体学习到比标准期望回报最大化更鲁棒且更符合情境的策略?
- RQ4该框架能否根据任务状态(如比赛剩余时间)支持不同风险态度(如风险规避与风险寻求)?
- RQ5在PG-SMDP设定下,分层强化学习中风险感知技能学习是否存在理论收敛保证?
主要发现
- 在胜利场景中,SARiCoS智能体通过缓慢带球和站在球上实现拖延时间,平均回合长度为142.3 ± 1.5步。
- 在胜利场景中,SARiCoS智能体每回合仅攻入1.3 ± 0.6个进球,但每100回合仅被对方抢断7.3 ± 0.6次,表明其表现出有效的风险规避行为。
- 在失败场景中,SARiCoS智能体每回合攻入74.3 ± 6.5个进球,平均奖励达6.3 ± 0.2,显著优于期望回报(ER)基线,后者仅攻入1.7 ± 1.2个进球,平均奖励为-0.3 ± 0.1(负值)。
- SARiCoS智能体因风险敏感目标的推动,在失败场景中成功达到性能阈值β,主动寻求高影响力回报(如进球),而ER智能体则陷入局部最优。
- SARiCoS智能体通过避免过度远距离带球等次优行为,展现出对基于奖励的模型误设的鲁棒性,这些行为曾使ER智能体陷入低回报循环。
- 该算法实现了理论上的局部最优解收敛,验证了其在风险感知分层决策中的稳定性与实用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。