[论文解读] Pessimism About Unknown Unknowns Inspires Conservatism
本文提出了一种贝叶斯强化学习智能体,通过在未知世界模型上采用悲观策略来避免新颖的失败模式。通过在不确定时向导师求助,并在一组模型中针对最坏情况下的期望奖励进行优化,该智能体确保其极少引发前所未有的事件——在渐近性能上至少与导师相当,同时随时间推移减少依赖导师的频率。
If we could define the set of all bad outcomes, we could hard-code an agent which avoids them; however, in sufficiently complex environments, this is infeasible. We do not know of any general-purpose approaches in the literature to avoiding novel failure modes. Motivated by this, we define an idealized Bayesian reinforcement learner which follows a policy that maximizes the worst-case expected reward over a set of world-models. We call this agent pessimistic, since it optimizes assuming the worst case. A scalar parameter tunes the agent's pessimism by changing the size of the set of world-models taken into account. Our first main contribution is: given an assumption about the agent's model class, a sufficiently pessimistic agent does not cause "unprecedented events" with probability $1-δ$, whether or not designers know how to precisely specify those precedents they are concerned with. Since pessimism discourages exploration, at each timestep, the agent may defer to a mentor, who may be a human or some known-safe policy we would like to improve. Our other main contribution is that the agent's policy's value approaches at least that of the mentor, while the probability of deferring to the mentor goes to 0. In high-stakes environments, we might like advanced artificial agents to pursue goals cautiously, which is a non-trivial problem even if the agent were allowed arbitrary computing power; we present a formal solution.
研究动机与目标
- 为解决在复杂、非马尔可夫环境中难以形式化指定所有风险时,避免未知未知失败模式的挑战。
- 设计一种在面对前所未有的事件时仍保持保守的强化学习智能体,即使设计者无法正式指定所有潜在失败模式。
- 确保智能体的长期性能趋近或超过导师的性能,同时随时间推移最小化对导师指导的依赖。
- 形式化一种安全保证,即智能体以高概率不会引发此前从未发生过的事件,除非导师主动发起。
提出的方法
- 智能体维护一个可数个世界模型和导师模型的贝叶斯后验分布,并根据交互历史递归更新。
- 在每个时间步,智能体计算一个悲观值,即其后验中前 β 分数的世界模型的最小期望回报。
- 若在采样世界模型中导师的期望值超过悲观值加上噪声,或悲观值为零,则智能体向导师求助。
- 智能体使用类似汤普森采样查询概率的方法,在探索与导师指导之间取得平衡,当不确定性较高时更倾向于求助。
- 智能体的策略被定义为在前几大世界模型中最大化悲观值的策略,以确保最坏情况下的鲁棒性。
- 假设模型类足够丰富(例如,半可计算的随机模型),能够包含合理的世界模型和导师模型,从而实现广泛适用性。
实验结果
研究问题
- RQ1能否设计一种强化学习智能体,即使在失败模式无法正式指定的情况下,也能避免前所未有的失败模式?
- RQ2这种智能体能否在随时间减少对导师依赖的同时,实现至少与导师相当的性能?
- RQ3能否形式化保证智能体以高概率不会引发此前从未发生过的新型事件?
- RQ4如何在贝叶斯强化学习框架中形式化悲观策略,以确保安全性而不牺牲长期性能?
主要发现
- 悲观智能体的策略值渐近趋近于至少与导师相当的水平,确保长期性能不低于导师。
- 随着时序增加,智能体向导师求助的概率趋近于零,表明其自主性随时间不断增强。
- 对于给定复杂度类 C 中的任意事件 E,只要该事件此前未发生过,即可使智能体以任意高的概率避免首次引发 E。
- 由于基于悲观的最坏情况分析,该智能体的安全保证在设计者无法正式指定希望避免的失败模式时依然成立。
- 智能体对类似线路劫持(wireheading)的世界模型具有鲁棒性:悲观策略抑制了劫持奖励信号的动机,因为此类行为的最坏情况值始终保持较低。
- 该理论框架形式化且具有一般性,仅依赖于可数模型类和贝叶斯更新,因此适用于复杂、非马尔可夫环境。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。