[论文解读] On Reward Function for Survival
本文提出了一种基于强化学习(RL)的生存根本性奖励函数,通过将目标表述为最大化多步生存概率,即以时间生存概率的对数形式表达。该方法通过变分推断将此目标转化为标准强化学习目标,使智能体能够学习有效的生存策略——在实验中,智能体成功维持了电池电量并避免了毒物,其生存时间显著优于随机智能体。
Obtaining a survival strategy (policy) is one of the fundamental problems of biological agents. In this paper, we generalize the formulation of previous research related to the survival of an agent and we formulate the survival problem as a maximization of the multi-step survival probability in future time steps. We introduce a method for converting the maximization of multi-step survival probability into a classical reinforcement learning problem. Using this conversion, the reward function (negative temporal cost function) is expressed as the log of the temporal survival probability. And we show that the objective function of the reinforcement learning in this sense is proportional to the variational lower bound of the original problem. Finally, We empirically demonstrate that the agent learns survival behavior by using the reward function introduced in this paper.
研究动机与目标
- 将生存问题形式化为未来多步生存概率的概率优化问题。
- 通过推导一个原则性的奖励函数,弥合生存策略学习与经典强化学习之间的鸿沟。
- 证明通过变分推断最大化生存概率可得到与特定奖励函数等价的标准强化学习目标函数。
- 通过实证验证,使用该奖励函数训练的智能体能够学习到有效的生存行为,包括资源管理与危险规避。
提出的方法
- 将生存问题表述为在 T 个未来时间步内最大化生存概率,使用状态转移的概率模型。
- 引入一个奖励函数,定义为时间生存概率的负对数,作为真实生存目标的代理函数。
- 应用变分推断与期望最大化(EM)算法,推导出生存概率目标的下界(变分自由能)。
- 证明在 M 步中,负自由能函数在数学上等价于具有所提出奖励函数的标准强化学习目标。
- 使用 Sarsa(λ) 作为无模型强化学习算法,在包含电池、食物和毒物状态的模拟环境中,基于推导出的奖励函数训练智能体。
- 采用生存标志机制追踪智能体的存活能力,当生存概率降至阈值以下时终止训练回合。
实验结果
研究问题
- RQ1生存问题能否被正式表述为多步生存概率最大化的任务?
- RQ2此类生存目标如何转化为具有意义奖励函数的标准强化学习问题?
- RQ3基于生存概率对数的推导出的奖励函数,是否能有效训练智能体学习稳健的生存行为?
- RQ4生存目标的变分下界是否与经典强化学习目标一致,从而可使用现有强化学习算法?
主要发现
- 使用所提出的生存奖励函数的 Sarsa(λ) 智能体,其中位生存时间显著超过随机智能体,后者通常在 25 个时间步内即告死亡。
- 智能体成功将电池电量维持在期望水平 60 左右,表明其对生理状态具有有效调控能力。
- 智能体在整个评估过程中消耗的毒物数量(B)始终为零,证实其成功避开了有害刺激。
- 智能体随时间增加了对有益食物项(A)的消耗,表明其表现出适应性觅食行为。
- 实证结果证实,所提出的奖励函数能够支持学习复杂的生存策略,包括资源管理与危险规避。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。