Skip to main content
QUICK REVIEW

[论文解读] Visceral Machines: Risk-Aversion in Reinforcement Learning with Intrinsic Physiological Rewards

Daniel McDuff, Ashish Kapoor|arXiv (Cornell University)|May 25, 2018
Mental Health Research Topics被引用 16
一句话总结

本文提出了一种强化学习框架,通过整合源自人类自主神经系统反应的内在生理奖励——特别是外周血流调节——以提升强化学习中的样本效率与安全性。通过训练卷积神经网络(CNN)从第一视角视频中预测与压力相关的生理信号,该方法提供了密集且具有预警作用的奖励信号,从而在模拟驾驶环境中减少碰撞并加速学习过程。

ABSTRACT

As people learn to navigate the world, autonomic nervous system (e.g., "fight or flight") responses provide intrinsic feedback about the potential consequence of action choices (e.g., becoming nervous when close to a cliff edge or driving fast around a bend.) Physiological changes are correlated with these biological preparations to protect one-self from danger. We present a novel approach to reinforcement learning that leverages a task-independent intrinsic reward function trained on peripheral pulse measurements that are correlated with human autonomic nervous system responses. Our hypothesis is that such reward functions can circumvent the challenges associated with sparse and skewed rewards in reinforcement learning settings and can help improve sample efficiency. We test this in a simulated driving environment and show that it can increase the speed of learning and reduce the number of collisions during the learning stage.

研究动机与目标

  • 为解决现实世界强化学习中稀疏且不均衡奖励的挑战,利用内在生理反馈。
  • 通过整合实时自主神经系统反应作为奖励信号,提升样本效率并减少训练过程中的灾难性失败。
  • 探究与‘战斗或逃跑’反应相关的生理信号是否可作为强化学习中的有效内在奖励。
  • 对比基于CNN的生理奖励模型与基于到障碍物距离的启发式奖励设计的性能。
  • 评估动态衰减内在奖励贡献对训练过程中学习速度与安全性的影响力。

提出的方法

  • 训练卷神经网络(CNN)从驾驶员的第一视角视频帧中预测外周血容量脉冲(交感神经系统激活的代理指标)。
  • 将CNN的输出用作内在奖励信号,对高唤醒状态(如接近碰撞)进行惩罚,从而在实际碰撞发生前实现预警。
  • 通过加权和的方式将内在生理奖励与外在任务奖励(如速度、目标完成度)结合:$ R_{total} = R_{ext} + \lambda R_{int} $。
  • 通过课程学习策略随时间衰减内在奖励权重 $ \lambda $:$ \lambda = 1 - \frac{1}{N_{\text{Episode}}} $,初始阶段完全依赖内在反馈。
  • 在具有受限空间与碰撞风险的模拟驾驶环境中训练一个演员-评论家强化学习智能体。
  • 对比基于CNN的内在奖励与基于启发式距离的内在奖励(如 $ 1 - \exp[-|\text{distance to wall}|] $)的性能。

实验结果

研究问题

  • RQ1与自主神经系统反应相关的生理信号是否可作为强化学习中有效且密集的内在奖励?
  • RQ2与稀疏外在奖励相比,使用学习到的生理唤醒模型是否能提升样本效率并减少训练过程中的碰撞?
  • RQ3动态衰减内在奖励贡献对早期训练阶段的学习速度与安全性有何影响?
  • RQ4基于深度学习的生理反应模型是否比基于几何距离的预设奖励设计更有效?
  • RQ5源自内脏反应的内在奖励是否能实现更安全的探索并延长高风险环境中的episode长度?

主要发现

  • 基于CNN的内在奖励显著减少了训练过程中的碰撞次数,尤其是在早期episode中,得益于对高唤醒状态的早期检测。
  • 采用时间衰减的内在奖励后,episode长度显著增加,智能体相比固定或非衰减的内在权重,能更快学会避免碰撞。
  • 在平均外在奖励与episode长度方面,使用CNN内在奖励的智能体均优于基于启发式距离的奖励设计。
  • 时间衰减的内在奖励策略优于最佳固定 $ \lambda = 0.25 $ 的情况,实现了更高的平均速度与更长的episode。
  • 生理奖励信号提供了非稀疏的反馈,且在实际碰撞前即被触发,从而实现更早的策略更新与更安全的探索。
  • 该模型表明,学习到的生理奖励能更好地捕捉复杂情境线索(如高速转弯、狭窄通道),优于简单的距离度量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。