[论文解读] Adaptive patch foraging in deep reinforcement learning agents
该论文表明,深度强化学习智能体可在复杂且生态上合理的环境中学习适应性觅食行为,其表现接近由边际价值理论(MVT)定义的最优解。这些智能体表现出类似灵长类动物觅食时的神经动力学特征,暗示生物智能与人工智能系统之间存在共享的计算原理。
Patch foraging is one of the most heavily studied behavioral optimization challenges in biology. However, despite its importance to biological intelligence, this behavioral optimization problem is understudied in artificial intelligence research. Patch foraging is especially amenable to study given that it has a known optimal solution, which may be difficult to discover given current techniques in deep reinforcement learning. Here, we investigate deep reinforcement learning agents in an ecological patch foraging task. For the first time, we show that machine learning agents can learn to patch forage adaptively in patterns similar to biological foragers, and approach optimal patch foraging behavior when accounting for temporal discounting. Finally, we show emergent internal dynamics in these agents that resemble single-cell recordings from foraging non-human primates, which complements experimental and theoretical work on the neural mechanisms of biological foraging. This work suggests that agents interacting in complex environments with ecologically valid pressures arrive at common solutions, suggesting the emergence of foundational computations behind adaptive, intelligent behavior in both biological and artificial agents.
研究动机与目标
- 研究深度强化学习智能体是否能在复杂且生态上真实的环境中学习适应性觅食行为。
- 确定使用无模型深度强化学习训练的智能体在多大程度上可逼近由边际价值理论(MVT)定义的最优解。
- 探索训练后智能体中出现的内部动力学是否与生物觅食者中观察到的神经活动模式相似。
- 通过在两个领域中建模一个基础决策问题,建立人工智能与生物认知之间的桥梁。
提出的方法
- 在具有空间分布资源斑块且随时间呈指数衰减的3D连续控制环境中训练深度强化学习智能体。
- 采用连续动作空间和类似LIDAR的感官输入,以实现逼真的导航与资源探测。
- 应用无模型深度强化学习(如SAC或类似算法)学习策略,而无需事先了解MVT。
- 追踪智能体轨迹与内部神经激活,以分析其行为与动力学特征与生物觅食者的相似性。
- 通过在不同环境条件下将斑块停留时间与MVT预测进行比较,评估性能。
- 分析智能体内部表征,寻找时间积分的证据,类似于灵长类前额叶皮层中观察到的证据累积机制。
实验结果
研究问题
- RQ1深度强化学习智能体是否能在具有衰减奖励的基于斑块的环境中学会适应性觅食?
- RQ2训练后智能体的斑块停留时间在多大程度上与边际价值理论(MVT)预测一致?
- RQ3训练后智能体的内部神经动力学是否与生物觅食者(尤其是非人灵长类动物)中观察到的模式相似?
- RQ4人工智能系统中出现的行为是否能为生物系统中觅食的神经机制提供可检验的预测?
- RQ5环境的复杂性与连续控制是否对最优觅食策略的出现构成挑战或提供支持?
主要发现
- 深度强化学习智能体成功在复杂3D环境中学会适应性觅食,根据环境资源丰富度调整斑块停留时间。
- 智能体行为在考虑时间折现的情况下,与边际价值理论预测的最优解高度接近。
- 智能体内部神经动力学表现出与灵长类动物(尤其是前额叶皮层区域)单细胞记录相似的模式。
- 智能体对斑块刷新速率和移动时间的变化表现出鲁棒性,其行为调整与MVT预测一致。
- 智能体中出现的行为表明,生物智能与人工智能系统在解决基本生态决策问题时存在共享的计算原理。
- 结果支持如下假设:复杂环境中的生态压力可导致人工与生物智能体中出现基础认知计算的涌现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。