Skip to main content
QUICK REVIEW

[论文解读] Evaluating Agents without Rewards

Brendon Matusch, Jimmy Ba|arXiv (Cornell University)|Dec 21, 2020
Reinforcement Learning in Robotics参考文献 44被引用 10
一句话总结

本文通过分析预先收集的智能体行为数据集,提出了一种用于强化学习内在动机目标的回顾性评估框架,避免了昂贵的在线训练。研究发现,输入熵和信息增益与人类行为的相关性高于任务奖励,表明在Atari和Minecraft等复杂环境中,它们是更优的人类行为代理指标。

ABSTRACT

Reinforcement learning has enabled agents to solve challenging tasks in unknown environments. However, manually crafting reward functions can be time consuming, expensive, and error prone to human error. Competing objectives have been proposed for agents to learn without external supervision, but it has been unclear how well they reflect task rewards or human behavior. To accelerate the development of intrinsic objectives, we retrospectively compute potential objectives on pre-collected datasets of agent behavior, rather than optimizing them online, and compare them by analyzing their correlations. We study input entropy, information gain, and empowerment across seven agents, three Atari games, and the 3D game Minecraft. We find that all three intrinsic objectives correlate more strongly with a human behavior similarity metric than with task reward. Moreover, input entropy and information gain correlate more strongly with human similarity than task reward does, suggesting the use of intrinsic objectives for designing agents that behave similarly to human players.

研究动机与目标

  • 为解决在奖励函数稀疏或不可用时,评估内在目标在强化学习中迭代缓慢的问题。
  • 在复杂环境中,将内在目标(输入熵、信息增益、赋能)与人类行为及任务奖励进行比较。
  • 开发一种可扩展的回顾性评估方法,避免为每个目标重新训练智能体,从而实现对内在动机机制的快速比较。
  • 确定在Atari和Minecraft等环境中,内在目标是否比传统任务奖励更能反映类人行为。

提出的方法

  • 作者在4个环境(Atari游戏和Minecraft)中收集了26个智能体的多样化数据集,总计超过20亿张图像,作为固定的基准用于评估。
  • 通过将图像下采样至8×8像素,并将每个像素离散化为4个值,对图像进行预处理,以高效计算内在目标的离散概率张量。
  • 输入熵通过学习的密度模型计算,用于衡量感官输入的稀有性;信息增益衡量环境动态预测性能的提升;赋能量化智能体对其观测的控制能力。
  • 使用皮尔逊相关系数,在所有环境中计算每个内在目标与两个外部指标(任务奖励和人类相似性)之间的相关性。
  • 分析基于预先存在的智能体轨迹进行回顾性处理,无需为每个目标重新在线训练智能体。
  • 人类相似性通过使用基于行为一致性的度量,将智能体轨迹与记录的人类玩家轨迹进行比较来量化。

实验结果

研究问题

  • RQ1输入熵、信息增益和赋能等内在目标是否与人类行为的相关性高于与任务奖励的相关性?
  • RQ2内在目标能否作为比任务奖励更优的代理,用于设计类人行为的智能体?
  • RQ3在多样化环境中,不同内在目标在行为相关性方面如何相互关联?
  • RQ4是否能够通过固定预收集的行为数据集,无需重新训练智能体,高效评估和比较内在目标?

主要发现

  • 在所有环境中,输入熵(r = 0.89)和信息增益(r = 0.79)与人类相似性的相关性均高于任务奖励(r = 0.67)。
  • 所有三种内在目标与人类相似性的相关性均高于任务奖励,表明任务奖励可能并非类人行为的可靠代理。
  • 输入熵与信息增益之间存在强相互相关性(r ≈ 0.7),表明它们衡量的是行为的相似方面;而赋能与两者的相关性较低,表明其捕捉的是不同的行为维度。
  • 基于图像离散化的输入熵、信息增益和赋能的简单实现,与人类相似性表现出强相关性,表明其在探索和评估中的实用性。
  • 回顾性评估框架可在无需在线训练的情况下,高效比较内在目标,显著缩短迭代时间。
  • 赋能与人类相似性的相关性最弱(r = 0.66),表明其在开放性环境中可能与人类行为模式的对齐程度较低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。