[论文解读] Towards Information-Seeking Agents
本文提出一种通用框架,利用深度强化学习训练智能体在部分可观测环境中主动获取信息。通过结合内在奖励与外在奖励,智能体学会智能地查询信息片段(如视觉补丁或文本字符),以减少不确定性,并高效完成复杂任务,如目标检测、属性分类以及猜字游戏(Hangman)。在CelebA数据集上,10轮提问时准确率达96%(仅使用4%的图像数据),20轮提问时准确率达87.1%,显著优于随机基线方法。
We develop a general problem setting for training and testing the ability of agents to gather information efficiently. Specifically, we present a collection of tasks in which success requires searching through a partially-observed environment, for fragments of information which can be pieced together to accomplish various goals. We combine deep architectures with techniques from reinforcement learning to develop agents that solve our tasks. We shape the behavior of these agents by combining extrinsic and intrinsic rewards. We empirically demonstrate that these agents learn to search actively and intelligently for new information to reduce their uncertainty, and to exploit information they have already acquired.
研究动机与目标
- 开发一种通用的问题设定,用于训练智能体在部分可观测环境中高效获取信息。
- 使智能体能够通过结合内在奖励与外在奖励,学习主动且目标导向的信息获取行为。
- 证明智能体可通过智能查询减少不确定性,并有效利用获取的信息。
- 展示信息增益启发式方法在特定任务设置中可提升性能。
- 在多样化任务(包括目标检测、属性分类及基于文本的猜谜游戏)上验证该方法的有效性。
提出的方法
- 该框架使用带有注意力机制的深度神经网络,在每一步选择具有信息量的区域(如图像补丁或字符)。
- 采用强化学习方法,结合任务特定(外在)奖励与不确定性减少(内在)奖励的奖励塑造策略。
- 智能体的策略通过与环境的试错交互进行训练,环境每轮仅提供有限的信息。
- 视觉任务(如杂乱MNIST、CelebA)采用二维卷积架构,而基于文本的任务(如Hangman)则采用一维卷积网络。
- 使用信息增益启发式方法作为内在奖励,以鼓励在不确定性较高的状态下进行探索。
- 智能体通过整合多次查询的信息,构建完整的内部表征并作出最终预测。
实验结果
研究问题
- RQ1智能体能否在部分可观测环境中学习主动获取信息,以减少不确定性并提升任务性能?
- RQ2结合内在奖励(信息增益)与外在奖励(任务奖励)如何影响信息获取行为?
- RQ3单一通用智能体架构在多类信息获取任务中具有多大程度的泛化能力?
- RQ4与完整输入基线相比,该智能体在信息使用效率方面表现如何?
- RQ5能否使信息获取行为具备可解释性,并与人类推理方式(如在20个问题或Hangman游戏中)保持一致?
主要发现
- 在20个问题任务中,智能体仅用10轮提问(仅4%的图像数据)便达到96%的准确率,显著优于随机策略(71%准确率)。
- 在CelebA数据集上,智能体在20轮提问后(90像素,图像数据不足1%)达到87.1%的准确率,而完整图像的上限为88.3%。
- 在CelebA上,采用内在奖励塑造的模型显著优于随机基线(76.5%),证明其具备高效的信息获取能力。
- 在Hangman游戏中,智能体比基于频率或随机策略更有效地减少错误猜测次数,如游戏完成情况的累积分布所示。
- 智能体学会避免无意义的探索,其错误主要发生在关键对象未被定位到的搜索阶段。
- 模型展现出智能行为,能根据累积的不确定性动态调整提问策略,例如在20个问题任务中识别出黄色十字以降低对某项陈述的信心。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。