QUICK REVIEW
[论文解读] Enhancing Text-based Reinforcement Learning Agents with Commonsense Knowledge
Keerthiram Murugesan, Mattia Atzeni|arXiv (Cornell University)|May 2, 2020
Topic Modeling参考文献 33被引用 17
一句话总结
本文提出了一种用于文本环境的强化学习智能体,通过将符号化信念图与ConceptNet中的常识知识相结合,以减少探索并提高样本效率。通过动态融合实时环境观测与外部知识,该智能体在厨房清理和烹饪食谱任务中表现出优越性能,但过多的知识可能阻碍学习,凸显了上下文感知知识整合的必要性。
ABSTRACT
In this paper, we consider the recent trend of evaluating progress on reinforcement learning technology by using text-based environments and games as evaluation environments. This reliance on text brings advances in natural language processing into the ambit of these agents, with a recurring thread being the use of external knowledge to mimic and better human-level performance. We present one such instantiation of agents that use commonsense knowledge from ConceptNet to show promising performance on two text-based environments.
研究动机与目标
- 通过整合常识知识,解决文本强化学习智能体的样本低效问题。
- 研究来自ConceptNet的外部知识如何在TextWorld等文本环境中减少探索。
- 探索常识知识在何种条件下能提升或损害智能体性能。
- 开发一种双图架构,以符号化方式表示智能体的当前信念状态和全局常识知识。
- 在多样化的文本任务上评估该方法,包括厨房清理和基于食谱的游戏。
提出的方法
- 智能体维护一个局部信念图,基于文本观测符号化地表示其对环境的当前感知。
- 利用ConceptNet中的实体和关系构建一个全局常识图,以表示外部世界知识。
- 通过可微注意力机制将信念图与常识图融合,以指导动作选择。
- 系统支持两种知识集成模式:全图模式(从开始即可访问全部知识)和演化图模式(随着智能体探索逐步添加知识)。
- 该方法采用受Graph-Aided Transformer Agent(GATA)启发的框架,通过符号图上的自注意力机制学习状态表示。
- 性能在两个文本任务(厨房清理和基于食谱的烹饪游戏)上通过多次运行进行评估。
实验结果
研究问题
- RQ1在文本强化学习环境中,整合来自ConceptNet的常识知识是否能减少探索并提高样本效率?
- RQ2知识集成的时间(全图 vs. 渐进式)如何影响智能体性能?
- RQ3在何种条件下,外部知识会降低而非提升智能体性能?
- RQ4符号化信念图与常识知识的融合如何增强文本游戏中的决策能力?
- RQ5在何种场景下,真实信念图信息比常识知识更具优势?
主要发现
- 所提出的智能体在厨房清理任务中优于简单文本智能体和GATA基线模型,表现出更少的探索和更快的收敛速度。
- 在烹饪食谱任务中,演化图设置(渐进式知识)优于全图设置,表明延迟知识集成可减少噪声并提升性能。
- GATA_Full智能体在烹饪食谱任务中表现最佳,表明在目标局部化且简单的任务中,真实状态信息比常识知识更有效。
- 过多或未经充分过滤的常识知识可能使智能体不堪重负,导致性能下降,尤其在低复杂度环境中更为明显。
- 双图方法(信念图 + 常识知识)在复杂任务(如厨房清理)中显著提升了性能,因为此类任务需要对物体位置和关系进行推理。
- 结果表明,知识集成必须具备上下文感知能力:常识知识的效用取决于任务复杂度和环境结构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。