[论文解读] Playing Text-Based Games with Common Sense
本文提出通过引入常识知识来增强基于文本的游戏智能体,以提升其在部分可观测、类现实世界环境中的鲁棒性。通过使用 COMET 或 BERT 推断缺失的世界状态元素,并将其整合到知识图谱中,智能体在具有挑战性的 9:05 '日常生活' 游戏中表现显著提升,尤其在观察信息不完整或存在噪声时效果更明显。
Text based games are simulations in which an agent interacts with the world purely through natural language. They typically consist of a number of puzzles interspersed with interactions with common everyday objects and locations. Deep reinforcement learning agents can learn to solve these puzzles. However, the everyday interactions with the environment, while trivial for human players, present as additional puzzles to agents. We explore two techniques for incorporating commonsense knowledge into agents. Inferring possibly hidden aspects of the world state with either a commonsense inference model COMET, or a language model BERT. Biasing an agents exploration according to common patterns recognized by a language model. We test our technique in the 9to05 game, which is an extreme version of a text based game that requires numerous interactions with common, everyday objects in common, everyday scenarios. We conclude that agents that augment their beliefs about the world state with commonsense inferences are more robust to observational errors and omissions of common elements from text descriptions.
研究动机与目标
- 为解决基于文本的游戏中的部分可观测性挑战,即智能体因描述不完整或有噪声而遗漏关键物体。
- 探究常识知识是否能提升智能体在常见于 '日常生活' 游戏中的真实、日常场景下的表现。
- 评估通过 COMET 或 BERT 推断实体来增强智能体对世界状态信念的方法,是否比利用语言模型模式引导探索更有效。
- 在 9:05 游戏中测试智能体在观测失败情况下的鲁棒性,该游戏模拟了日常生活的平凡流程。
提出的方法
- 通过 COMET(一种神经模型)将常识推理结果整合到知识图谱中,以生成自然语言中的合理世界状态关系(如 HasA),从而增强 KG-A2C 智能体框架。
- 利用 BERT 的下一句预测能力,识别自然语言中常见的动作序列,从而引导动作探索,使智能体更倾向于选择合理的命令序列。
- 采用 Q*BERT(一种基于 BERT 的问答方法),推断超出简单 HasA 关系的多样化常识属性与关系,提升对隐含世界状态元素的覆盖度。
- 在两种条件下训练并评估智能体在 9:05 游戏中的表现:完整观测与修改后的观测(缺少物体引用),以模拟现实世界中的遗漏。
- 对比三种变体的性能:基线 KG-A2C、KG-A2C-BERT(探索偏差)与 COMET-A2C/Q*BERT(知识图谱增强)。
- 使用稀疏密集奖励塑造(奖励 = 2 表示进入浴室,6 表示洗澡)来衡量复杂多步任务中的进展与收敛速度。
实验结果
研究问题
- RQ1在观测不完整的情况下,常识知识是否能提升基于文本的游戏智能体在具有真实日常场景中的表现?
- RQ2通过推断实体增强智能体对世界状态的信念,是否比仅利用语言模型模式引导探索更有效?
- RQ3不同来源的常识知识(COMET 与 BERT 与 Q*BERT)在提升对观测失败的鲁棒性方面表现如何比较?
- RQ4使用多样化常识推理(超越简单 HasA 关系)是否能加快复杂类现实世界环境中的收敛速度并提升任务完成度?
主要发现
- 当房间描述中缺少物体引用时,COMET-A2C 和 Q*BERT 显著优于 KG-A2C 与 KG-A2C-BERT,成功完成进入浴室的全部任务。
- 当关键物体(如洗手池、马桶、淋浴)被省略时,KG-A2C 无法突破奖励为 2(进入浴室)的限制,表明其对观测空白极为脆弱。
- 在缺少物体的条件下,KG-A2C-BERT 的表现与基线 KG-A2C 相当,说明仅靠探索偏差无法弥补世界状态知识的缺失。
- 在缺少物体的条件下,Q*BERT 的收敛速度优于 COMET-A2C,表明通过问答方式实现的多样化常识推理能更有效地建模世界状态。
- 使用常识推理增强知识图谱,相比探索偏差,能带来更鲁棒、更可靠的性能表现,尤其在类现实世界观测噪声下。
- 结果证实,常识知识对智能体应对现实世界类环境至关重要,因为在这些环境中,细节常被省略或隐含而非明确陈述。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。