[论文解读] How To Avoid Being Eaten By a Grue: Exploration Strategies for Text-Adventure Agents
本文提出两种新颖的探索策略——策略链(policy chaining)与基于知识图谱的单元表示的Go-Explore——用于文本冒险智能体,以克服Zork1中组合爆炸式动作空间的问题,并成功通过关键瓶颈(如在被Grue吞噬前点亮灯)。表现最佳的方法KG-A2C-Explore获得44分,超越先前方法,表明结合知识图谱与针对性探索可实现部分可观察环境中高效长时程决策。
Text-based games -- in which an agent interacts with the world through textual natural language -- present us with the problem of combinatorially-sized action-spaces. Most current reinforcement learning algorithms are not capable of effectively handling such a large number of possible actions per turn. Poor sample efficiency, consequently, results in agents that are unable to pass bottleneck states, where they are unable to proceed because they do not see the right action sequence to pass the bottleneck enough times to be sufficiently reinforced. Building on prior work using knowledge graphs in reinforcement learning, we introduce two new game state exploration strategies. We compare our exploration strategies against strong baselines on the classic text-adventure game, Zork1, where prior agent have been unable to get past a bottleneck where the agent is eaten by a Grue.
研究动机与目标
- 解决Zork1等文本游戏中的组合爆炸式动作空间问题,此类问题导致标准强化学习智能体难以有效探索。
- 通过将知识图谱整合到探索策略中,提升部分可观察环境中的样本效率。
- 使智能体能够成功通过长时程瓶颈(如在遇到Grue前点亮灯),此类情境因延迟奖励而使学习变得困难。
- 评估基于知识图谱的状态表示是否相比纯文本表示能提升探索性能。
- 比较策略链与基于Go-Explore的探索在遍历无环、解谜型游戏结构中的有效性。
提出的方法
- 作者在知识图谱增强的A2C智能体KG-A2C基础上,引入两种探索策略:策略链与基于知识图谱单元表示的Go-Explore。
- 策略链通过回溯检测潜在瓶颈,并显式训练策略以解决这些瓶颈,从而提升顺序决策任务中的样本效率。
- Go-Explore通过将知识图谱快照与游戏状态共同作为单元表示进行适配,实现比纯文本编码更具意义的状态抽象。
- 知识图谱在每一步动态更新,利用OpenIE从观测中提取三元组,表示实体、关系及其位置或状态。
- 探索通过加权采样单元进行引导,优先级更高的单元为得分更高或游戏进度更先进的单元。
- 智能体使用基于模板的动作空间,包含237个模板及最多两个实体填充项,将每步的有效动作空间从1.64×10^14降低至1.15×10^8。
实验结果
研究问题
- RQ1基于知识图谱的探索策略是否能显著提升组合爆炸式动作空间的文本游戏中的样本效率?
- RQ2在Go-Explore中使用基于知识图谱的单元表示是否相比纯文本编码带来更好的探索性能?
- RQ3策略链(显式检测并解决瓶颈)在无环游戏结构中是否比随机或启发式探索更具样本效率?
- RQ4基于知识图谱状态表示的智能体能否突破Zork1中的40分瓶颈(失败原因是在遇到Grue前未及时点亮灯)?
- RQ5在部分可观察环境下,知识图谱表示相比纯文本编码基线,在实现长时程规划方面表现如何?
主要发现
- KG-A2C-Explore方法最终获得44分,成功通过Zork1中的40分瓶颈,而此前的智能体均未能突破此关卡。
- KG-A2C-chained获得41.8分,表明结合知识图谱的策略链可实现比基于Go-Explore的探索更快收敛与更高样本效率。
- A2C-Explore基线最高得分为40分,但未能通过瓶颈,表明仅使用纯文本单元表示不足以实现长时程探索。
- 基于知识图谱的状态表示显著优于纯文本表示,即使在未增强探索的情况下,KG-A2C也达到34分,而A2C仅得32分。
- 策略链在样本效率上优于基于Go-Explore的探索,表明显式瓶颈检测可加速在结构化、无环游戏环境中的学习。
- 消融实验确认知识图谱对部分可观察性至关重要,且仅增强探索本身不足以在缺乏结构化状态表示的情况下实现有效学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。