Skip to main content
QUICK REVIEW

[论文解读] Multi-Stage Episodic Control for Strategic Exploration in Text Games

Jens Tuyls, Shunyu Yao|arXiv (Cornell University)|Jan 4, 2022
Artificial Intelligence in Games被引用 4
一句话总结

本文提出 eXploit-Then-eXplore (XTX),一种多阶段的篇章式控制算法,通过在每个episode中显式分离利用与探索,实现文本游戏中的战略性导航。通过首先利用自监督模仿学习对过往有希望的轨迹进行利用,随后切换至基于逆动力学的好奇心驱动探索,XTX在确定性和随机设置下的Jericho基准测试中,平均得分分别较之前方法提升27%和11%,在Zork1上达到103分——超过之前最先进方法的两倍以上。

ABSTRACT

Text adventure games present unique challenges to reinforcement learning methods due to their combinatorially large action spaces and sparse rewards. The interplay of these two factors is particularly demanding because large action spaces require extensive exploration, while sparse rewards provide limited feedback. This work proposes to tackle the explore-vs-exploit dilemma using a multi-stage approach that explicitly disentangles these two strategies within each episode. Our algorithm, called eXploit-Then-eXplore (XTX), begins each episode using an exploitation policy that imitates a set of promising trajectories from the past, and then switches over to an exploration policy aimed at discovering novel actions that lead to unseen state spaces. This policy decomposition allows us to combine global decisions about which parts of the game space to return to with curiosity-based local exploration in that space, motivated by how a human may approach these games. Our method significantly outperforms prior approaches by 27% and 11% average normalized score over 12 games from the Jericho benchmark (Hausknecht et al., 2020) in both deterministic and stochastic settings, respectively. On the game of Zork1, in particular, XTX obtains a score of 103, more than a 2x improvement over prior methods, and pushes past several known bottlenecks in the game that have plagued previous state-of-the-art methods.

研究动机与目标

  • 为解决文本冒险游戏中稀疏奖励与组合爆炸式动作空间带来的挑战,这些挑战会阻碍有效探索与利用。
  • 克服单策略方法在动态、高维环境中难以平衡探索与利用的局限性。
  • 使智能体能够有策略地返回到有希望的前沿状态,并执行有针对性的局部探索,以突破持久的游戏瓶颈。
  • 开发一种方法,可在无需依赖环境特定假设或外部记忆的前提下,跨确定性和随机性文本游戏变体实现扩展。
  • 证明在episode内显式分解策略可带来相较于端到端或好奇心增强基线方法更优的样本效率与性能。

提出的方法

  • XTX采用两阶段的篇章式控制策略:首先通过在过往经验中混合高分与长轨迹进行自监督模仿学习训练的策略进行利用。
  • 利用策略是轨迹的软性混合,可防止过早收敛至局部最优,并支持对前沿状态的稳健回归。
  • 在利用阶段结束后,智能体切换至结合时序差分(TD)损失与辅助逆动力学损失的探索策略,以鼓励发现新颖、未见过的动作。
  • 单一插值参数 λ 控制利用与探索之间的过渡,实现在单个episode内的平滑策略融合。
  • 探索策略利用基于内在好奇心与环境反馈训练的价值函数,使智能体能够在已知前沿状态周围执行战略性局部探索。
  • 该方法无需访问底层游戏模拟器或游戏树归档,因此具备良好的可扩展性与泛化能力。

实验结果

研究问题

  • RQ1是否一种显式分离利用与探索的多阶段篇章式控制方法,能够提升在稀疏奖励与大动作空间文本游戏中的样本效率与性能?
  • RQ2在复杂游戏环境中,利用阶段采用混合策略在多大程度上可防止过早收敛至局部最优?
  • RQ3将基于逆动力学的 curiosity 与专用利用策略结合,在未见游戏状态中能否显著增强战略性探索?
  • RQ4所提出的两阶段方法是否在确定性与随机性游戏设置下,均优于采用内在好奇心奖励或独立探索策略的单策略方法?
  • RQ5与持续混合策略相比,显式分离利用与探索阶段对于解决如 Zork1 这类具有挑战性的文本冒险游戏而言,其关键性如何?

主要发现

  • 在Jericho基准测试的12个确定性游戏中,XTX相较之前方法平均提升27%的归一化得分。
  • 在随机设置下,XTX相较基线方法在相同12个游戏中平均提升11%的归一化得分。
  • 在Zork1的确定性版本中,XTX取得103分——超过之前最先进方法44分的两倍以上。
  • 在Zork1的随机变体中,XTX达到67分,显著优于之前最先进水平的41分。
  • 消融实验表明,纯利用或纯探索策略表现均欠佳,且在利用阶段混合策略对突破游戏特异性瓶颈至关重要。
  • 该方法成功突破了Zork1中的已知瓶颈,例如击败地牢中的巨魔,而此前的智能体均被此障碍阻断。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。