Skip to main content
QUICK REVIEW

[论文解读] Playing 20 Question Game with Policy-Based Reinforcement Learning

Huang Hu, Xianchao Wu|arXiv (Cornell University)|Aug 23, 2018
Multimodal Machine Learning Applications参考文献 9被引用 4
一句话总结

本文提出了一种基于策略的强化学习框架,用于20个问题游戏,使智能体能够在不依赖知识库或人工设计启发式规则的情况下学习最优问题选择。通过使用奖励网络来估计具有信息量的即时奖励,并利用策略网络采样多样化、鲁棒的问题,该方法在存在噪声的真实世界环境中优于基于熵的基线模型,同时在无噪声模拟环境中也保持了具有竞争力的性能。

ABSTRACT

The 20 Questions (Q20) game is a well known game which encourages deductive reasoning and creativity. In the game, the answerer first thinks of an object such as a famous person or a kind of animal. Then the questioner tries to guess the object by asking 20 questions. In a Q20 game system, the user is considered as the answerer while the system itself acts as the questioner which requires a good strategy of question selection to figure out the correct object and win the game. However, the optimal policy of question selection is hard to be derived due to the complexity and volatility of the game environment. In this paper, we propose a novel policy-based Reinforcement Learning (RL) method, which enables the questioner agent to learn the optimal policy of question selection through continuous interactions with users. To facilitate training, we also propose to use a reward network to estimate the more informative reward. Compared to previous methods, our RL method is robust to noisy answers and does not rely on the Knowledge Base of objects. Experimental results show that our RL method clearly outperforms an entropy-based engineering system and has competitive performance in a noisy-free simulation environment.

研究动机与目标

  • 开发一种20个问题游戏中无需依赖预存对象知识库的问题选择策略。
  • 提升对真实交互中常见噪声用户回答的鲁棒性。
  • 通过随机策略采样使智能体能够探索多样化的问题策略,从而增强泛化能力并避免陷入局部最优。
  • 为长时序决策设计有意义的奖励信号,其中仅最终猜测提供稀疏奖励。
  • 构建一个可扩展的端到端强化学习框架,可通过与真实用户的交互进行训练。

提出的方法

  • 将游戏建模为马尔可夫决策过程(MDP),智能体维护一个关于可能目标对象的信念状态(置信度向量)。
  • 策略网络 πθ(a|s) 基于当前信念状态输出问题分布,实现问题的随机采样而非贪婪选择。
  • 引入一种新颖的 RewardNet,用于在每个时间步估计非零且具信息量的奖励,从而改善长期回报的信用分配。
  • 智能体使用经验回放机制存储并采样历史轨迹 (s, a, r, s'),以实现稳定训练。
  • 通过策略梯度方法训练策略,利用 RewardNet 估计的回报进行端到端优化,实现问题选择的端到端学习。
  • 该框架通过与真实用户的交互进行训练,使其对答案噪声具有鲁棒性,并能适应多样的对象分布。

实验结果

研究问题

  • RQ1基于策略的强化学习智能体是否能够在无知识库访问的情况下,学会在20个问题游戏中有效选择问题?
  • RQ2当仅能获得最终胜负反馈时,如何设计有意义的中间奖励以提升训练效率?
  • RQ3强化学习智能体在面对真实用户提供的噪声或错误答案时,其泛化能力和鲁棒性在多大程度上得以保持?
  • RQ4与基于贪婪规则的方法相比,通过策略网络实现的随机问题采样是否能提升多样性与泛化能力?
  • RQ5在存在噪声和无噪声的环境中,该强化学习智能体的性能与高度工程化的基线方法相比如何?

主要发现

  • 所提出的强化学习方法在真实用户参与的评估中显著优于基于熵的工程化系统,尤其在噪声答案普遍存在的场景下表现更优。
  • 在无噪声的模拟环境中,该强化学习智能体的胜率与基于熵的基线方法相当,展现出强大的泛化能力。
  • 智能体在常见和不常见对象上均保持高性能,表明其对数据稀疏性和对象流行度偏差具有鲁棒性。
  • 使用 RewardNet 产生了更具信息量的训练信号,即使在最终奖励稀疏的情况下,也能实现更快的收敛和更优的策略学习。
  • 基于策略的方法结合随机采样,生成了更多样化且更自然的问题,从而提升了用户体验。
  • 该方法在不同对象集合上均表现出良好的泛化能力,表现为无论采用均匀分布还是基于流行度的对象采样分布,性能均保持一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。