Skip to main content
QUICK REVIEW

[论文解读] Large-Scale Retrieval for Reinforcement Learning

Peter C. Humphreys, Arthur Guez|arXiv (Cornell University)|Jun 10, 2022
Reinforcement Learning in Robotics被引用 11
一句话总结

本文提出了一种检索增强型强化学习框架,使智能体能够通过近似最近邻搜索动态访问数千万个专家示范状态,显著提升了在9×9围棋中的决策能力。该方法实现了端到端训练,智能体在无需微调的情况下学习利用检索到的上下文来提升预测准确率和游戏表现,即使在推理时新增数据也能立即生效。

ABSTRACT

Effective decision making involves flexibly relating past experiences and relevant contextual information to a novel situation. In deep reinforcement learning (RL), the dominant paradigm is for an agent to amortise information that helps decision making into its network weights via gradient descent on training losses. Here, we pursue an alternative approach in which agents can utilise large-scale context sensitive database lookups to support their parametric computations. This allows agents to directly learn in an end-to-end manner to utilise relevant information to inform their outputs. In addition, new information can be attended to by the agent, without retraining, by simply augmenting the retrieval dataset. We study this approach for offline RL in 9x9 Go, a challenging game for which the vast combinatorial state space privileges generalisation over direct matching to past experiences. We leverage fast, approximate nearest neighbor techniques in order to retrieve relevant data from a set of tens of millions of expert demonstration states. Attending to this information provides a significant boost to prediction accuracy and game-play performance over simply using these demonstrations as training trajectories, providing a compelling demonstration of the value of large-scale retrieval in offline RL agents.

研究动机与目标

  • 使深度强化学习智能体能够在推理过程中访问并利用大规模外部历史经验数据集。
  • 克服纯参数化模型在引入新信息时需大量微调的局限性。
  • 探究大规模、上下文敏感的检索是否能提升组合环境(如9×9围棋)中的泛化能力和决策水平。
  • 证明检索可作为可扩展、高效且自适应的机制,将多样化信息源整合进强化学习智能体。
  • 验证在分布外设置下,检索机制在无需额外训练的情况下仍能提升性能。

提出的方法

  • 智能体采用半参数化架构,结合参数化策略网络与检索机制,以访问相关的历史经验。
  • 通过在状态嵌入空间中使用近似最近邻(ANN)搜索来检索相关经验。
  • 检索查询由当前观测通过查询网络生成,前k个最近邻被用作上下文,以条件化策略和价值预测。
  • 模型在离线监督式强化学习设置下进行端到端训练,使用约5000万盘专家围棋对局的数据集中的示范数据。
  • 推理时应用蒙特卡洛树搜索(MCTS)以进一步利用检索到的上下文提升策略表现。
  • 检索数据集可在推理时动态更新,加入新对局数据后,无需微调即可立即获得性能提升。

实验结果

研究问题

  • RQ1大规模、上下文敏感的过往经验检索是否能提升深度强化学习智能体的决策能力?
  • RQ2基于检索的外部数据访问是否能在组合环境(如9×9围棋)中带来更好的泛化能力?
  • RQ3智能体是否能在推理时通过更新检索数据库实现对新信息的适应,而无需微调?
  • RQ4与传统的经验回放或参数化摊销方法相比,检索机制在性能和效率方面表现如何?
  • RQ5检索机制在分布外设置下与规划方法(如MCTS)的协同作用有多大?

主要发现

  • 检索增强型智能体在9×9围棋上的预测准确率和对局表现方面,显著优于强基线非检索模型。
  • 将与评估对手对弈的新对局加入检索数据集后,智能体性能立即提升,无需任何微调。
  • 即使在推理时随机检索邻居,智能体仍保持较高性能,表明模型在训练过程中已学会从检索数据中泛化。
  • 检索与MCTS的结合带来了协同增益,增加模拟次数和检索邻居数量均能进一步提升性能。
  • 该方法展现出计算效率优势,检索带来的性能提升远超增加MCTS模拟次数的成本。
  • 该方法实现了检索信息使用方式的端到端学习,而不同于以往方法中预设固定机制来使用历史数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。