[论文解读] Transformers are Sample-Efficient World Models
本文提出 iris,一种样本高效的强化学习智能体,其完全在由离散自编码器和自回归 Transformer 构成的世界模型中进行学习。在 Atari 100k 基准测试中仅使用两小时游戏数据进行训练,iris 达到了 1.046 的人类性能归一化得分,并在 26 款游戏中的 10 款上超越人类表现,成为无需前瞻搜索方法的最新最先进水平。
Deep reinforcement learning agents are notoriously sample inefficient, which considerably limits their application to real-world problems. Recently, many model-based methods have been designed to address this issue, with learning in the imagination of a world model being one of the most prominent approaches. However, while virtually unlimited interaction with a simulated environment sounds appealing, the world model has to be accurate over extended periods of time. Motivated by the success of Transformers in sequence modeling tasks, we introduce IRIS, a data-efficient agent that learns in a world model composed of a discrete autoencoder and an autoregressive Transformer. With the equivalent of only two hours of gameplay in the Atari 100k benchmark, IRIS achieves a mean human normalized score of 1.046, and outperforms humans on 10 out of 26 games, setting a new state of the art for methods without lookahead search. To foster future research on Transformers and world models for sample-efficient reinforcement learning, we release our code and models at https://github.com/eloialonso/iris.
研究动机与目标
- 为解决深度强化学习中样本效率低下的关键挑战,特别是针对现实世界部署的应用。
- 开发一种世界模型架构,实现在极少交互数据下对环境进行高保真、长时程的模拟。
- 证明 Transformer 结合离散自编码器可作为样本高效策略学习的有效世界模型。
- 通过仅使用极少数据实现人类水平性能,为无前瞻搜索的模型基强化学习建立新基准。
- 通过发布代码和模型,促进未来研究,确保可复现性和可扩展性。
提出的方法
- 世界模型使用离散自编码器将原始像素观测压缩为一连串离散标记。
- 自回归 Transformer(G)通过从潜在代码和动作序列中预测未来的帧标记、奖励和回合终止信号,来建模环境动力学。
- 策略网络(π)仅在想象中与世界模型交互,基于对未来状态的预测生成动作。
- 在策略训练开始前,世界模型已在少量环境交互数据上以自监督方式预训练。
- 整个系统通过重建损失、奖励和终止信号的预测损失,以及通过强化学习进行策略优化,实现端到端训练。
- 该架构避免了门控层等复杂修改,依赖自监督预训练的稳定性。
实验结果
研究问题
- RQ1基于离散自编码器的 Transformer 世界模型能否仅从极少交互数据中实现高保真、长时程的环境建模?
- RQ2仅通过两小时真实环境交互数据,完全在想象中训练的策略在多大程度上能超越人类水平表现?
- RQ3与以往基于模型的强化学习方法相比,离散自编码器与自回归 Transformer 的组合在样本效率方面表现如何?
- RQ4世界模型能否生成真实、像素级精确的预测,以体现对游戏机制的深层理解?
- RQ5是否可能在不使用前瞻搜索的情况下实现最先进性能,而仅依赖基于想象的训练?
主要发现
- iris 仅使用相当于两小时真实游戏的交互数据,在 Atari 100k 基准测试中实现了 1.046 的平均人类性能归一化得分。
- 该智能体在 26 款 Atari 游戏中的 10 款上超越了人类玩家,展示了在样本高效设置下的超人类表现。
- 世界模型在多款游戏中生成了高度准确、像素级精确的预测,表明其对游戏机制有深刻理解。
- 在无前瞻搜索的方法中,该模型实现了最先进性能,其样本效率优于先前方法如 DreamerV2。
- 世界模型展现出强大的生成能力,使想象训练期间能够产生丰富多样的游戏体验。
- 与成熟智能体相比,该方法鲁棒性更强,且超参数调优需求极低,表明其具备优异的泛化能力与易部署性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。