[论文解读] Generalization to New Actions in Reinforcement Learning
本文通过提出一种两阶段框架,实现了强化学习中新动作的零样本泛化:首先使用分层变分自编码器从观测中学习动作表征,然后训练一种基于学习到的嵌入选择动作的策略。该方法在工具选择和3D形状堆叠等任务中对未见过的动作实现了强大的泛化性能,优于微调重训,且无需微调即可保持鲁棒性。
A fundamental trait of intelligence is the ability to achieve goals in the face of novel circumstances, such as making decisions from new action choices. However, standard reinforcement learning assumes a fixed set of actions and requires expensive retraining when given a new action set. To make learning agents more adaptable, we introduce the problem of zero-shot generalization to new actions. We propose a two-stage framework where the agent first infers action representations from action information acquired separately from the task. A policy flexible to varying action sets is then trained with generalization objectives. We benchmark generalization on sequential tasks, such as selecting from an unseen tool-set to solve physical reasoning puzzles and stacking towers with novel 3D shapes. Videos and code are available at https://sites.google.com/view/action-generalization
研究动机与目标
- 解决在引入新离散动作时强化学习中缺乏零样本泛化的问题。
- 使智能体能够在不重训的情况下,使用训练期间未见过的动作解决任务。
- 开发一种从观测中学习有意义动作表征并跨不同动作集泛化策略的框架。
- 在涉及工具、3D形状、导航和推荐的多样化环境中,对问题进行基准测试。
- 通过在训练期间鼓励多样化动作选择,提升策略泛化能力,避免对训练动作的过拟合。
提出的方法
- 使用分层变分自编码器(HVAE)将动作观测编码为低维动作表征。
- 从多样化输入(如视频、图像或动作执行的状态轨迹)中提取动作表征。
- 策略网络利用状态编码和动作表征计算动作效用,输出动作上的分类分布。
- 引入一种训练过程,鼓励在训练期间多样化选择动作,以提升零样本泛化性能。
- 策略采用混合动作空间,通过Beta分布和分类分布结合离散动作选择与连续动作(如位置或终止信号)。
- 对VAE应用重构损失,以确保从学习到的表征中准确恢复动作观测。
实验结果
研究问题
- RQ1强化学习智能体能否在未见过的训练动作上实现泛化?
- RQ2如何从多样化、高维的观测(如视频或轨迹)中有效学习动作表征?
- RQ3何种训练过程能使策略在不因过拟合于训练动作而影响性能的前提下,泛化到未见动作?
- RQ4当引入新动作时,所提框架与重训相比表现如何?
- RQ5该方法在不同任务和动作模态(如工具、3D形状和导航技能)之间,泛化能力的范围如何?
主要发现
- 所提出的两阶段框架能成功从多样化观测中学习有意义的动作表征,实现有效的零样本泛化。
- 在CREATE环境中,该方法在未见过的工具集合中实现良好泛化,智能体能从新工具集中选择工具解决物理推理谜题。
- 在形状堆叠任务中,智能体能泛化到训练期间未见过的3D形状,且在不重训的情况下取得高成功率。
- 通过鼓励训练期间多样化动作选择的训练过程,与朴素训练相比,显著提升了零样本性能。
- 在样本效率和泛化能力方面,该框架优于重训新动作,尤其在低数据场景下表现更优。
- 该方法在多个环境(包括导航和推荐任务)中表现出鲁棒性,证实了其广泛适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。