[论文解读] PaCo: Parameter-Compositional Multi-Task Reinforcement Learning
PaCo 提出了一种参数组合式的多任务强化学习框架,通过使用与任务无关的参数集学习共享策略子空间,实现参数空间中的线性插值,从而灵活组合策略。该方法通过显式分离与任务无关及与任务相关的组件,提升了训练稳定性和泛化能力,在 Meta-World 基准测试中实现了最先进性能。
The purpose of multi-task reinforcement learning (MTRL) is to train a single policy that can be applied to a set of different tasks. Sharing parameters allows us to take advantage of the similarities among tasks. However, the gaps between contents and difficulties of different tasks bring us challenges on both which tasks should share the parameters and what parameters should be shared, as well as the optimization challenges due to parameter sharing. In this work, we introduce a parameter-compositional approach (PaCo) as an attempt to address these challenges. In this framework, a policy subspace represented by a set of parameters is learned. Policies for all the single tasks lie in this subspace and can be composed by interpolating with the learned set. It allows not only flexible parameter sharing but also a natural way to improve training. We demonstrate the state-of-the-art performance on Meta-World benchmarks, verifying the effectiveness of the proposed approach.
研究动机与目标
- 为解决多任务强化学习(MTRL)中在多样化任务间确定共享内容及共享方式的挑战。
- 通过解耦与任务无关和与任务相关的策略参数,提升 MTRL 中的训练稳定性。
- 通过统一的组合结构,实现对相似与不相似任务的灵活参数共享。
- 在不依赖复杂架构或外部元数据的前提下,实现在标准 MTRL 基准上的优越性能。
提出的方法
- 该方法使用一组与任务无关的参数(表示为矩阵 Φ)学习共享策略子空间,该子空间覆盖所有与任务相关的策略空间。
- 每个与任务相关的策略通过使用与任务相关的组合向量 w 线性组合 Φ 的列来构建,使得策略参数为 w^TΦ。
- 框架采用软演员评论家(SAC)算法,并为每个任务使用独立的温度参数 α_τ,以维持每项任务的熵水平。
- 每个任务独立优化一个与任务相关的组合向量 w,实现参数空间中的插值而非动作空间中的插值。
- 通过将与任务相关的更新与共享参数集隔离,该方法稳定了训练过程,减少了梯度冲突。
- 主成分分析(PCA)可视化显示,组合向量在语义上呈现聚集特征,表明 PaCo 在参数空间中学习到了有意义的行为结构。
实验结果
研究问题
- RQ1与标准参数共享相比,策略在参数空间中的线性组合是否能提升多任务强化学习的性能?
- RQ2将与任务无关和与任务相关的参数分离,对 MTRL 中的训练稳定性和泛化能力有何影响?
- RQ3在任务之间未显式关联的情况下,参数空间中的组合向量 w 是否能捕捉任务之间的语义关系?
- RQ4PaCo 框架是否在标准 MTRL 基准(如 Meta-World)上优于现有最先进方法?
- RQ5通过插值,所学习的参数子空间在多大程度上能泛化到未见过的任务?
主要发现
- PaCo 在 Meta-World 基准上实现了最先进性能,相比现有 SOTA 方法,在多任务学习效率和最终性能上均有提升。
- 通过 PCA 可视化组合向量 w 时,语义上相似的任务(如 window-open 和 door-open)在 w 空间中紧密聚集,表明方法学习到了有意义的行为语义。
- 即使在不相关的任务(如 peg-insert 和 window-open)之间,其在 w 空间中也表现出接近性,表明该方法捕捉到了超越任务名称字面意义的高层行为相似性。
- 通过将与任务相关的更新与共享参数集解耦,该方法实现了稳定的训练,减少了梯度冲突。
- 通过参数空间中的线性插值得到的策略具有良好的泛化能力,单位圆上采样的策略在环境中展现出多样且行为上有意义的交互。
- 该框架统一了 MTRL 中多种先前的共享结构,并为模块化或表示学习方法提供了一种灵活且可扩展的替代方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。