[论文解读] Learning to Multi-Task by Active Sampling
该论文提出了一种在线、基于主动采样的多任务强化学习框架,通过主动学习原则优先选择更难的任务,从而消除了对专家网络的依赖。该框架引入了三种方法——自适应采样、基于UCB的元学习器和基于A3C的元学习器,在七个多样化的多任务实例中实现了最先进性能,包括一个21个任务的Atari环境,展现出强大的泛化能力和无任务依赖的表征学习能力。
One of the long-standing challenges in Artificial Intelligence for learning goal-directed behavior is to build a single agent which can solve multiple tasks. Recent progress in multi-task learning for goal-directed sequential problems has been in the form of distillation based learning wherein a student network learns from multiple task-specific expert networks by mimicking the task-specific policies of the expert networks. While such approaches offer a promising solution to the multi-task learning problem, they require supervision from large expert networks which require extensive data and computation time for training. In this work, we propose an efficient multi-task learning framework which solves multiple goal-directed tasks in an on-line setup without the need for expert supervision. Our work uses active learning principles to achieve multi-task learning by sampling the harder tasks more than the easier ones. We propose three distinct models under our active sampling framework. An adaptive method with extremely competitive multi-tasking performance. A UCB-based meta-learner which casts the problem of picking the next task to train on as a multi-armed bandit problem. A meta-learning method that casts the next-task picking problem as a full Reinforcement Learning problem and uses actor critic methods for optimizing the multi-tasking performance directly. We demonstrate results in the Atari 2600 domain on seven multi-tasking instances: three 6-task instances, one 8-task instance, two 12-task instances and one 21-task instance.
研究动机与目标
- 解决单一智能体在不依赖任务特定专家网络的情况下,同时学习解决多个目标导向任务的挑战。
- 通过实现在线、自监督学习,克服基于蒸馏的多任务学习所导致的高计算和数据成本。
- 通过主动采样学习无任务依赖的表征,提升在视觉差异大、高维任务中的泛化能力。
- 开发一种可扩展且鲁棒的多任务学习框架,使超参数在不同任务集之间具有良好的泛化性,包括大规模多任务实例。
- 引入新的评估指标,以比现有基准更准确地反映多任务性能。
提出的方法
- 将多任务学习建模为一个主动采样问题,通过更频繁地采样更难的任务来提高学习效率。
- 提出三种不同的模型:(1) 自适应采样方法,根据任务难度动态调整采样频率;(2) 基于UCB的元学习器,将任务选择建模为带探索奖励的多臂赌博机问题;(3) 基于A3C的元学习器,使用演员-评论家强化学习直接优化多任务性能。
- 使用共享主干网络和任务特定输出头,但表明共享头在性能和泛化能力上优于独立头架构。
- 通过主动采样实现课程学习,使用A3C风格的异步强化学习端到端训练多任务智能体。
- 实施一种新颖的评估协议,引入$ p_{am} $、$ q_{am} $、$ q_{gm} $ 和 $ q_{hm} $ 等指标,以同时评估所有任务的性能。
- 使用单任务A3C智能体的目标得分作为性能基准,确保在所有任务中评估的公平性和一致性。
实验结果
研究问题
- RQ1是否可以仅通过与环境的在线交互,无需专家监督,有效训练多任务强化学习智能体?
- RQ2对更难任务进行主动采样是否能加快收敛速度,并在多样化、高维任务中实现更好的泛化?
- RQ3在多任务实例中,自适应采样、UCB和基于A3C的优化等不同元学习策略在性能和可扩展性方面如何比较?
- RQ4在小规模多任务实例(如6个任务)上调整的超参数在更大、更复杂的多任务实例(如21个任务)上是否具有良好的泛化能力?
- RQ5在具有重叠动作空间的多任务深度强化学习中,共享输出头是否比任务特定头带来更好的性能和泛化能力?
主要发现
- 所提出的主动采样框架在七个多任务实例中实现了最先进性能,包括一个21个任务的Atari设置,优于依赖专家蒸馏的先前方法。
- 自适应采样方法在MT1(6个任务)上达到$ p_{am} = 0.907 $,显著优于基线DBA3C智能体($ p_{am} = 0.244 $),并展现出更优的泛化能力。
- 基于A3C的元学习器(A5C)在所有MTI上均优于其独立头变体(DA5C),表明在具有共同动作空间的任务中,共享头对多任务学习更有效。
- 在6个任务的MTI上调整的超参数能良好泛化到最多21个任务的大规模MTI,表明该框架具有良好的可扩展性和鲁棒性。
- 特征分析表明,所学习的共享表征具有无任务依赖性,并通过消融研究和可视化分析得到验证,有助于泛化。
- 所提出的评估指标($ p_{am} $、$ q_{am} $、$ q_{gm} $、$ q_{hm} $)比传统指标能更细致、更合理地评估多任务性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。