[论文解读] Attend, Adapt and Transfer: Attentive Deep Architecture for Adaptive Transfer from multiple sources in the same domain
本文提出A2T(Attend, Adapt and Transfer),一种深度神经网络架构,通过使用注意力机制动态加权来自多个同领域源任务的网络贡献,实现选择性、自适应的迁移,同时避免负迁移。该方法通过学习在不同状态空间区域关注最相关的源策略或价值函数,提升了各类强化学习任务的学习效率与性能,优于从零开始训练和基线迁移方法。
Transferring knowledge from prior source tasks in solving a new target task can be useful in several learning applications. The application of transfer poses two serious challenges which have not been adequately addressed. First, the agent should be able to avoid negative transfer, which happens when the transfer hampers or slows down the learning instead of helping it. Second, the agent should be able to selectively transfer, which is the ability to select and transfer from different and multiple source tasks for different parts of the state space of the target task. We propose A2T (Attend, Adapt and Transfer), an attentive deep architecture which adapts and transfers from these source tasks. Our model is generic enough to effect transfer of either policies or value functions. Empirical evaluations on different learning algorithms show that A2T is an effective architecture for transfer by being able to avoid negative transfer while transferring selectively from multiple source tasks in the same domain.
研究动机与目标
- 解决迁移学习中的负迁移问题,即源任务的先验知识阻碍目标任务的学习。
- 通过允许智能体在目标任务的不同状态空间区域使用不同的源任务,实现选择性迁移。
- 设计一种支持策略与价值函数迁移的通用深度架构。
- 使基础网络能够学习任何源任务中均不存在的新技能,确保在源知识无关或次优时的鲁棒性。
- 通过注意力机制开发一种可微分的、软性元控制器,实现在源任务贡献上的连续、自适应决策。
提出的方法
- A2T框架将从零开始在目标任务上训练的基础网络与在相关任务上预训练的多个源任务网络相结合。
- 注意力网络计算每个源网络和基础网络的动态、与状态相关的权重,以确定在每个状态下使用哪些知识。
- 最终输出是源网络预测结果与基础网络输出的加权组合,其中权重通过反向传播端到端学习。
- 注意力机制实现了对源网络的软门控,使智能体能够选择性地关注不同状态区域中最相关的专家。
- 该架构使用标准强化学习目标进行训练,注意力网络与目标任务的回报最小化联合优化。
- 该框架支持策略迁移与价值函数迁移,适用于具有共享状态空间和动作空间的任务。
实验结果
研究问题
- RQ1能否通过深度架构在目标任务中动态且自适应地从多个源任务中选择知识,以提升学习性能并避免负迁移?
- RQ2与固定平均或单专家迁移相比,注意力机制如何提升迁移性能?
- RQ3基础网络能否学习任何源任务中均不存在的新技能,尤其是在源知识无关或次优时?
- RQ4A2T在连续控制和游戏环境中相较于从零开始训练和基线迁移方法的性能提升程度如何?
- RQ5注意力机制能否作为层次化和持续强化学习中的可微分、软性元控制器?
主要发现
- 在Pong环境中,A2T优于从零开始训练和单专家迁移,实现了更快的收敛速度和更高的平均奖励。
- 在存在部分专家(平均得分为8/21)和负向专家的情况下,A2T仍优于从零开始训练和单负向专家迁移。
- 该框架成功发现并学习了任何源网络中均不存在的新技能,例如网球中的“放高吊球”(drop shots),当源知识具有害时,系统依赖基础网络进行学习。
- 注意力机制有效学习到在不同状态区域关注最相关源网络的能力,实现了无需人工干预的选择性迁移。
- 实证结果表明,即使源任务不完美或部分无关,A2T仍能保持性能,展现出对负迁移的鲁棒性。
- 注意力网络实现了一种可微分的、软性元控制器,可应用于层次化和持续学习场景,扩展了迁移学习的适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。