[论文解读] Generalization Tower Network: A Novel Deep Neural Network Architecture for Multi-Task Learning
本文提出了一种新型深度神经网络架构——泛化塔网络(Generalization Tower Network, GTN),用于多任务强化学习(MT-RL),该架构通过水平流实现共享特征提取,通过垂直流建模任务间的层次化共享知识。GTN在51款Atari游戏中实现了最先进性能,相较于MT-A3C,最终得分相对提升最高达23%,尤其在射击类和冒险类等高复杂度任务类别中表现突出。
Deep learning (DL) advances state-of-the-art reinforcement learning (RL), by incorporating deep neural networks in learning representations from the input to RL. However, the conventional deep neural network architecture is limited in learning representations for multi-task RL (MT-RL), as multiple tasks can refer to different kinds of representations. In this paper, we thus propose a novel deep neural network architecture, namely generalization tower network (GTN), which can achieve MT-RL within a single learned model. Specifically, the architecture of GTN is composed of both horizontal and vertical streams. In our GTN architecture, horizontal streams are used to learn representation shared in similar tasks. In contrast, the vertical streams are introduced to be more suitable for handling diverse tasks, which encodes hierarchical shared knowledge of these tasks. The effectiveness of the introduced vertical stream is validated by experimental results. Experimental results further verify that our GTN architecture is able to advance the state-of-the-art MT-RL, via being tested on 51 Atari games.
研究动机与目标
- 解决传统深度神经网络在多任务强化学习(MT-RL)中学习表示能力的局限性,其中不同任务可能需要不同类型共享表示。
- 克服现有MT-RL方法(如渐进式网络)中需存储并手动选择多个预训练模型的缺陷。
- 通过在任务间编码层次化共享知识,使单一统一模型能够掌握多个任务。
- 通过引入垂直流架构,捕捉不同抽象层次上的任务特定知识与共享知识,从而提升MT-RL中的多任务泛化性能。
提出的方法
- 设计双流架构:水平流利用卷积层和LSTM层处理高维输入,以提取多层次表示。
- 引入垂直流,使其在水平流之间分层共享层,使模型能够学习任务间的层次化共享知识。
- 构建垂直流,使较低层编码通用知识(如射击类游戏中“持续射击”),而深层则编码更具体的知识(如“瞄准有效目标并射击”)。
- 使用异步优势演员评论者(A3C)框架端到端训练GTN模型,通过在垂直流层之间共享权重以强化知识迁移。
- 在训练过程中对每款游戏的步长奖励进行归一化,以确保在不同得分尺度的任务间实现公平比较。
- 使用相对最终得分(RFS)评估性能,定义为多任务智能体得分与单任务智能体得分的比值,用于衡量跨任务的泛化能力。
实验结果
研究问题
- RQ1通过建模层次化共享知识,单一深度神经网络架构是否能有效泛化于多个多样化强化学习任务?
- RQ2与仅使用水平流的标准架构相比,引入用于层次化知识编码的垂直流在多任务泛化方面有何改进?
- RQ3在大规模任务集合中,GTN架构在性能和可扩展性方面相较于现有MT-RL基线方法(如MT-A3C)的超越程度如何?
- RQ4在具有大量相似任务的场景中(如Atari平台上的射击类或冒险类游戏),GTN架构是否展现出显著优势?
主要发现
- 当使用4个垂直流层级(M=4)和4个水平层(N=4)时,GTN架构在所有射击类游戏中实现了65%的平均相对最终得分(RFS),显著优于基线方法。
- 垂直流对多任务泛化有显著贡献,当N=4时,RFS从M=1时的52%提升至M=4时的65%,而水平层对多任务性能的影响微乎其微。
- 在射击类游戏类别中,GTN相较于MT-A3C的性能最高提升达23%,且在全部6个Atari游戏类别中均保持一致增益。
- 水平流在单任务学习中最为有效,在N=4且M=2时达到104%的RFS,表明其在每项任务中特征提取能力强大。
- GTN与MT-A3C之间的性能差距在高复杂度、高任务数量的类别(如射击类和冒险类游戏)中最为显著,体现出GTN在可扩展性和泛化能力方面的优势。
- 该模型在无需任务标签或手动选择模型的情况下,能良好泛化于多样化任务,实现了单一统一架构下的端到端多任务学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。