Skip to main content
QUICK REVIEW

[論文レビュー] Generalization Tower Network: A Novel Deep Neural Network Architecture for Multi-Task Learning

Yuhang Song, Main Xu|arXiv (Cornell University)|Oct 27, 2017
Reinforcement Learning in Robotics参考文献 21被引用数 3
ひとこと要約

本稿では、マルチタスク強化学習(MT-RL)のための新しい深層ニューラルネットワークアーキテクチャであるGeneralization Tower Network(GTN)を提案する。GTNは、共有特徴抽出のための水平ストリームと、タスク間の階層的共有知識をモデル化するための垂直ストリームを統合している。GTNは51種類のAtariゲームにおいて最先端の性能を達成し、MT-A3Cと比較して最終スコアを最大23%向上させた。特にシューティングやアドベンチャーなどの高複雑度タスクカテゴリで顕著な向上を示した。

ABSTRACT

Deep learning (DL) advances state-of-the-art reinforcement learning (RL), by incorporating deep neural networks in learning representations from the input to RL. However, the conventional deep neural network architecture is limited in learning representations for multi-task RL (MT-RL), as multiple tasks can refer to different kinds of representations. In this paper, we thus propose a novel deep neural network architecture, namely generalization tower network (GTN), which can achieve MT-RL within a single learned model. Specifically, the architecture of GTN is composed of both horizontal and vertical streams. In our GTN architecture, horizontal streams are used to learn representation shared in similar tasks. In contrast, the vertical streams are introduced to be more suitable for handling diverse tasks, which encodes hierarchical shared knowledge of these tasks. The effectiveness of the introduced vertical stream is validated by experimental results. Experimental results further verify that our GTN architecture is able to advance the state-of-the-art MT-RL, via being tested on 51 Atari games.

研究の動機と目的

  • マルチタスク強化学習(MT-RL)において、タスクが異なる種類の共有表現を必要とすることに起因する、従来の深層ニューラルネットワークの表現学習の限界を解消すること。
  • プログレッシブネットワークなどの既存のMT-RL手法が、複数の事前学習済みモデルを保存・手動で選択する必要があるという問題を克服すること。
  • タスク間の階層的共有知識をエンコードすることで、1つの統合モデルが複数のタスクを習得可能になるようにすること。
  • 異なる抽象度のタスク固有知識と共有知識を捉える垂直ストリームアーキテクチャを導入することで、MT-RLにおけるマルチタスク一般化性能を向上させること。

提案手法

  • 二重ストリームアーキテクチャを設計:水平ストリームは畳み込み層とLSTM層を用いて高次元入力を処理し、多段階の表現を抽出する。
  • 水平ストリーム間で階層的に共有される層を持つ垂直ストリームを導入し、タスク間の階層的共有知識を学習可能にする。
  • 垂直ストリームを構造化し、低レベルでは共通知識(例:シューティングゲームにおける「連続的に撃つ」)をエンコードし、深層ではより特化した知識(例:「有効な標的を狙って撃つ」)をエンコードする。
  • アスキーントス・アドバンテージアクターキャリブレーター(A3C)フレームワークを用いてGTNモデルをエンドツーエンドで訓練し、垂直ストリームの層間に共有重みを導入することで知識移行を促進する。
  • 訓練中に各ゲームごとのステップ報酬を正規化し、スコアスケールが異なるタスク間での公平な比較を保証する。
  • 一般化能力の測定に、マルチタスクエージェントスコアとシングルタスクエージェントスコアの比として定義される相対的最終スコア(RFS)を用いて性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1階層的共有知識をモデリングすることで、1つの深層ニューラルネットワークアーキテクチャが多様な強化学習タスクに効果的に一般化できるか?
  • RQ2階層的知識エンコードのための垂直ストリームを導入することで、標準的な水平ストリームのみのアーキテクチャと比較して、マルチタスク一般化性能がどのように向上するか?
  • RQ3GTNアーキテクチャは、MT-A3Cなどの既存のMT-RLベースラインと比較して、多数のタスクにわたる性能とスケーラビリティにおいてどの程度優れているか?
  • RQ4シューティングやアドベンチャーなどの類似タスクが多数存在する状況(Atariプラットフォーム上)において、GTNアーキテクチャに特に顕著な利点が見られるか?

主な発見

  • GTNアーキテクチャは、4つの垂直ストリームレベル(M=4)と4つの水平層(N=4)を用いた場合、全シューティングゲームで平均65%の相対的最終スコア(RFS)を達成し、ベースライン手法を著しく上回った。
  • 垂直ストリームはマルチタスク一般化に顕著な貢献を示し、N=4の条件下でM=1(52% RFS)からM=4(65% RFS)にRFSが向上した一方、水平層はマルチタスク性能にほとんど影響を与えなかった。
  • シューティングゲームカテゴリにおいて、GTNはMT-A3Cを最大23%上回る性能を発揮し、全6つのAtariゲームカテゴリで一貫した向上を示した。
  • 水平ストリームは単一タスク学習において最も効果的であり、N=4、M=2の条件下で104%のRFSを達成しており、タスクごとの特徴抽出能力の高さを示している。
  • GTNとMT-A3Cの性能差は、シューティングやアドベンチャーなど高複雑度・高タスク数のカテゴリで最も顕著であり、GTNのスケーラビリティと一般化能力の優位性を示している。
  • タスクラベルや手動でのモデル選択を必要とせず、多様なタスクにわたる一般化が可能であり、1つの統合アーキテクチャ内でエンドツーエンドのマルチタスク学習が実現できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。