Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating Vision Transformer Methods for Deep Reinforcement Learning from Pixels

Tianxin Tao, Daniele Reda|arXiv (Cornell University)|Apr 11, 2022
Advanced Memory and Neural Computing被引用数 4
ひとこと要約

この論文は、自己教師あり事前学習手法(マスキングベース、対照的、予測ベースの目的関数)を用いたビジョントランスフォーマー(ViT)が、ピクセルから強化学習を実行する際の性能を評価している。ViTはコンピュータビジョン分野で成功を収めたが、本研究では補助タスクがViTの性能向上に寄与することを確認したものの、最先端のCNNベースのRAD手法がすべてのViTバージョンを上回っている。特に、マスキングベースの事前学習(例:MAE)は対照的学習を著しく上回っている。

ABSTRACT

Vision Transformers (ViT) have recently demonstrated the significant potential of transformer architectures for computer vision. To what extent can image-based deep reinforcement learning also benefit from ViT architectures, as compared to standard convolutional neural network (CNN) architectures? To answer this question, we evaluate ViT training methods for image-based reinforcement learning (RL) control tasks and compare these results to a leading convolutional-network architecture method, RAD. For training the ViT encoder, we consider several recently-proposed self-supervised losses that are treated as auxiliary tasks, as well as a baseline with no additional loss terms. We find that the CNN architectures trained using RAD still generally provide superior performance. For the ViT methods, all three types of auxiliary tasks that we consider provide a benefit over plain ViT training. Furthermore, ViT reconstruction-based tasks are found to significantly outperform ViT contrastive-learning.

研究の動機と目的

  • ビジョントランスフォーマー(ViT)が、生のピクセルから強化学習のための視覚的表現を効果的に学習できるかを調査すること。
  • マスキング、対照的学習、将来予測の3つの自己教師あり事前学習目的関数が、ViTベースの強化学習方策に与える影響を評価すること。
  • 標準的な制御環境において、ViTベースの手法と強力なCNNベースのベースライン(RAD)との性能を比較すること。
  • データオーグメンテーションと補助タスクが、ViTベースの強化学習におけるサンプル効率と最終的性能を向上させるかを検証すること。
  • 高次元の視覚入力を持つ下流の強化学習制御タスクへの自己教師ありViT事前学習の転送性を評価すること。

提案手法

  • マスクドオートエンコーダ(MAE)、Data2Vec、モーメンタム対照的学習(MoCo)の3つの自己教師ありViT事前学習手法を適応する。
  • ViTエンコーダをソフトアクタクリティカル(SAC)エージェントと統合し、共有表現学習を通じて方策と補助目的を同時に学習する。
  • 主にランダムクロッピングをデータオーグメンテーション戦略として採用し、100×100の観測値を84×84にリサイズして学習に使用する。
  • 4層、8つのアテンションヘッド、12×12のパッチサイズ、128次元の潜在空間を持つ軽量なViTアーキテクチャを採用する。
  • 対照的学習用に二重ブランチのデコーダヘッドを採用し、MAE用に学習可能なマスクベクトルを導入。対照的目的関数は別々に最適化する。
  • SAC+AEと同様に、エージェントからエンコーダへの勾配ブロッキングを実装し、表現学習の安定性を確保しながら、クリティックの更新を共有エンコーダに許可する。

実験結果

リサーチクエスチョン

  • RQ1自己教師あり事前学習を用いたビジョントランスフォーマー(ViT)は、画像ベースの深層強化学習におけるサンプル効率と最終的性能を効果的に向上させられるか?
  • RQ2マスキング、対照的学習、将来予測の3つの自己教師あり事前学習目的関数は、ViT方策学習をどの程度効果的に導けるかを比較するとどうなるか?
  • RQ3標準的な制御ベンチマークにおいて、ViTベースの強化学習エージェントの性能は、RADのような最先端のCNNベース手法を上回るか、それとも下回るか?
  • RQ4特にランダムクロッピングを含むデータオーグメンテーションが、強化学習環境におけるViTの学習安定性と性能に与える影響は何か?
  • RQ5補助タスクは、ViTアーキテクチャを用いた視覚ベースの強化学習における表現学習のボトルネックを緩和できるか?

主な発見

  • CNNベースのRAD手法は、評価されたすべての環境で、すべてのViTベースのアプローチを一貫して上回っており、この設定ではViTが確立されたCNNを凌駕していないことを示している。
  • MAE、Data2Vec、MoCoの3つの補助的事前学習手法は、補助目的なしの単純な事前学習よりも、すべてViTの性能を向上させている。
  • マスキングベースの事前学習(MAE)は、対照的学習(MoCo)を著しく上回っており、再構成タスクが方策学習においてより効果的である可能性を示唆している。
  • Data2Vecベースの事前学習は中程度の改善を示したが、MAEおよびRADベースラインを下回っている。
  • マスキング率(40%および75%)の選択が性能に影響を与え、MAEでは75%マスキングの方が優れた結果を示しており、より高いインペイントの複雑さが表現品質を向上させることを示唆している。
  • 補助目的との共同学習と、エージェントからエンコーダへの勾配ブロッキングにより、学習が安定化し、最終的な報酬が向上した。これは、アーキテクチャ的および訓練設計の選択の価値を裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。