Skip to main content
QUICK REVIEW

[論文レビュー] Semantic Exploration from Language Abstractions and Pretrained Representations

Allison C. Tam, Neil C. Rabinowitz|arXiv (Cornell University)|Apr 8, 2022
Multimodal Machine Learning Applications被引用数 16
ひとこと要約

本論文では、自然言語から導出された意味的状態抽象化を通じてノベルティを定義することにより、事前学習済みの視覚言語表現を活用して強化学習における探索を改善する手法を提案する。CLIPのようなモデルからの言語に適合した埋め込みを活用することで、3次元環境におけるサンプル効率とカバレッジが向上し、学習速度が18–70%向上し、ナビゲーションタスクでは訪問領域が2倍に増加した。

ABSTRACT

Effective exploration is a challenge in reinforcement learning (RL). Novelty-based exploration methods can suffer in high-dimensional state spaces, such as continuous partially-observable 3D environments. We address this challenge by defining novelty using semantically meaningful state abstractions, which can be found in learned representations shaped by natural language. In particular, we evaluate vision-language representations, pretrained on natural image captioning datasets. We show that these pretrained representations drive meaningful, task-relevant exploration and improve performance on 3D simulated environments. We also characterize why and how language provides useful abstractions for exploration by considering the impacts of using representations from a pretrained model, a language oracle, and several ablations. We demonstrate the benefits of our approach in two very different task domains -- one that stresses the identification and manipulation of everyday objects, and one that requires navigational exploration in an expansive world. Our results suggest that using language-shaped representations could improve exploration for various algorithms and agents in challenging environments.

研究の動機と目的

  • 従来のノベルティベース手法が視覚的ノイズや意味的抽象化の欠如により失敗する高次元的かつ部分観測可能な3次元環境において、効果的な探索を実現する課題に対処すること。
  • 自然言語によって形作られた事前学習済みの視覚言語表現が、強化学習における内因的報酬設計のための有効な抽象化として機能するかを調査すること。
  • 言語ベースの表現が、異なる3次元環境およびポリシーに依存する/依存しない強化学習アルゴリズムにおいて、探索性能を向上させるかを評価すること。
  • 言語抽象化の寄与を、言語オラクルベースラインや、ImageNet埋め込みのような代替表現との比較によって理解すること。
  • 訓練中に言語オラクルが利用可能でない状況でも、言語に適合した表現が有効な探索を可能にすることを示すことにより、非アノテート環境へのスケーラビリティを実証すること。

提案手法

  • 事前学習済みの視覚言語モデル(例:CLIP)を用いて、視覚的観測を人間が理解可能な概念と整合する意味的表現に埋め込む。
  • 内因的報酬は、これらの事前学習済みテキストまたは画像埋め込みのノベルティに基づいて計算され、言語オラクルまたはモデル自身の画像エンコーダーの両方を用いる。
  • 従来の探索アルゴリズム(ランダム・ネットワーク分散化(RND)およびNever Give Up(NGU))と統合するため、状態表現モジュールを言語に適合した特徴に置き換える。
  • 2つの3次元環境(Playroom(物体操作)およびCity(大規模ナビゲーション))で評価を行い、Unityでシミュレートされた環境で実験を行う。
  • 制御実験として、言語に適合した表現とImageNet埋め込み、および代替表現を用いたアブレーションバージョンを比較し、言語の影響を隔離する。
  • ポリシーに依存する(IMPALA)および依存しない(R2D2)強化学習アルゴリズムを用いてフレームワークをテストし、訓練パラダイムにわたる一般化を評価する。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みの視覚言語表現は、強化学習における意味的ノベルティを定義する有効な抽象化として機能するか?
  • RQ2視覚のみまたはランダム特徴に基づく手法と比較して、言語ベースの表現は3次元環境におけるサンプル効率とカバレッジをどのように向上させるか?
  • RQ3複雑なマルチオブジェクトシーンにおいて、ImageNet埋め込みのような非言語的表現よりも言語抽象化がどれほど優れているか?
  • RQ4訓練中に言語オラクルが利用可能でない場合でも、言語に適合した表現の利点は維持されるか?
  • RQ5言語の監視、表現の質、タスクの特異性といった異なる要素が、探索手法の有効性にどのように影響するか?

主な発見

  • Playroom環境における物体操作タスクでは、言語に適合した表現が、ベースラインのRNDおよびNGU手法と比較して、サンプル効率を18–70%向上させた。
  • City環境では、言語ベースの探索を用いたエージェントが、ベースライン手法と比較して訪問領域を2倍に増やし、大規模ナビゲーションにおける優れたカバレッジを示した。
  • アルゴリズムに跨る一般化が確認され、ポリシーに依存する(IMPALA)および依存しない(R2D2)両方の訓練設定で性能向上を示した。
  • 複雑なタスク(例:「見つける」)では、言語に適合した表現を用いたエージェントが、ImageNet埋め込みを用いたエージェントを上回った。これは、マルチオブジェクトシーンの理解が重要な状況で顕著に現れた。
  • 言語オラクルが存在しない状況でも、事前学習済み画像エンコーダーのみを用いたLSE-NGUバージョンが、言語オラクル版と同等の性能を達成した。これは、堅牢性とスケーラビリティを示している。
  • アブレーションスタディにより、表現の能力そのものよりも、言語表現の意味的整合性が改善された探索を促進していることが確認された。これは、多様なタスクおよび環境にわたる一貫した向上を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。