Skip to main content
QUICK REVIEW

[論文レビュー] History Compression via Language Models in Reinforcement Learning

Fabian Paischer, Thomas Adler|arXiv (Cornell University)|May 24, 2022
Reinforcement Learning in Robotics被引用数 4
ひとこと要約

本稿では、部分的に観察可能な強化学習における履歴表現のためのメモリモジュールとして、凍結された事前学習済み言語変換器(PLT)を用いる新規フレームワーク、HELM(History comprEssion via Language Models)を提案する。FrozenHopfield——観察をランダム射影によってPLTトークン埋め込みにマッピングするトレーニングフリーの関連記憶——を用いることで、PLTの微調整なしに、サンプル効率の高い方策学習が可能となり、MinigridおよびProcgen環境で最先端の性能を達成した。

ABSTRACT

In a partially observable Markov decision process (POMDP), an agent typically uses a representation of the past to approximate the underlying MDP. We propose to utilize a frozen Pretrained Language Transformer (PLT) for history representation and compression to improve sample efficiency. To avoid training of the Transformer, we introduce FrozenHopfield, which automatically associates observations with pretrained token embeddings. To form these associations, a modern Hopfield network stores these token embeddings, which are retrieved by queries that are obtained by a random but fixed projection of observations. Our new method, HELM, enables actor-critic network architectures that contain a pretrained language Transformer for history representation as a memory module. Since a representation of the past need not be learned, HELM is much more sample efficient than competitors. On Minigrid and Procgen environments HELM achieves new state-of-the-art results. Our code is available at https://github.com/ml-jku/helm.

研究の動機と目的

  • 事前学習済み言語モデルを用いた履歴表現によって、部分的に観察可能な強化学習におけるサンプル効率を向上させること。
  • 微調整や重み更新なしに、凍結された言語モデルをオンポリシー強化学習に統合する課題に対処すること。
  • 観察と行動を事前学習済み変換器の入力空間にマッピングするトレーニングフリーのメカニズムを設計すること。
  • アクタクリティックネットワークが、圧縮され抽象化された履歴表現を用いて、POMDPにおける意思決定を改善できること。
  • 最小限のトレーニングオーバヘッドで、MinigridおよびProcgen環境で最先端の性能を達成すること。

提案手法

  • 観察と行動をランダム射影を用いたクエリとして用いることで、事前学習済みトークン埋め込みにマッピングする、凍結された関連記憶であるFrozenHopfieldを導入する。
  • 現代的ホフデルネットワーク(MHN)を用いて、事前学習済みトークン埋め込みを格納および再構成し、トレーニングなしで再構成可能である。
  • 固定された観察の射影を用いて、MHNから関連するトークン埋め込みを取得するクエリを生成する。
  • 取得したPLTによる履歴表現と、CNNで埋め込まれた現在の観察を連結し、方策および価値ネットワークの入力とする。
  • トレーニング可能なコンponentとして、浅い多層パーセプトロンとCNNのみを用い、トレーニング中にPLTを凍結したままにしている。
  • PPOなどのアクタクリティックアルゴリズムにこのフレームワークを適用し、抽象的かつ圧縮された履歴表現を用いたエンドツーエンドの強化学習トレーニングを可能にする。

実験結果

リサーチクエスチョン

  • RQ1微調整なしに、凍結された事前学習済み言語モデルを部分的に観察可能な強化学習における履歴表現に効果的に使用できるか?
  • RQ2非言語的モダリティ(例:ピクセル観察)からの観察を、トレーニングフリーの方法で言語モデルの入力空間にマッピングする方法は何か?
  • RQ3凍結されたPLTを用いた履歴圧縮は、標準的なRNNベースの記憶機構と比較して、サンプル効率が向上するか?
  • RQ4現代的ホフデルネットワークは、凍結されたPLTから関連するトークン埋め込みを取得するための信頼性があり、パラメータフリーの関連記憶として機能できるか?
  • RQ5困難なPOMDPベンチマークにおいて、HELMは既存手法と比較して、サンプル効率および最終的性能の面でどの程度優れているか?

主な発見

  • HELMはMinigridおよびProcgen環境で最先端の性能を達成し、サンプル効率および最終的性能の両面で先行手法を上回った。
  • 凍結されたPLTを履歴表現に用いることで、履歴抽象化を再学習から始めずとも、顕著なサンプル効率の向上が達成された。
  • FrozenHopfieldは、トレーニングなしにランダム射影と現代的ホフデルネットワークのみを用いて、関連するトークン埋め込みの効果的かつ安定した再構成を可能にした。
  • MHNにおける再構成誤差は、パターン間の分離度に指数関数的に依存し、高精度な記憶再現が保証された。
  • MHNにおける温度パラメータβを増加させることで、パターン間の距離が拡大し、表現の崩壊が抑制され、複数の環境にわたる一般化性能が向上した。
  • 定性的な分析では、類似した視覚的状態がPLT空間で同じまたは類似したトークンにマッピングされることが示され、意味的に類似した経験の有効な抽象化とクラスタリングが行われていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。