Skip to main content
QUICK REVIEW

[論文レビュー] Hypermodels for Exploration

Vikranth Dwaracherla, Xiuyuan Lu|arXiv (Cornell University)|Jun 12, 2020
Machine Learning and Algorithms参考文献 15被引用数 10
ひとこと要約

この論文は、強化学習におけるエピステミック的不確実性を表現するための深層ニューラルネットワークアンサンブルの計算的に効率的な代替手段として、ハイパーモデル—基本モデルのパラメータ化された族—を導入する。線形ハイパーモデルまたはハイパーネットワークを用いて関数の事後分布を近似することで、スケーラブルなトンプソンサンプリングと、情報指向的サンプリングのような高度な探索戦略を可能にし、はるかに少ないパラメータで大規模アンサンブルと同等の性能を達成する。

ABSTRACT

We study the use of hypermodels to represent epistemic uncertainty and guide exploration. This generalizes and extends the use of ensembles to approximate Thompson sampling. The computational cost of training an ensemble grows with its size, and as such, prior work has typically been limited to ensembles with tens of elements. We show that alternative hypermodels can enjoy dramatic efficiency gains, enabling behavior that would otherwise require hundreds or thousands of elements, and even succeed in situations where ensemble methods fail to learn regardless of size. This allows more accurate approximation of Thompson sampling as well as use of more sophisticated exploration schemes. In particular, we consider an approximate form of information-directed sampling and demonstrate performance gains relative to Thompson sampling. As alternatives to ensembles, we consider linear and neural network hypermodels, also known as hypernetworks. We prove that, with neural network base models, a linear hypermodel can represent essentially any distribution over functions, and as such, hypernetworks are no more expressive.

研究の動機と目的

  • 逐次意思決定における不確実性表現のための大型ディープラーニングアンサンブルの計算不能性に対処する。
  • 高コストなトレーニングのため、通常は数十モデルに制限される標準アンサンブルの限界を克服する。
  • ハイパーモデル—特に線形ハイパーモデルとハイパーネットワーク—が、アンサンブルに比べてより高い計算効率と表現力を持つかどうかを検討する。
  • ハイパーモデルが、アンサンブルでは計算的に不可能な情報指向的サンプリングのようなより洗練された探索戦略をサポートできるかどうかを調査する。
  • ハイパーネットワークが、複雑な関数分布を表現する上で線形ハイパーモデルを上回る利点を提供するかどうかを検証する。

提案手法

  • 潜在インデックス(参照分布から抽出)を基本モデルにマッピングするハイパーモデルを用い、アンサンブル手法を一般化する。
  • 基本モデルの事後分布を近似するために、摂動を加えたデータ上で確率的勾配降下法を用いてハイパーモデルを訓練する。
  • 潜在変数がガウス分布に従うように、線形変換を用いてその潜在変数を基本モデルのパラメータにマッピングする線形ハイパーモデルを採用する。
  • 潜在インデックスから基本モデルのパラメータへのマッピングをニューラルネットワークで実装するハイパーネットワークを用いる。
  • ハイパーモデルの出力分布から基本モデルをサンプリングし、そのサンプルに基づいて行動を選択することで、トンプソンサンプリングを近似する。
  • ハイパーモデルの不確実性推定値を用いて、分散に基づく情報指向的サンプリング(IDS)の変種を実装し、探索を誘導する。

実験結果

リサーチクエスチョン

  • RQ1線形ハイパーモデルなどの代替ハイパーモデルアーキテクチャが、近似的トンプソンサンプリングにおいて、従来のアンサンブルに比べて計算効率と性能で優れているか。
  • RQ2ハイパーモデルが、アンサンブルでは計算的に不可能な情報指向的サンプリングのようなより知的な探索戦略を可能にするか。
  • RQ3複雑な関数分布を表現するにはハイパーネットワークが必要か、それとも単純な線形ハイパーモデルで十分か。
  • RQ4基本モデルがニューラルネットワークの場合、線形ハイパーモデルの表現能力はどの程度か。
  • RQ5表現力に理論的同等性があるにもかかわらず、実際の応用においてハイパーネットワークが線形ハイパーモデルに比べて統計的または計算上の利点を提供するか。

主な発見

  • 線形ハイパーモデルはアンサンブルに比べて顕著な計算効率の向上を達成し、通常は数百〜数千のモデルを必要とする性能を、はるかに少ないパラメータで実現可能である。
  • 1つのスパース線形バンディット問題において、線形ハイパーモデルに情報指向的サンプリングを適用した場合、トンプソンサンプリングを著しく上回り、レグレット曲線が明確かつ持続的な優位性を示した。
  • 基本モデルがニューラルネットワークの場合、線形ハイパーモデルは有限ドメイン上の任意の確率分布を表現可能であることが、定理1で証明された。
  • 理論的結果から、ニューラルネットワークベースの基本モデルに対して、ハイパーネットワークは線形ハイパーモデルに比べて追加の表現能力を提供しないことが示唆された。
  • 理論的同等性があるにもかかわらず、ハイパーネットワークは一般化性能やトレーニング効率の面で実用的利点を提供する可能性があるが、これは未解決の問題のままである。
  • ハイパーモデルの使用により、複雑な環境において情報指向的サンプリングの有効な実装が可能となり、このような高度な探索戦略が効率的な不確実性表現と組み合わせて実現可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。