Skip to main content
QUICK REVIEW

[論文レビュー] Interference and Generalization in Temporal Difference Learning

Emmanuel Bengio, Joëlle Pineau|arXiv (Cornell University)|Mar 13, 2020
Domain Adaptation and Few-Shot Learning参考文献 49被引用数 10
ひとこと要約

本稿は、時系列差分(TD)学習における一般化と干渉(勾配の内積として定義される)の関係を調査する。TD学習は自然に低干渉で、一般化が低いパラメータを生成するが、これは教師あり学習とは対照的であり、教師あり学習では低干渉が良好な一般化と相関する。この差異は、ブートストラップのダイナミクスと非定常的ターゲットに起因する。

ABSTRACT

We study the link between generalization and interference in temporal-difference (TD) learning. Interference is defined as the inner product of two different gradients, representing their alignment. This quantity emerges as being of interest from a variety of observations about neural networks, parameter sharing and the dynamics of learning. We find that TD easily leads to low-interference, under-generalizing parameters, while the effect seems reversed in supervised learning. We hypothesize that the cause can be traced back to the interplay between the dynamics of interference and bootstrapping. This is supported empirically by several observations: the negative relationship between the generalization gap and interference in TD, the negative effect of bootstrapping on interference and the local coherence of targets, and the contrast between the propagation rate of information in TD(0) versus TD($λ$) and regression tasks such as Monte-Carlo policy evaluation. We hope that these new findings can guide the future discovery of better bootstrapping methods.

研究の動機と目的

  • 時系列差分(TD)学習における一般化に及ぼす勾配干渉の役割を調査すること。
  • TD学習と教師あり学習における干渉と一般化の挙動を比較すること。
  • 深層ニューラルネットワークを用いてもTD手法が一般化が悪い理由を理解すること。
  • ブートストラップとターゲット安定性がTDアルゴリズムにおける干渉ダイナミクスに与える影響を解明すること。
  • 干渉の進化を分析することで、将来のより良いブートストラップ手法の開発を支援すること。

提案手法

  • 干渉を二つの異なる目的関数の勾配の内積として定義し、$ \rho_{1,2} = \nabla_\theta J_1^T \nabla_\theta J_2 $ とすることで、勾配の整合性を定量化する。
  • MsPacmanのリプレイバッファを用いて、DQN、DDQN、QLなどの異なるTD手法と回帰タスクにおいて、干渉を実験的に測定する。
  • モーメンタムSGDを用いて干渉の進化を分析し、勾配の移動平均を含む更新された干渉項を導出する。
  • TD(0)、TD(λ)、モンテカルロ法による方策評価の干渉ダイナミクスを比較し、情報伝搬とターゲットの一貫性を評価する。
  • 回帰および方策評価タスクを用いて干渉項 $ r_1, r_2, r_3 $ を計算し、その符号および大きさの分布を分析する。
  • DQNにおける固定ターゲットネットワーク、DDQNにおける指数移動平均、QLにおける自己ターゲティングを用いて、ターゲット安定性が干渉に与える影響を調査する。

実験結果

リサーチクエスチョン

  • RQ1TD学習における干渉は、教師あり学習と比較してどのように訓練中に進化するか?
  • RQ2TD学習では低干渉が一般化が悪いと相関するが、これは教師あり学習とは逆の挙動である。その理由は何か?
  • RQ3ブートストラップは、TD手法における干渉ダイナミクスとターゲット一貫性にどのような役割を果たすか?
  • RQ4Adam や RMSProp などの最適化手法の選択が、TD学習における干渉と一般化に与える影響は何か?
  • RQ5TD(λ) は TD(0) や Q学習と比較して、一般化と干渉の安定性をどの程度改善するか?

主な発見

  • TD学習は一貫して低干渉パラメータを生成し、干渉値が低く、特にQ学習やDQNでは負の値をとることが多い。
  • TD学習における一般化ギャップは干渉と負の相関関係にあり、干渉が低いほど一般化が悪くなる。
  • TD手法におけるブートストラップは干渉を低減させ、ターゲットの一貫性を不安定化させ、結果として一般化が悪く、訓練データの記憶に陥りやすい。
  • TD(λ) は TD(0) や Q学習と比較して干渉の安定性と一般化性能に優れており、ターゲット伝搬と一貫性の向上が示唆される。
  • モーメンタムSGDは勾配の移動平均に従うことで干渉の分散を抑制し、TD学習における干渉進化の安定化に寄与する可能性がある。
  • Adam と RMSProp は干渉ダイナミクスにおいて予期しない差を示しており、最適化手法の選択がTD学習における一般化に顕著な影響を与えることが示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。