Skip to main content
QUICK REVIEW

[論文レビュー] I'm sorry Dave, I'm afraid I can't do that, Deep Q-learning from forbidden action

Mathieu Seurin, Pierre‐Marie Preux|arXiv (Cornell University)|Oct 4, 2019
Reinforcement Learning in Robotics参考文献 48被引用数 7
ひとこと要約

本論文では、現実世界の環境における安全制約によって拒否される「禁止行動」から学習するための修正されたDeep Q-Network(DQN)を提案する。禁止行動のQ値を有効な行動のQ値より低くするように促す「フロントier損失」を導入することで、収束を加速させるとともに、安全でない行動の呼び出しを標準DQNよりも削減する。この手法により、制約のある環境におけるより安全で効率的な強化学習が可能になる。

ABSTRACT

The use of Reinforcement Learning (RL) is still restricted to simulation or to enhance human-operated systems through recommendations. Real-world environments (e.g. industrial robots or power grids) are generally designed with safety constraints in mind implemented in the shape of valid actions masks or contingency controllers. For example, the range of motion and the angles of the motors of a robot can be limited to physical boundaries. Violating constraints thus results in rejected actions or entering in a safe mode driven by an external controller, making RL agents incapable of learning from their mistakes. In this paper, we propose a simple modification of a state-of-the-art deep RL algorithm (DQN), enabling learning from forbidden actions. To do so, the standard Q-learning update is enhanced with an extra safety loss inspired by structured classification. We empirically show that it reduces the number of hit constraints during the learning phase and accelerates convergence to near-optimal policies compared to using standard DQN. Experiments are done on a Visual Grid World Environment and Text-World domain.

研究の動機と目的

  • 安全制約によって危険な行動が拒否される環境における強化学習の課題に対処すること。
  • 標準DQNが拒否された行動を無効な操作(no-op)として扱うため、それらから学習できないという限界を克服すること。
  • 外部コントローラーやアクションマスクからのフィードバックを活用して、探索と方策学習を改善する手法を設計すること。
  • 実世界の応用において、安全でない行動の使用を最小限に抑えながら、近似的最適方策への収束を加速すること。

提案手法

  • 構造的分類にインspiredされたフロントier損失を標準DQNに追加し、禁止行動のQ値と有効行動のQ値を分離する。
  • マージンに基づく損失関数を用いて、分類ヘッドを訓練し、Q値に安全なギャップを強制する。
  • フロントier損失をDQNの更新ルールに統合し、安全制約を反映した正則化を時間差ターゲットに組み込む。
  • Q値予測用と行動有効性分類用の二重ヘッドネットワークを採用し、両者を同時に訓練する。
  • 物理的または文法的境界外の行動が拒否される環境(例:ビジュアルグリッドワールド、TextWorld)にこの手法を適用する。
  • モデルが禁止行動が単に効果がないのではなく、本質的に劣悪であることを学習するように保証し、安全な方策への探索を導く。

実験結果

リサーチクエスチョン

  • RQ1標準DQNは、外部の安全コントローラーによってフィルタリングされた拒否行動から効果的に学習できるか?
  • RQ2フロントier損失を追加することで、禁止行動を含む環境における学習効率と安全性がどのように向上するか?
  • RQ3提案手法は、標準DQNと比較して、トレーニング中に禁止行動が呼び出される回数を減らすか?
  • RQ4エージェントが初期段階で危険な行動を探索しても、フロントier損失は安全な方策への探索を導けるか?
  • RQ5本手法は、大きなまたは可変的な行動空間を有する環境へどの程度一般化可能か?

主な発見

  • 提案手法のDQNにフロントier損失を適用することで、トレーニング中における禁止行動の呼び出し回数が標準DQNと比較して顕著に減少した。
  • ビジュアルグリッドワールドおよびTextWorld環境における性能向上の速さから、近似的最適方策への収束が加速していることが示された。
  • 100,000ステップのトレーニング後でも、標準DQNは禁止行動と有効行動のQ値を明確に分離できていないが、フロントier損失は一貫したギャップを維持していた。
  • 可視化により、フロントier損失がトレーニングの初期段階でQ値分布を再構成し、危険な行動を避けるようにエージェントを誘導していることがわかった。
  • 禁止行動が単に無効であるのではなく、実際に有害であることを学習させることで、探索が改善され、より良い方策の一般化が達成された。
  • フロントier損失は、行動拒否が一般的な大規模または可変的な行動空間を有する環境でも、有効な学習を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。