Skip to main content
QUICK REVIEW

[論文レビュー] Safe Reinforcement Learning with Natural Language Constraints

Tsung-Yen Yang, Michael Y. Hu|arXiv (Cornell University)|Oct 11, 2020
Reinforcement Learning in Robotics参考文献 63被引用数 7
ひとこと要約

本論文では、自然言語による制約を解釈することで訓練中の安全性を向上させるモジュラー強化学習エージェント、POLCOを提案する。制約の解釈とポリシー学習を分離することで、新規のHazardWorldベンチマークにおいて、ベースラインと比較して最大11倍の報酬を達成し、制約違反も1.8倍減少した。これは、未知の制約を伴う新しいタスクへの効果的な一般化を示している。

ABSTRACT

While safe reinforcement learning (RL) holds great promise for many practical applications like robotics or autonomous cars, current approaches require specifying constraints in mathematical form. Such specifications demand domain expertise, limiting the adoption of safe RL. In this paper, we propose learning to interpret natural language constraints for safe RL. To this end, we first introduce HazardWorld, a new multi-task benchmark that requires an agent to optimize reward while not violating constraints specified in free-form text. We then develop an agent with a modular architecture that can interpret and adhere to such textual constraints while learning new tasks. Our model consists of (1) a constraint interpreter that encodes textual constraints into spatial and temporal representations of forbidden states, and (2) a policy network that uses these representations to produce a policy achieving minimal constraint violations during training. Across different domains in HazardWorld, we show that our method achieves higher rewards (up to11x) and fewer constraint violations (by 1.8x) compared to existing approaches. However, in terms of absolute performance, HazardWorld still poses significant challenges for agents to learn efficiently, motivating the need for future work.

研究の動機と目的

  • 数学的表現で安全制約を定式化する課題に対処すること。これはドメインの専門知識を要し、安全なRLの実世界への展開を制限する。
  • 形式論理や方程式ではなく、自由形式の自然言語で表現された安全制約をエージェントが学習・一般化できることを可能にすること。
  • 制約理解と報酬最大化を分離するモジュラーなアーキテクチャを構築し、異なるタスク間で再利用可能にすること。
  • グリッドワールドおよびロボット環境において、自然言語制約を伴う安全な探索を評価するためのベンチマーク、HazardWorldを構築すること。
  • 異なる報酬関数を伴う新しいタスクにおいて、制約の理解を一般化し、違反を最小限に抑えることができるかを実証すること。

提案手法

  • 安全な探索を伴う自由形式のテキスト制約を備えた、グリッドワールドおよびロボット環境を有するマルチタスクベンチマーク、HazardWorldを導入する。
  • 自然言語制約を空間的・時間的禁止状態の表現に変換する制約インタプリタを備えたモジュラーなエージェントアーキテクチャを設計する。
  • 状態観測と制約表現を組み合わせて、制約違反を最小化する行動を生成するポリシーネットワークを用いる。
  • 制約理解と一般化を向上させるために、マスク付き表現学習機構(M_B)と制約埋め込み(h_C)を採用する。
  • 安全な訓練中に人間がアノテートした制約から状態へのマッピングの教師信号を用いて、制約インタプリタをエンドツーエンドで訓練する。
  • 事前学習済みの制約インタプリタを再利用し、微調整されたポリシーネットワークと組み合わせることで、ゼロショット転移を可能にする。

実験結果

リサーチクエスチョン

  • RQ1エージェントは、数学的明示的定式化がなくても、訓練中に自由形式の自然言語制約を解釈し、それに従うことができるか?
  • RQ2異なる報酬関数を伴う新しいタスクにおいて、モジュラーなエージェントアーキテクチャは制約理解をどれほど効果的に転送できるか? また、制約違反はどれほど低い水準を維持できるか?
  • RQ3制約表現とポリシー学習を分離することで、安全なRLにおける一般化性能とパフォーマンスがどの程度向上するか?
  • RQ4関係的・順序的といった複雑な制約を複数含む状況において、本モデルは既存の安全RLベースラインと比較してどの程度の性能を示すか?
  • RQ5提案されたアーキテクチャのどのコンponents(例:M_B、h_C)が制約遵守とパフォーマンスにおいて最も重要であるか?

主な発見

  • POLCOはHazardWorld-gridにおいて、ベースライン手法と比較して最大11倍の累積報酬を達成し、安全制約下での学習効率の優位性を示した。
  • POLCOはベースラインと比較して、制約違反を最大1.8倍減少させ、自然言語による安全ルールへの強い準拠を示した。
  • アブレーションスタディの結果、制約埋め込み(h_C)またはマスク(M_B)を削除すると、制約違反が66.67%増加した。これは、正確な制約理解にこれらの要素が不可欠であることを裏付けた。
  • モデルは予算的、関係的、順序的な制約タイプの多様な種類を高い性能で処理し、複雑なテキスト制約への頑健な一般化を示した。
  • 特に順序的および関係的制約において、他の手法が安全とパフォーマンスのバランスを保てない中で、POLCOは報酬と制約遵守の両面ですべてのベースラインを上回った。
  • 訓練時と同じ報酬関数を用いても、評価段階で新しい制約に一般化する能力が向上しており、モジュラー設計の有効性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。