Skip to main content
QUICK REVIEW

[論文レビュー] Deceptive Reinforcement Learning for Privacy-Preserving Planning

Zhengshang Liu, Yang Yue|arXiv (Cornell University)|Feb 5, 2021
Reinforcement Learning in Robotics参考文献 36被引用数 9
ひとこと要約

本稿では、モデルフリー強化学習における報酬関数のプライバシーを保護するため、二つの誘導的強化学習手法——曖昧性駆動型および非合理性重み付き行動選択——を提案する。事前学習済みQ関数を用いて、最適でないが曖昧な軌道を生成することで、エージェントは初心者の意図認識システムおよび人間の観察者をだます。これにより、真の報酬関数の推定精度が低下する一方、報酬損失は限定的である。

ABSTRACT

In this paper, we study the problem of deceptive reinforcement learning to preserve the privacy of a reward function. Reinforcement learning is the problem of finding a behaviour policy based on rewards received from exploratory behaviour. A key ingredient in reinforcement learning is a reward function, which determines how much reward (negative or positive) is given and when. However, in some situations, we may want to keep a reward function private; that is, to make it difficult for an observer to determine the reward function used. We define the problem of privacy-preserving reinforcement learning, and present two models for solving it. These models are based on dissimulation -- a form of deception that `hides the truth'. We evaluate our models both computationally and via human behavioural experiments. Results show that the resulting policies are indeed deceptive, and that participants can determine the true reward function less reliably than that of an honest agent.

研究の動機と目的

  • 観察者から真の報酬関数を隠すことで、強化学習におけるプライバシーを保護する挑戦に取り組む。
  • モデルベースの計画を必要とせず、標準的な強化学習フレームワークに適用可能な、モデルフリーで実用的な欺瞞メカニズムを開発する。
  • 計算的および人間の行動的状況の両方で、欺瞞の有効性を評価する。
  • 欺瞞が観察者の推論精度に与える影響と、期待報酬性能とのトレードオフを調査する。
  • 観察者の熟練度と自覚度が、欺瞞の有効性に与える影響を調査する。

提案手法

  • 曖昧性モデルは、観察者の真の報酬関数に関する信念分布のエントロピーを最大化する行動を選択することで、真の報酬関数の不確実性を高める。
  • 非合理性モデルは、誠実な行動と非合理的な行動を重み付き和で組み合わせ、重みを調整して欺瞞と性能のバランスをとる。
  • 両モデルとも、行動選択をガイドするために事前学習済みQ関数を用い、環境のモデル知識を必要としないモデルフリー強化学習への適用を可能にする。
  • 欺瞞は、真の目的以外のすべての目的に対して部分的に最適でない軌道を生成することで実装され、エージェントの意図が曖昧になる。
  • モデルは、観察された経路に基づいてゴールの尤度を推定する初心者の意図認識システムを用いて評価される。
  • 3または5つの到着地点が存在するパス計画タスクにおいて、69名の参加者を対象とした人間被験により、現実世界における欺瞞の有効性が評価される。

実験結果

リサーチクエスチョン

  • RQ1強化学習における欺瞞は、観察者から真の報酬関数を効果的に隠すことができるか?
  • RQ2曖昧性ベースのモデルと非合理性ベースのモデルの間で、欺瞞の有効性と報酬効率の観点から、どのような差異が生じるか?
  • RQ3欺瞞的エージェントと誠実なエージェントを観察した場合、人間参加者が真の報酬関数をどれだけ正確に推定できるか?
  • RQ4観察者の自覚度(例:欺瞞が可能であることを知っている)が、人間被験者における欺瞞の認識に与える影響は何か?
  • RQ5提案されたモデルにおいて、欺瞞の有効性と期待累積報酬の間には、どのようなトレードオフが生じるか?

主な発見

  • 曖昧性モデルは、特に5つのゴールがある状況において、人間参加者が真の報酬関数を正しく特定する能力を、誠実なエージェントと比較して低下させた。
  • 非合理性モデルは曖昧性モデルよりも強い欺瞞効果を示し、経路全体を通じて参加者が真のゴールを正しく推定する確率が低かった。
  • 欺瞞にもかかわらず、観察された行動が増えるにつれて真の報酬関数がますます特定可能になる傾向があり、これは、より長い計画ではプライバシー保護が弱くなることを示している。
  • 人間参加者の推論精度は、初心者の意図認識モデルよりも低く、人間の認知は最適経路を推定するのに非効率であることが示唆された。
  • 誠実なモデルですら、参加者にしばしば欺瞞的であると認識された。これは、戦略的行動に関する仮定による観察者のバイアスが、欺瞞検出に影響している可能性を示している。
  • 非合理性モデルは曖昧性モデルよりも高い報酬損失(低い割引期待報酬)を示したため、欺瞞設計におけるパフォーマンスコストのトレードオフが明確になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。