Skip to main content
QUICK REVIEW

[論文レビュー] Learning Behaviors with Uncertain Human Feedback

Xu He, Haipeng Chen|arXiv (Cornell University)|Jun 7, 2020
Advanced Bandit Algorithms Research参考文献 18被引用数 8
ひとこと要約

本論文は、最適な行動が曖昧であるか、報酬が確率的である場合に、強化学習における人間のトレーナーの応答における不確実性を考慮する、新しい確率的ヒューマンフィードバックモデルを提案する。特に、最適な行動が曖昧であるか、報酬が確率的である状況において、不確実性を考慮したフィードバックモデルを提案する。近似的なEMアルゴリズムを導入し、勾配降下法を用いてフィードバックモデルのパラメータを推定することで、正確なモデルとは異なる人間のフィードバックに対しても、ベースラインと比較して不確実な環境下での方策学習を著しく改善する。

ABSTRACT

Human feedback is widely used to train agents in many domains. However, previous works rarely consider the uncertainty when humans provide feedback, especially in cases that the optimal actions are not obvious to the trainers. For example, the reward of a sub-optimal action can be stochastic and sometimes exceeds that of the optimal action, which is common in games or real-world. Trainers are likely to provide positive feedback to sub-optimal actions, negative feedback to the optimal actions and even do not provide feedback in some confusing situations. Existing works, which utilize the Expectation Maximization (EM) algorithm and treat the feedback model as hidden parameters, do not consider uncertainties in the learning environment and human feedback. To address this challenge, we introduce a novel feedback model that considers the uncertainty of human feedback. However, this incurs intractable calculus in the EM algorithm. To this end, we propose a novel approximate EM algorithm, in which we approximate the expectation step with the Gradient Descent method. Experimental results in both synthetic scenarios and two real-world scenarios with human participants demonstrate the superior performance of our proposed approach.

研究の動機と目的

  • 既存のRL手法が、トレーナーが最適な行動について不確実である場合でも、決定的であると仮定しているという限界を是正すること。
  • 人間のフィードバックを、行動の最適性に依存する確率的関数としてモデル化し、フィードバックの現実世界における曖昧性を反映すること。
  • エージェント方策と人間フィードバックモデルのパラメータを同時に最適化できる、計算的に実行可能な学習アルゴリズムを開発すること。
  • 人間のフィードバックが仮定された確率的モデルに厳密に従わない場合のロバストネスを評価すること。

提案手法

  • 行動が最適な行動から離れるほど、肯定的/否定的フィードバックの確率が増加または減少するフィードバックモデルを提案。行動の最適性に応じて、ガウス分布としてモデル化する。
  • パラメータ推定を分離する近似的なEMアルゴリズムを導入。まず一部のパラメータ(例:標準偏差)を固定し、その後勾配降下法で最適化する。
  • 確率的フィードバックモデルに起因する積分が計算不能となる場合に、Eステップの近似として勾配降下法を用いる。
  • 2段階の学習手順を採用:まずEMを用いて方策パラメータを推定し、その後勾配降下法でフィードバックモデルパラメータを精緻化する。
  • 人間フィードバックモデルを学習可能なパラメータを持つ潜在変数として扱い、方策とフィードバックモデルを同時に最適化可能にする。
  • 合成環境および2つの実世界のヒューマンインザループタスク(ネズミの採餌とバーチャルドッグトレーニング)で手法を検証する。

実験結果

リサーチクエスチョン

  • RQ1最適な行動が曖昧な確率的環境において、人間フィードバックの不確実性をモデル化することで、方策学習はどの程度向上するか?
  • RQ2正確な推論が不可能な状況下で、勾配降下法を用いた近似的なEMアルゴリズムが、エージェント方策と人間フィードバックモデルの両方のパラメータを効果的に学習できるか?
  • RQ3人間のトレーナーが仮定されたフィードバックモデルに従わない場合、提案手法はどの程度ロバストであるか?
  • RQ4状態数や行動数の変動が、フィードバックモデルパラメータ推定の正確さおよび学習性能に与える影響は何か?
  • RQ5多様なフィードバック条件下で、収束速度および最終的な方策品質の観点から、既存のベースラインを上回るか?

主な発見

  • 提案手法ABLUFは、合成環境および実世界環境の両方で、ラットを捕獲する効率(ステップあたりのラット数)や最適方策からの累積距離といった複数の指標において、BLUFおよびISABLベースラインを上回る性能を発揮する。
  • ネズミの採餌タスクでは、行動数が増加する状況でもABLUFがより高い性能を発揮し、複雑な行動空間の扱いが優れていることが示された。
  • バーチャルドッグトレーニングタスクでは、ABLUFがベースラインと比較して最適方策からの累積距離を著しく短縮し、より高速かつ正確な方策学習が可能であることを示した。
  • ロバストネス分析の結果、ABLUFは仮定されたモデルとは異なるフィードバックを提供するトレーナーに対しても、強力な性能を維持しており、現実世界のフィードバックのばらつきに適応可能であることが実証された。
  • ほとんどの設定において、フィードバックモデルパラメータσは低い分散で推定されるが、非常に短いエピソードでは収束が達成されないため、性能に限界がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。