Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Engage with Interactive Systems: A Field Study on Deep Reinforcement Learning in a Public Museum

Lingheng Meng, Daiwei Lin|arXiv (Cornell University)|Apr 14, 2019
Reinforcement Learning in Robotics参考文献 78被引用数 5
ひとこと要約

本論文は、赤外線センサデータを用いてグループ内の人的関与を推定する深層強化学習(DRL)フレームワークを提案する。このフレームワークでは、アクティブなジェスチャーとパッシブな占有状態(近接領域への存在)を統合し、その関与推定値を報酬信号として用いて、公共の美術館で展開される大規模なインタラクティブ彫刻装置(Living Architecture)において、適応的で人間らしい振る舞いを学習する。この手法は、事前にスクリプトされた振る舞いと比較して、関与度と好まれやすさの両面で優れている。これは、オープンワールドで動的かつ変化し続ける環境において、自律的かつ社会的に適応可能なシステムの実現可能性を示している。

ABSTRACT

Physical agents that can autonomously generate engaging, life-like behaviour will lead to more responsive and interesting robots and other autonomous systems. Although many advances have been made for one-to-one interactions in well controlled settings, future physical agents should be capable of interacting with humans in natural settings, including group interaction. In order to generate engaging behaviours, the autonomous system must first be able to estimate its human partners' engagement level. In this paper, we propose an approach for estimating engagement during group interaction by simultaneously taking into account active and passive interaction, i.e. occupancy, and use the measure as the reward signal within a reinforcement learning framework to learn engaging interactive behaviours. The proposed approach is implemented in an interactive sculptural system in a museum setting. We compare the learning system to a baseline using pre-scripted interactive behaviours. Analysis based on sensory data and survey data shows that adaptable behaviours within an expert-designed action space can achieve higher engagement and likeability.

研究の動機と目的

  • 構造的でない、公共の環境における長期間にわたる、人的なグループとの適応的相互作用が可能な自律的システムの開発。
  • アクティブなジェスチャー(例:手を振る)とパッシブな占有(近接領域への存在)を統合することで、グループ内での人的関与を推定すること。
  • 関与度を学習した報酬信号として用いることで、深層強化学習を用いてインタラクティブな振る舞いを学習し、継続的な適応を可能にすること。
  • 実世界の美術館環境において、学習された振る舞いが事前スクリプトされた振る舞いと比較して、関与度と好まれやすさの観点で優れているかどうかを評価すること。
  • 明示的な人間の監視なしに、センサデータによる暗黙のヒューマンフィードバックを用いてインタラクティブシステムを訓練するという実現可能性の探求。

提案手法

  • 本システムは、複数の赤外線(IR)センサを用い、アクティブな人間のジェスチャー(例:手を振る)とパッシブな占有(インタラクション領域への存在)を両方検出する。
  • 関与度は、アクティブな相互作用の頻度とパッシブな占有時間の両方を組み合わせた複合報酬信号として定義され、連続的かつリアルタイムのフィードバック信号としてモデル化される。
  • ポリシー・ネットワークの学習には、連続的行動空間制御を可能にする深層決定的方策勾配(DDPG)アルゴリズムが用いられる。
  • 報酬関数は、持続的な関与度を最大化することを目的とし、過剰な刺激を避けるために新奇性と反応性のバランスを取る。
  • 簡略化されたシミュレータは、初期のハイパーパramータチューニングおよびコード検証の目的でのみ使用され、事前学習には用いられない。
  • 本システムは、実際の美術館展示(例:Radiant Soil)に展開され、長期にわたり訪問者のリアルタイム相互作用から学習する。

実験結果

リサーチクエスチョン

  • RQ1強化学習エージェントは、暗黙の関与信号を用いて、実世界のオープンワールドかつグループインタラクション環境で、関与度の高い振る舞いを学習できるか?
  • RQ2学習ベースの振る舞い生成は、公共の美術館環境において、事前スクリプトされた振る舞いと比較して、より高い認識上の関与度と好まれやすさをもたらすか?
  • RQ3パッシブな占有とアクティブなジェスチャーは、グループ設定において、信頼性の高い関与度推定信号をどのように統合的に提供するか?
  • RQ4DRLエージェントは、多様で構造のない人間の相互作用パターンに応じて、時間経過とともにその振る舞いをどれほど適応的に変化させられるか?
  • RQ5高次元の自由度を持つ大規模なリアルタイムインタラクティブシステムにDRLを展開する際の実用的課題は何か?

主な発見

  • センサデータによる相互作用頻度と持続時間の測定から、学習されたポリシー(PLA)は、事前スクリプトされた振る舞い(PB)ベースラインと比較して、有意に高い平均関与度を達成した。
  • アンケート調査の結果、訪問者は学習されたシステムを、事前スクリプトされたバージョンよりもより好まれやすく、関与度が高いと感じた。これは、社会的受容性の向上を示唆している。
  • 本システムは、グループダイナミクス、社会的影響(例:模倣)や訪問者の熟練度の差異といった多様な相互作用スタイルに対し、成功裏に適応した。
  • アクティブなジェスチャーとパッシブな占有を統合した複合関与度信号は、社会的に適切で反応性の高い振る舞いをRLエージェントが学習するのを効果的に導いた。
  • サンプル効率の低さや現実的でないシミュレータの欠如という課題が存在したが、DDPGベースのアプローチは、実際の美術館環境での長期にわたる展開においても安定した学習を示した。
  • 結果から、オープンワールド環境において、暗黙的で関与度に基づく報酬設計が、自律的かつ適応的インタラクティブシステムの訓練に実現可能であることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。