Skip to main content
QUICK REVIEW

[論文レビュー] Teaching Social Behavior through Human Reinforcement for Ad hoc Teamwork -The STAR Framework

Shani Alkoby, Avilash Rath|arXiv (Cornell University)|Sep 20, 2018
Reinforcement Learning in Robotics参考文献 40被引用数 5
ひとこと要約

STARフレームワークは、効果性と社会的受容性のための専用フィードバックチャネルを用いた並列強化学習を通じて、アドホックなチームにおけるエージェントが人間の社会的規範に従うように学習する。結果として、二重フィードバックによりエージェントは高いパフォーマンスと社会的適合性の両立を学習し、ブレンド型または単一フィードバックアプローチを上回ることが示された。

ABSTRACT

As AI technology continues to develop, more and more agents will become capable of long term autonomy alongside people. Thus, a recent line of research has studied the problem of teaching autonomous agents the concept of ethics and human social norms. Most existing work considers the case of an individual agent attempting to learn a predefined set of rules. In reality, however, social norms are not always pre-defined and are very difficult to represent algorithmically. Moreover, the basic idea behind the social norms concept is ensuring that one's actions do not negatively influence others' utilities, which is inherently a multiagent concept. Thus, here we investigate a way to teach agents, as a team, how to act according to human social norms. In this research, we introduce the STAR framework used to teach an ad hoc team of agents to act in accordance with human social norms. Using a hybrid team (agents and people), when taking an action considered to be socially unacceptable, the agents receive negative feedback from the human teammate(s) who has(have) an awareness of the team's norms. We view STAR as an important step towards teaching agents to act more consistently with respect to human morality.

研究の動機と目的

  • マルチエージェントで人間が関与する環境において、自律的エージェントに社会的規範を教えるというギャップを埋める。
  • 単一エージェント、事前に定義された規範、または目的と制約の形式を混同する既存手法の限界を克服する。
  • チーム協働中にリアルタイムの人間からのフィードバックを通じて、文化的・時間的文脈に適した社会的規範をエージェントが学習可能にする。
  • 長期的な自律性を支援すると同時に、ハイブリッドな人間・エージェントチームにおける社会的責任ある行動を保証するフレームワークを開発する。
  • 効果性と社会的規範のための並列フィードバックチャネルが、ブレンド型または単一チャネルフィードバックよりも優れた学習をもたらすことを検証する。

提案手法

  • タスクの効果性と社会的受容性のための2つの並列フィードバックチャネルを備えた、STAR(強化学習による社会的トレーニングエージェント)フレームワークを導入する。
  • 人間のチームメイトが、エージェントの行動が社会的に不適切と見なされた場合、その効果性にかかわらず、リアルタイムで専用のフィードバックを提供する。
  • 強化学習を用いて、エージェントがタスクパフォーマンスと社会的規範遵守の両方を同時に最適化するように訓練する。
  • 現実世界のアドホックなチームワークシナリオを模倣するため、人間とエージェントのハイブリッドチーム設定を設計する。
  • 社会的規範とタスク効果性を分離するためのデュアルチャネルフィードバックメカニズムを採用し、学習における干渉を回避する。
  • 複数のフィードバック設計(効果性のみ、社会的受容性のみ、ブレンド型、および提案された並列STARフレームワーク)を評価する。

実験結果

リサーチクエスチョン

  • RQ1事前に社会的規範が定義されていなくても、人間からのフィードバックを通じて、アドホックなチームにおけるエージェントが社会的に許容可能な行動を学習できるか?
  • RQ2効果性と社会的規範のためのフィードバックを分離することで、ブレンド型フィードバックと比較して学習パフォーマンスにどのような影響があるか?
  • RQ3STARにおける並列フィードバック設計により、エージェントは高いパフォーマンスを達成しながら、社会的に不適切な行動を最小限に抑えることができるか?
  • RQ4このフレームワークを用いることで、異なる文化的・時間的文脈においても社会的規範を一般化できるか?
  • RQ5マルチエージェントシステムにおいて、効果性と社会的適合性の両方を教える最適なフィードバック構造は何か?

主な発見

  • 並列STARフィードバック設計は、効果性と社会的適合性の両面で理論上の上限に最も近いパフォーマンスを達成した。
  • 社会的受容性のみのフィードバックを受けたエージェントは、許容可能な行動の割合が最も高かったが、ゲームでクリアした行数が最も少なく、効果性が低かった。
  • 効果性のみのフィードバックでは、クリアした行数が最も多く、同時に社会的に不適切な行動の数も最も多かった。
  • ブレンド型フィードバック設計では、社会的適合性のパフォーマンス曲線が低く保たれたため、社会的規範の学習が効果的でなかった。
  • STARフレームワークにより、エージェントは効果性と社会的適合性の両方を並列に学習でき、両者のバランスを達成した。
  • 3ゲーム後には、STARフレームワークのパフォーマンス曲線が理論上の上限に非常に近づき、効果性と社会的規範の両方の効果的な統合的学習を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。