Skip to main content
QUICK REVIEW

[論文レビュー] Emergence of Pragmatics from Referential Game between Theory of Mind Agents

Luyao Yuan, Zipeng Fu|arXiv (Cornell University)|Jan 21, 2020
Multi-Agent Systems and Negotiation参考文献 52被引用数 12
ひとこと要約

本論文は、明示的な規則なしに、協働的 mind(ToM)エージェントが自発的に実用的通信プロトコルを発展できるようにする適応的強化学習アルゴリズムを提案する。相手の心的状態に関する一次的信念をモデル化し、反復的最良応答(IBR)トレーニングを用いることで、エージェントは文面的な意味を超えて文脈的に関連する意味を推論できるようになり、参照的正確性が最大98.7%に達し、再帰的教育次元(RTD)を実証的に近似する。

ABSTRACT

Pragmatics studies how context can contribute to language meanings. In human communication, language is never interpreted out of context, and sentences can usually convey more information than their literal meanings. However, this mechanism is missing in most multi-agent systems, restricting the communication efficiency and the capability of human-agent interaction. In this paper, we propose an algorithm, using which agents can spontaneously learn the ability to "read between lines" without any explicit hand-designed rules. We integrate the theory of mind (ToM) in a cooperative multi-agent pedagogical situation and propose an adaptive reinforcement learning (RL) algorithm to develop a communication protocol. ToM is a profound cognitive science concept, claiming that people regularly reason about other's mental states, including beliefs, goals, and intentions, to obtain performance advantage in competition, cooperation or coalition. With this ability, agents consider language as not only messages but also rational acts reflecting others' hidden states. Our experiments demonstrate the advantage of pragmatic protocols over non-pragmatic protocols. We also show the teaching complexity following the pragmatic protocol empirically approximates to recursive teaching dimension (RTD).

研究の動機と目的

  • マルチエージェントシステムが、意味が文脈や相互の信念によって形作られる実用的通信を発展させることを可能にすること。
  • 計算コストが著しく増大するおそれがある再帰的理論的思考(ToM)推論を、マルチエージェントシステムに統合する課題に対処すること。
  • エージェントが文脈に敏感なメッセージ選択とグローバルなメッセージマッピングを学習できる、スケーラブルでエンドツーエンドでトレーニング可能なフレームワークを設計すること。
  • 協働的教育シナリオにおいて、実用的プロトコルが自然に出現するかどうかを評価し、正確性と教育の複雑さの観点から非実用的ベースラインと比較すること。
  • 人間がアノテートしたメッセージの意味づけが、理論的下限である再帰的教育次元(RTD)に近い教える複雑さを持つプロトコルを生み出すかどうかを調査すること。

提案手法

  • 協働的マルチエージェント強化学習に一次的理論的思考(ToM)を統合し、エージェントが環境やターゲットオブジェクトに関する相手の信念をモデル化する。
  • 反復的最良応答(IBR)トレーニング方式を用いる:一方のエージェントの方策を固定し、他方を最適化することで、相互適応と安定した通信プロトコルへの収束を実現する。
  • 相手の実際の信念を近似する信念推定関数を学習する適応的強化学習アルゴリズムを開発し、高階層の信念ネストの非実行可能性を回避する。
  • 教師が学生にメッセージを用いてターゲットオブジェクトを伝える参照ゲームの設定を採用し、シンボリックおよびピクセルベースの入力を用いる。
  • 共同トレーニングの前段階として、ベイズ的信念更新による事前トレーニングを実施し、メッセージの意味づけを解釈可能に保証することで、安定性と解釈可能性を向上させる。
  • テストセットを用いて、ダミーの数(3または7)を変化させた状況でメッセージの妥当性と参照的正確性を評価し、メッセージとダミー属性の共分散を計算することで、文脈への感受性を評価する。

実験結果

リサーチクエスチョン

  • RQ1明示的な規則なしに、強化学習とToMを組み合わせた場合、協働的マルチエージェントシステムで実用的通信が出現するか?
  • RQ2一次的信念モデルの導入により、文面的解釈と比較して通信の効率性と参照的正確性はどの程度向上するか?
  • RQ3出現した実用的プロトコルは、教える複雑さの理論的下限である再帰的教育次元(RTD)にどの程度近づくか?
  • RQ4エージェントは文脈に応じてどのようにメッセージを選択するか?また、メッセージとダミー属性の共分散を用いてその選択を定量化できるか?
  • RQ5人間がアノテートしたメッセージの意味づけは、解釈可能でかつ効率的なプロトコルを生み出し、最適な教える複雑さに近づけるか?

主な発見

  • 実用的プロトコルでは、ダミーが7個の状況で98.7%、4個の状況で98.1%の参照的正確性を達成し、非実用的ベースラインを著しく上回った。
  • 実用的プロトコル下でメッセージの妥当性は98.8%に達し、エージェントが文脈的に適切で意味のある発話を行うようになったことを示している。
  • 共分散分析の結果、教師エージェントはダミー属性に対応するメッセージを避ける傾向にあった—例えば、色のダミーが存在する場合には色に関するメッセージが生成されにくかった—これにより、文脈に敏感なメッセージ選択が確認された。
  • 人間がアノテートした意味づけを用いることで、出現したプロトコルの教育複雑さは実証的に再帰的教育次元(RTD)に近づいた。これは、情報効率がほぼ最適に近いことを示唆している。
  • 反復的トレーニングプロセスにより、プロトコルの進化が安定化し、効果的な通信パターンが保持されつつ性能が向上した。また、高い人間の解釈可能性を維持した。
  • L.A. [2017] や L.A. [2018] といった先行手法を上回り、同じ条件下でダミーが7個の状況で98.1%、4個の状況で99.7%の正確性を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。