Skip to main content
QUICK REVIEW

[論文レビュー] How agents see things: On visual representations in an emergent language game

Diane Bouchacourt, Marco Baroni|arXiv (Cornell University)|Aug 31, 2018
Language and cultural evolution参考文献 13被引用数 8
ひとこと要約

本論文は、実際の画像を用いたエージェントが、出現する言語ゲームにおいて視覚的表象をどのように発展させるかを調査している。成功した通信にもかかわらず、エージェントは概念的対象特性ではなく、低レベルの関係的画像特徴に依存して学習する。これは、ランダムなノイズについても高いパフォーマンスを達成するため、視覚的表象に人間のような意味的基盤が欠如していることを示している。

ABSTRACT

There is growing interest in the language developed by agents interacting in emergent-communication settings. Earlier studies have focused on the agents' symbol usage, rather than on their representation of visual input. In this paper, we consider the referential games of Lazaridou et al. (2017) and investigate the representations the agents develop during their evolving interaction. We find that the agents establish successful communication by inducing visual representations that almost perfectly align with each other, but, surprisingly, do not capture the conceptual properties of the objects depicted in the input images. We conclude that, if we are interested in developing language-like communication systems, we must pay more attention to the visual semantics agents associate to the symbols they use.

研究の動機と目的

  • エージェントが出現する言語ゲーム中に視覚入力をどのように表象するかを調査し、記号的使用を超えて、その背後にある視覚的表象を検討すること。
  • エージェントが人間が認識できる対象の特性と整合する概念的レベルの視覚的表象を発展させるかどうかを特定すること。
  • 参照ゲームにおける成功した通信が、視覚入力に意味的な意味的基盤があることを示すかどうかを評価すること。
  • エージェントの表象が知覚的入力に忠実であるか、それとも任意の関係的差異へと逸脱するかを評価すること。

提案手法

  • ImageNet画像から4096次元の画像特徴を抽出するために、事前学習済みのVGG-16ネットワークを用いて、Lazaridouら(2017)の送信者・受信者アーキテクチャを再実装した。
  • REINFORCE方策勾配強化学習を用いて、同じ画像および異なる画像の2つのバージョンで通信成功を最適化するようにエージェントを訓練した。
  • 100語彙の離散的語彙を用い、実画像ペアおよびランダムなノイズベクトルを含むホールドアウトテストセットでパフォーマンスを評価した。
  • 交差検証されたパフォーマンス指標を計算し、入力の入れ替えに対する平均報酬と語彙の安定性を測定した。
  • z正規化されたコサイン類似度を用いて、入力空間、送信者空間、受信者空間における画像ペア間の表象類似度を測定した。
  • ノイズ入力に対する通信のロバストネスをテストし、エージェントが概念的特徴か知覚的特徴に依存しているかを評価した。

実験結果

リサーチクエスチョン

  • RQ1出現する言語ゲームにおけるエージェントは、描写された対象の概念的特性を捉える視覚的表象を発展させるか?
  • RQ2送信者と受信者の内部表象はどの程度一致するか?また、それらは入力表象とはどのように異なるか?
  • RQ3意味的コンテンツのない入力、たとえばランダムなノイズについてもエージェントは効果的に通信できるか?
  • RQ4通信戦略は絶対的画像特徴に基づくのか、それとも入力間の相対的比較に基づくのか?
  • RQ5ゲームの設定が、安定的で概念的基盤を持つ語の意味の出現を促進するか?

主な発見

  • 同じ画像および異なる画像の両ゲームで訓練されたエージェントは、ノイズ入力ペアに対して95%以上の平均報酬を達成し、概念的コンテンツなしでの通信を示している。
  • ノイズ入力でのパフォーマンスは実画像入力(同じ画像ゲームでは95%対100%)と同等であり、エージェントが意味的コンテンツに感受しないことを示している。
  • 高い通信成功にもかかわらず、送信者および受信者空間における視覚的表象は概念的類似性を保持しておらず、同じ概念の画像がエージェント空間で離れる傾向にあった(入力空間の平均類似度1.07 対 1.94)。
  • クラス内画像類似度は送信者空間で上昇した(入力空間の0.61 対 送信者空間の0.75)、これは一部の構造が保持されていることを示唆しているが、それは概念的ではない。
  • 99%以上のノイズペアで、ターゲットを交換すると最も確率の高い語彙が変化したため、エージェントが絶対的特徴ではなく相対的比較に依存していることが確認された。
  • エージェントは人間レベルの対象概念に対応しない、安定的で共有された通信システムを確立し、任意の関係的差異に基づく「概念的合意」を形成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。