Skip to main content
QUICK REVIEW

[論文レビュー] The Emergence of Compositional Languages for Numeric Concepts Through Iterated Learning in Neural Agents

Shangmin Guo, Yi Ren|arXiv (Cornell University)|Oct 11, 2019
Language and cultural evolution参考文献 18被引用数 17
ひとこと要約

この論文は、深層ニューラルネットワークエージェントにおける反復学習を通じて、数的概念のための構成的言語が出現することを示しているが、これは入力表現(例えば、連結された one-hot ベクトルまたは物体数の画像)がリスナーの学習をより速く可能にしている場合に限る。構成的言語が支配的になるのは、それらが統合的代替案よりも学習可能である場合に限る。これは、学習可能性が出現的コミュニケーションにおける構成的構造の主要因であることを強調する。

ABSTRACT

Since first introduced, computer simulation has been an increasingly important tool in evolutionary linguistics. Recently, with the development of deep learning techniques, research in grounded language learning has also started to focus on facilitating the emergence of compositional languages without pre-defined elementary linguistic knowledge. In this work, we explore the emergence of compositional languages for numeric concepts in multi-agent communication systems. We demonstrate that compositional language for encoding numeric concepts can emerge through iterated learning in populations of deep neural network agents. However, language properties greatly depend on the input representations given to agents. We found that compositional languages only emerge if they require less iterations to be fully learnt than other non-degenerate languages for agents on a given input representation.

研究の動機と目的

  • 事前に定義された言語的要素が存在しないマルチエージェント通信システムにおいて、数的概念のための構成的言語が出現するかどうかを調査すること。
  • 入力表現(連結、画像、ベクトルの集合)が反復学習を通じて構成的言語の出現に与える影響を検討すること。
  • リスナーが言語を習得するために必要な訓練反復回数(学習可能性)が、構成的構造の出現を決定づける要因であるかどうかを特定すること。
  • 構成的構造が、反復学習の文脈において表現力と学習可能性のトレードオフから生じるという仮説を検証すること。

提案手法

  • スピーカーが特定の数の2種類の物体(A と B)を含むバッグを観察し、メッセージを生成し、リスナーが15個の候補から正しいバッグを選択する参照ゲーム「Bag-Select」を設計した。
  • 3種類の異なる入力表現を用いた:(1) one-hot ベクトルの連結(例:'2A3B' → [001000; 000100])、(2) 物体数が異なるシーンの画像、(3) 量を表す one-hot ベクトルの集合。
  • それぞれの入力に特化したニューラルエンコーダーを採用:連結には多層パーセプトロン(MLP)、画像には LeNet-5 スタイルの CNN、集合にはシグモイド活性化関数を用いたセットエンコーダー(順序不変性を維持)。
  • 文化的伝達を模倣するため、世代を跨いでダブル(スピーカー・リスナー対)をチェーン化する反復学習を実装した。各リスナーが次の世代の新しいスピーカーとなる。
  • 交差エントロピー損失と確率的勾配降下法(SGD)を用いてエージェントを訓練し、性能はメッセージの正答率(スピーカー)と正しいバッグ選択率(リスナー)で測定した。
  • 世代に跨る言語の進化を、出現言語のトポロジカル類似度と、構成性(ρ)が異なる言語の事後確率を用いて追跡した。滑らかにした指標を世代ごとに使用した。

実験結果

リサーチクエスチョン

  • RQ1神経的エージェントにおける反復学習が、数的概念のための構成的言語の出現を引き起こすか?
  • RQ2連結、画像、集合の異なる入力表現が、出現言語における構成的構造の出現にどのように影響するか?
  • RQ3リスナーが言語を習得するために必要な訓練反復回数(学習可能性)が、構成的言語が支配的になるかどうかを決定づける要因となるか?
  • RQ4表現力が同程度であるにもかかわらず、なぜ集合ベースの入力表現下では構成的言語が出現しないのか?

主な発見

  • 連結 one-hot ベクトルまたは画像表現の条件下では、構成的言語(ρ > 0.6)が出現し、世代に跨って支配的となった。高構成性言語の事後確率は着実に上昇した。
  • 連結および画像条件の両方で、最終的に出現した言語には明確な構成的構造が見られ、A および B 物体の数に対応する明確なメッセージトークンが存在した。
  • 集合ベースの入力表現条件下では、構成的言語は出現しなかった。最終言語は非構成的であり、メッセージトークンと物体数との間に明確な対応関係がなかった。
  • トポロジカル類似度の観点から、集合条件では連結および画像条件と比較して顕著に低く、世代に跨る構造的一致性が乏しかった。
  • 構成的言語は、同じ入力条件下での統合的言語や出現言語よりもリスナーにとってより学習可能であり、必要な訓練反復回数が少なかった。これは、反復学習において構成的言語が支配的になる理由を説明している。
  • 結果は、構成的構造が表現力と学習可能性の両方の圧力の下で出現するという仮説を支持しており、集合表現は構造的規則性が低くてもリスナーの学習可能性が高いため、非構成的言語を好む傾向にある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。