Skip to main content
QUICK REVIEW

[論文レビュー] Computational Language Acquisition with Theory of Mind

Andy Liu, Hao Zhu|arXiv (Cornell University)|Mar 2, 2023
Topic Modeling被引用数 5
ひとこと要約

本論文では、話者エージェントが内部の心の理論(ToM)リスナーモデルを用いて、画像参照ゲームにおける意味的適切さを向上させるために発話文を再ランク付けする計算言語習得フレームワークを提示する。ToMコンponentを統合することで、リスナーのターゲット選択に対する信頼度を予測し、モデルはより高い正確性を達成するとともに、より自然で的確な言語を生成するようになる。特に環境の難易度が上昇する状況でも顕著である。

ABSTRACT

Unlike current state-of-the-art language models, young children actively acquire language through interactions with their surrounding environment and caretakers. One mechanism that has been argued to be critical to language learning is the ability to infer the mental states of other agents in social environments, coined Theory of Mind (ToM) by Premack & Woodruff (1978). Drawing inspiration from the modern operationalized versions of ToM implemented in Rabinowitz et al. (2018) and Zhu et al. (2021), we build language-learning agents equipped with ToM, and measure its effects on the learning process. We model ToM by giving the speaker agent an internal listener model that is trained alongside the speaker and used to rerank potential utterances. We experiment with varying task difficulty, hypothesizing that models will acquire more complex language to adapt to stronger environmental pressures. We find that training speakers with a highly weighted ToM listener component leads to performance gains in our image referential game setting. We also find some evidence that increasing task difficulty in the training process results in more fluent and precise utterances in evaluation. This suggests the potential utility of further incorporating ToM, as well as other insights from child language acquisition, into computational models of language acquisition.

研究の動機と目的

  • 計算的エージェントが対話的で意味的根拠のある環境内において、心の理論(ToM)機構が言語習得に与える影響を調査すること。
  • 視覚的および意味的に類似した不正解候補画像が増加するという環境難易度の上昇が、学習された言語の複雑さと質に与える影響を検討すること。
  • 発達心理学における人間の言語習得に関する知見と、実装された意味的推論および社会的認知を組み合わせることで、計算モデルと橋渡しを行うこと。
  • ToMと環境的圧力が併せて作用することで、より人間らしく、自然で的確な言語生成が人工エージェントに出現するかどうかを評価すること。

提案手法

  • 話者エージェントに、発話文が与えられたもとでリスナーのターゲット画像選択に対する信頼度を予測する内部のToMリスナー・モデルを搭載する。このモデルは話者と同時に学習される。
  • 内部のToMリスナーの確率スコアを用いて、候補となる発話文を再ランク付けし、リスナーの期待に最も適合する発話文を優先選択する。
  • 話者エージェントを、ターゲット画像を不正解候補画像の中から説明する英語発話文を生成する参照ゲームの設定で訓練する。報酬はリスナーの正確性と信頼度に基づく。
  • CLIP、RoBERTa、TF-IDFの埋め込みを用いて、視覚的および意味的類似度を制御する不正解候補画像の分布から、タスク難易度を変化させる。
  • カリキュラムスタイルの訓練を実装し、不正解候補の類似度を調整することで、環境的圧力を模倣する。
  • ターゲット画像の選択正確性を測定し、自動指標と人間評価を用いて生成された発話文の自然さと的確さを評価する。
Figure 1: An example of how ToM is used by our speaker models in our implementation. The speaker first generates candidate utterances before reranking them according to the probability given to each target image, utterance pair by the internal ToM listener. It then selects either the highest-scoring
Figure 1: An example of how ToM is used by our speaker models in our implementation. The speaker first generates candidate utterances before reranking them according to the probability given to each target image, utterance pair by the internal ToM listener. It then selects either the highest-scoring

実験結果

リサーチクエスチョン

  • RQ1RQ1: 内部の心の理論(ToM)リスナー・コンponentの導入が、言語学習エージェントの性能および言語的質に与える影響は何か?
  • RQ2RQ2: 発話文の出力が、より類似した不正解候補画像を含む環境難易度の上昇にどのように適応するか?
  • RQ3RQ3: ToMと環境的圧力の組み合わせが、より自然で的確かつ人間らしい言語生成をもたらすか?
  • RQ4RQ4: ToMを搭載したモデルが、さまざまなタスク条件下で非ToMモデルに比べて、意味的適切な言語生成においてどの程度優れているか?

主な発見

  • ToMコンponentを備えた話者モデルは、最終的な正確性および生成発話文の自然さにおいて、非ToMモデルを一貫して上回る。
  • 視覚的および意味的に類似した不正解候補画像を用いた訓練は、性能向上が常に見られない中でも、より長く的確で自然な発話文を生成するようになる。
  • ToMリスナー・モデルにより、話者はリスナーが正しく解釈する可能性が最も高い発話文を選択することで、より意味的適切な発話文を生成できる。
  • 環境難易度の上昇は、言語の複雑さの向上をもたらし、環境からの圧力が言語の洗練を促進していることを示唆している。
  • 改善は見られるものの、生成された言語は依然として人間のキャプションに比べて自然さと流暢さで著しく劣っている。
  • ToMと環境的圧力の統合は、より意味的適切で人間らしく、自然な言語モデルの開発に有望である。
Figure 2: An example image-caption pair, and distractors ranked as similar by various metrics. Caption and Hybrid similarities are computed with TF-IDF - weighted RoBERTa embeddings.
Figure 2: An example image-caption pair, and distractors ranked as similar by various metrics. Caption and Hybrid similarities are computed with TF-IDF - weighted RoBERTa embeddings.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。