Skip to main content
QUICK REVIEW

[論文レビュー] Assessing Phrasal Representation and Composition in Transformers

Lang Yu, Allyson Ettinger|arXiv (Cornell University)|Oct 8, 2020
Topic Modeling参考文献 54被引用数 4
ひとこと要約

本稿では、語彙的効果と真の構文的意味の組み合わせを分離する制御されたテストを用いて、最先端のトランスフォーマーにおけるフレーズ表現と構成の特性を体系的に評価している。モデルが語の内容を強く反映している一方で、語の重複以外の洗練されたフレーズレベルの構成的意味にはほとんど証拠がなく、語の重複を制御すると性能が著しく低下することが判明した。

ABSTRACT

Deep transformer models have pushed performance on NLP tasks to new limits, suggesting sophisticated treatment of complex linguistic inputs, such as phrases. However, we have limited understanding of how these models handle representation of phrases, and whether this reflects sophisticated composition of phrase meaning like that done by humans. In this paper, we present systematic analysis of phrasal representations in state-of-the-art pre-trained transformers. We use tests leveraging human judgments of phrase similarity and meaning shift, and compare results before and after control of word overlap, to tease apart lexical effects versus composition effects. We find that phrase representation in these models relies heavily on word content, with little evidence of nuanced composition. We also identify variations in phrase representation quality across models, layers, and representation types, and make corresponding recommendations for usage of representations from these models.

研究の動機と目的

  • 最先端のトランスフォーマーが、単なる語の内容を超えて洗練されたフレーズ意味の構成を実行しているかどうかを調査すること。
  • フレーズ埋め込みにおける語の重複による駆動と真の構成的意味の違いを明確にすること。
  • モデル、層、表現タイプ(例:CLS、Avg-Phrase)ごとのフレーズ表現品質の違いを分析すること。
  • 目的に応じた最適な表現の選定に関する実用的提案(例:語の内容の忠実度対構成的意味の理解)を提供すること。

提案手法

  • 人間によるフレーズ類似度と意味のずれの判断を用いた、フレーズ類似度および類義表現分類のベンチマークを適応的に活用した。
  • 語の重複に起因する手がかりを除去することで、構成的効果と語彙的効果を分離する制御済みのデータセットを構築した。
  • 古典的な意味選択テスト(例:Kintsch, 2001)を用いて、フレーズレベルでの構文的構成を評価した。
  • BERT、RoBERTa、DistilBERT、XLNet、XLM-RoBERTaの複数のモデルに対して、層ごとの分析を実施した。
  • さまざまな表現タイプを評価した:[CLS]、[SEP]、[CLS]トークン、およびワードピece埋め込みの平均値(Avg-Phrase)。
  • 制御済みと非制御済みの設定の結果を比較することで、語彙的コンテンツと構成的意味の寄与を分離した。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマー表現は、語の重複とは独立して、二語フレーズの真の構成的意味をどの程度反映しているか?
  • RQ2異なるモデル(例:BERT、RoBERTa、DistilBERT)および層におけるフレーズ表現の品質はどのように変化するか?
  • RQ3どの表現タイプ(例:CLS、Avg-Phrase、主語語)がフレーズ意味または語の内容を最もよく捉えているか?
  • RQ4代表的な構成テスト(例:意味選択)は、構成的理解を信頼できる方法で測定しているのか、それとも語彙的手がかりによって混同されているのか?
  • RQ5下流タスクに適した忠実なフレーズ表現をサポートする、特定のモデル設定(モデル、層、表現タイプ)を特定できるか?

主な発見

  • 語の重複が制御されていない状態では、モデルは人間のフレーズ類似度判断と強く相関し、類義表現分類タスクでも高い性能を示した。
  • 語の重複を制御した後は、類似度および分類タスクの性能が著しく低下し、モデルの成功が主に語彙的コンテンツに起因していることが示された。
  • RoBERTaの後続層におけるAvg-Phrase表現、およびXLM-RoBERTaの後続層におけるAvg-Phrase表現(フレーズが文脈にある場合)が、構成的感受性の最も有望な兆候を示した。
  • DistilBERTの最終層における[CLS]トークンは、[CLS]表現の中で最も優れた性能を示したが、依然として構成的忠実度は限定的であった。
  • [CLS]トークンは一般にフレーズ表現に不適切であり、最終層であってもDistilBERTを除いては劣っている。
  • 代表的な意味選択テストの結果は、非制御済みの類似度タスクと類似しており、語彙的効果の影響を受ける可能性があることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。