Skip to main content
QUICK REVIEW

[論文レビュー] Are "Undocumented Workers" the Same as "Illegal Aliens"? Disentangling Denotation and Connotation in Vector Spaces

Albert Webson, Zhizhong Chen|arXiv (Cornell University)|Oct 6, 2020
Topic Modeling参考文献 39被引用数 6
ひとこと要約

本稿では、事前学習済み単語埋め込みを、意味的参照(denotation)と感情・イデオロギー的含み(connotation)に分離する敵対的ニューラルネットワークを提案し、意味的参照と感情の別々のモデリングを可能にしている。政治的言語を対象として評価した結果、事実的意味からイデオロギー的含みを分離することで、情報検索における見解の多様性が向上した。

ABSTRACT

In politics, neologisms are frequently invented for partisan objectives. For example, "undocumented workers" and "illegal aliens" refer to the same group of people (i.e., they have the same denotation), but they carry clearly different connotations. Examples like these have traditionally posed a challenge to reference-based semantic theories and led to increasing acceptance of alternative theories (e.g., Two-Factor Semantics) among philosophers and cognitive scientists. In NLP, however, popular pretrained models encode both denotation and connotation as one entangled representation. In this study, we propose an adversarial neural network that decomposes a pretrained representation as independent denotation and connotation representations. For intrinsic interpretability, we show that words with the same denotation but different connotations (e.g., "immigrants" vs. "aliens", "estate tax" vs. "death tax") move closer to each other in denotation space while moving further apart in connotation space. For extrinsic application, we train an information retrieval system with our disentangled representations and show that the denotation vectors improve the viewpoint diversity of document rankings.

研究の動機と目的

  • 事前学習済み単語埋め込みにおける意味的参照と含みの混同を是正し、NLPシステムにおける政治的バイアスの強化を防ぐこと。
  • 意味的意味を、意味的参照(参照)と含み(感情/イデオロギー)の別々で解釈可能なベクトル空間に分離する手法を開発すること。
  • 内在的評価として意味的類似度とクラスタリングを用い、外在的評価として情報検索タスクを用いて、分離された表現を評価すること。
  • 意味的参照に配慮した表現が、ドキュメントランク付けにおける見解の多様性を向上させ、イデオロギー的エコーチャンバーを軽減することを実証すること。
  • スピーカーと参照ラベルを監視信号として用いることで、モデルを現実の政治的議論に根ざさせること。

提案手法

  • 事前学習済み単語埋め込みを、意味的参照用と含み用の2つの独立したベクトル空間に分解するため、敵対的オートエンコーダーの枠組みを用いる。
  • 意味的参照と含みの両方を区別する2つの識別器を用い、実際の表現と生成された表現を区別させることで、分離を促進する。
  • 損失関数には、元の入力の再構成損失と、意味的参照および含みの両方の敵対的損失を組み合わせ、各ベクトル空間が各自の意図された意味次元のみを捉えるように保証する。
  • 監視信号として文レベルのラベルを用いる:含みのためのスピーカーのイデオロギー、意味的参照のための政策トピック。これらが分離プロセスをガイドする。
  • 政治的議論がアノテートされたニュースコーパス上でモデルを学習させ、参照的意味と評価的トーンの違いを学習可能にする。
  • 学習後、意味的参照と含みのベクトルは、内在的クラスタリングと外在的検索タスクを用いて評価され、意味的純度と実用性を検証する。

実験結果

リサーチクエスチョン

  • RQ1敵対的訓練を用いて、事前学習済み単語埋め込みを意味的参照と含みの別々の表現に効果的に分離できるか?
  • RQ2分離された意味的参照ベクトルは、同じ政策を異なる政治的フレーミングで扱った場合でも、一貫した意味的参照を捉えられるか?
  • RQ3分離された含みベクトルは、イデオロギー的感情を反映しつつ、事実的意味を保持しているか?
  • RQ4意味的参照ベクトルは、情報検索システムにおける見解の多様性を向上させられるか?
  • RQ5モデルは、既知の政治的婉曲表現(例:「未登録労働者」と「違法外国人」)をベクトル空間に正しく保存しているか、どの程度の正確さで保存しているか?

主な発見

  • 意味的参照が同一だが含みが異なる語ペairの間で、平均コサイン類似度が0.944に達し、強い意味的一貫性を示した。
  • 含みが同一だが意味的参照が異なる語ペアの間で、平均コサイン類似度が0.904に達し、感情の有効な分離が確認された。
  • 情報検索タスクにおいて、意味的参照ベースのランク付けにより見解の多様性が向上し、α-nDCGスコアが0.37に上昇した。これは、取得されたドキュメントの多様性が高まったことを示している。
  • 意味的参照ベースの手法では、ドキュメントランク付けのジニ係数が0.153に低下し、イデオロギー的同質性の低減が確認された。
  • 定性的分析により、「未登録労働者」と「違法外国人」といった語が、意味的参照空間では近く、含み空間では離れていることが確認され、モデルの意図した挙動が妥当であることが裏付けられた。
  • 明示的な定義を必要とせず、文脈的およびスピーカーレベルの監視信号に依存することで、意味的次元を効果的に分離できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。