Skip to main content
QUICK REVIEW

[論文レビュー] Can Eye Movement Data Be Used As Ground Truth For Word Embeddings Evaluation?

Amir Bakarov|arXiv (Cornell University)|Apr 23, 2018
Neurobiology of Language and Bilingualism参考文献 1被引用数 6
ひとこと要約

本研究は、黙読中の眼球運動データが、語の分散的意味論的表現(word embeddings)の評価に用いられる言語に依存しない基準(ground truth)として機能できるかどうかを検証する。英語およびロシア語の眼動態データセット(Provo、GECO、Russian Sentence Corpus)と、国家およびウェブコーパスで学習された単語ベクトルを用いて分析した結果、語の分散的意味論的表現と眼球運動パターンとの間に弱く一貫性のない相関が認められ、言語を問わず語彙的意味論が正確に反映されるという仮説に疑問を呈した。

ABSTRACT

In recent years a certain success in the task of modeling lexical semantics was obtained with distributional semantic models. Nevertheless, the scientific community is still unaware what is the most reliable evaluation method for these models. Some researchers argue that the only possible gold standard could be obtained from neuro-cognitive resources that store information about human cognition. One of such resources is eye movement data on silent reading. The goal of this work is to test the hypothesis of whether such data could be used to evaluate distributional semantic models on different languages. We propose experiments with English and Russian eye movement datasets (Provo Corpus, GECO and Russian Sentence Corpus), word vectors (Skip-Gram models trained on national corpora and Web corpora) and word similarity datasets of Russian and English assessed by humans in order to find the existence of correlation between embeddings and eye movement data and test the hypothesis that this correlation is language independent. As a result, we found that the validity of the hypothesis being tested could be questioned.

研究の動機と目的

  • 黙読中の眼球運動データが、語の分散的意味論的表現の信頼できる言語に依存しない評価基準として機能できるかどうかを検証すること。
  • 語の分散的意味論的表現と眼球運動データとの相関が、特に英語とロシア語を含む異なる言語間で一貫しているかどうかを調査すること。
  • 固定時間や再帰的移動(regressions)といった神経行動的データが、分布的意味論モデルと整合する形で語の意味的類似性を反映しているかどうかを評価すること。
  • 国家コーパスとウェブコーパスで学習された語の分散的意味論的表現の性能を、二つのタイプが著しく異なる言語(英語とロシア語)において眼球運動データと比較すること。
  • 眼動態データが語の分散的意味論的表現の内在的評価において、人間の語彙的意味論の代理として有効であるかどうかを検証すること。

提案手法

  • Provoコーパス(英語)、GECO(英語)、Russian Sentence Corpus(ロシア語)の3つのコーパスから眼球運動データを収集し、固定時間と再帰的移動頻度に注目した。
  • ロシア語のNational CorpusとWeb Corpus、および同等の英語コーパスを用いて、Skip-gram法による語の分散的意味論的表現を学習した。
  • 語の分散的意味論的表現と眼球運動データ(固定時間との相関を介して)を用いて、ターゲット語とその最近傍語との類似度スコアを算出した。
  • スピアマンの順位相関係数を用いて、語の分散的意味論的表現の類似度と眼球運動に基づく類似度の相関を測定した。
  • 異なる学習設定(国家コーパス対ウェブコーパス)および言語ペアにおける相関の頑健性を評価した。
  • 人間がアノテートした語の類似度データセット(例:SimLex-999、Ruscorpora)を参照として用いたが、主な評価指標は眼球運動データと分散的意味論的表現の相関に焦点を当てた。

実験結果

リサーチクエスチョン

  • RQ1英語およびロシア語において、語の分散的意味論的表現と眼球運動データ(例:固定時間)との間に有意な相関が認められるか?
  • RQ2語の分散的意味論的表現と眼球運動データとの相関が、異なる言語間で一貫しており、言語跨ぎの有効性を示唆するか?
  • RQ3国家コーパスで学習された語の分散的意味論的表現とウェブコーパスで学習されたものとを比較すると、眼球運動データとの相関に差は認められるか?
  • RQ4黙読中の眼球運動データは、語の分散的意味論的表現の内在的評価における語彙的意味論の信頼できる代理指標と見なせるか?
  • RQ5眼球運動パターンと語の分散的意味論的表現との関係が言語依存的である場合、そのデータが普遍的な意味論的構造を反映していない可能性があるか?

主な発見

  • 英語およびロシア語の両データセットにおいて、語の分散的意味論的表現と眼球運動データ(例:固定時間)との間には弱く一貫性のない相関が認められた。
  • 大規模コーパスから得た高品質な分散的意味論的表現を用いても、固定時間や再帰的移動回数といった眼球運動特徴と強い相関は観察されなかった。
  • 分散的意味論的表現と眼球運動データとの相関は、ランダムベースライン水準を著しく上回っていなかったため、意味論的評価の代理指標としての有効性が限定的であると示唆された。
  • 眼球運動データが語の分散的意味論的表現の信頼できる言語に依存しない基準であるという仮説は、結果から支持されなかった。
  • 言語間で一貫した相関が得られなかったため、眼球運動データが普遍的な語彙的意味論を反映しているという主張は揺るがされた。
  • 国家コーパスで学習された分散的意味論的表現がウェブコーパスで学習されたものよりも眼球運動パターンの予測において優れている証拠は得られず、眼球動態データがゴールスタンダードとしての有効性がさらに弱まった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。