Skip to main content
QUICK REVIEW

[論文レビュー] What a Nerd! Beating Students and Vector Cosine in the ESL and TOEFL Datasets

Enrico Santus, Tin-Shing Chiu|arXiv (Cornell University)|Mar 29, 2016
Topic Modeling参考文献 4被引用数 9
ひとこと要約

本稿では、2つの目的語が共有する最も関連性の高い文脈の順位付き共通部分集合を評価することで、ベクトルコサインや共起統計を上回る新しい非教師あり単語類似度測定法であるAPSynを紹介する。ESLおよびTOEFLのデータセットにおいて、それぞれ73%および70%の正確さを達成し、人間の性能(64.5%)と最先端手法を上回った。

ABSTRACT

In this paper, we claim that Vector Cosine, which is generally considered one of the most efficient unsupervised measures for identifying word similarity in Vector Space Models, can be outperformed by a completely unsupervised measure that evaluates the extent of the intersection among the most associated contexts of two target words, weighting such intersection according to the rank of the shared contexts in the dependency ranked lists. This claim comes from the hypothesis that similar words do not simply occur in similar contexts, but they share a larger portion of their most relevant contexts compared to other related words. To prove it, we describe and evaluate APSyn, a variant of Average Precision that, independently of the adopted parameters, outperforms the Vector Cosine and the co-occurrence on the ESL and TOEFL test sets. In the best setting, APSyn reaches 0.73 accuracy on the ESL dataset and 0.70 accuracy in the TOEFL dataset, beating therefore the non-English US college applicants (whose average, as reported in the literature, is 64.50%) and several state-of-the-art approaches.

研究の動機と目的

  • 単語類似度が、ベクトルコサイン類似度よりも上位順位の文脈の重複によってよりよく捉えられるかどうかを調査すること。
  • 上位順位の依存関係文脈を活用して、単語類似度予測を改善する非教師あり測定法を開発すること。
  • 人間の性能が重要なベースラインである標準ベンチマーク(ESLおよびTOEFL)上で、提案手法を評価すること。
  • 文脈の共通部分集合を順位で重み付けすることで、従来のベクトルベースおよび共起ベースの手法と比較して優れた性能が得られることを示すこと。

提案手法

  • APSynは、2つの目的語の依存関係順位付きリストからの最も関連性の高い文脈の共通部分集合を測定することで単語類似度を計算する。
  • 共有される文脈は、依存関係リストにおける順位に基づいて重み付けされ、頻度が高く上位に位置する共有文脈に高い重要性が与えられる。
  • これは、ラベルなしデータを必要とせず、単語の文脈を比較するために適応された平均適合度(AP)の変種である。
  • このアプローチは完全に非教師あり設定で動作し、依存構文解析と文脈頻度順位付けに依存する。
  • 標準的な正確さ指標を用いて、ESLおよびTOEFLの単語類似度データセット上でモデルを評価する。

実験結果

リサーチクエスチョン

  • RQ1上位順位の文脈の共通部分集合に基づく測定法が、単語類似度タスクにおいてベクトルコサインよりも優れているか。
  • RQ2依存関係リストにおける文脈の順位を重み付けすることで、類似度推定が改善されるか。
  • RQ3非教師あり手法が、標準化された単語類似度ベンチマークで人間の性能を上回ることができるか。
  • RQ4APSynは、ESLおよびTOEFLのデータセットにおいて、共起およびベクトルコサイン手法と比較して正確さでどのように差をつけるか。

主な発見

  • APSynはESLデータセットで73%の正確さを達成し、64.5%の人間ベースラインを顕著に上回った。
  • TOEFLデータセットでは、APSynは70%の正確さに達し、人間の性能と複数の最先端手法を上回った。
  • この手法は、両方のデータセットにおいて、ベクトルコサインおよび共起ベースの測定法を一貫して上回った。
  • APSynの最良設定は、パrameterチューニングに依存しない強靭性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。