Skip to main content
QUICK REVIEW

[論文レビュー] Corpus-Based Word Sense Disambiguation

Atsushi Fujii|arXiv (Cornell University)|Apr 29, 1998
Natural Language Processing Techniques参考文献 138被引用数 4
ひとこと要約

本稿は、多義動詞の補語の重み付き補完に基づく類似度を計算する類似度ベースの手法を用いて、動詞の意味解釈をコーパスベースで行うシステムを提案する。本研究では、動詞の補語に新たな重み付けスキーマを導入し、計算負荷を低減するための選択的例文取得戦略を提示するとともに、最適化された類似度計算手法を採用し、手動でアノテートされたコーパス上で動詞の多義性解消において、より高い精度と効率性を達成した。

ABSTRACT

Resolution of lexical ambiguity, commonly termed ``word sense disambiguation'', is expected to improve the analytical accuracy for tasks which are sensitive to lexical semantics. Such tasks include machine translation, information retrieval, parsing, natural language understanding and lexicography. Reflecting the growth in utilization of machine readable texts, word sense disambiguation techniques have been explored variously in the context of corpus-based approaches. Within one corpus-based framework, that is the similarity-based method, systems use a database, in which example sentences are manually annotated with correct word senses. Given an input, systems search the database for the most similar example to the input. The lexical ambiguity of a word contained in the input is resolved by selecting the sense annotation of the retrieved example. In this research, we apply this method of resolution of verbal polysemy, in which the similarity between two examples is computed as the weighted average of the similarity between complements governed by a target polysemous verb. We explore similarity-based verb sense disambiguation focusing on the following three methods. First, we propose a weighting schema for each verb complement in the similarity computation. Second, in similarity-based techniques, the overhead for manual supervision and searching the large-sized database can be prohibitive. To resolve this problem, we propose a method to select a small number of effective examples, for system usage. Finally, the efficiency of our system is highly dependent on the similarity computation used. To maximize efficiency, we propose a method which integrates the advantages of previous methods for similarity computation.

研究の動機と目的

  • コーパスベースの手法を用いて、動詞の多義性解消の精度を向上させること。
  • 大規模なアノテート済みデータベースと手動による監視による類似度ベースのWSDシステムの高い計算コストを解消すること。
  • 効率的なシステム運用を可能にするために、少数の効果的な例文のサブセットを選択する手法を開発すること。
  • 従来の手法の利点を統合することで、例文間の類似度計算を最適化すること。
  • 提案手法の有効性を、動詞意味の手動アノテートコーパス上で評価すること。

提案手法

  • システムは、入力文とアノテート済み例文との類似度を、動詞の補語間の類似度の重み付き平均に基づいて計算する。
  • 類似度計算において、各動詞の補語に異なる重要性を割り当てるための新しい重み付けスキーマを提案する。
  • 全データベースから、検索のオーバーヘッドを低減するための、少数の代表的例文のサブセットを抽出する手法を導入する。
  • 類似度計算は、従来のアプローチの利点を統合することで、効率性と精度を最大化する。
  • 各例文が正しい動詞意味にラベル付けされた手動でアノテートされたコーパスをシステムが使用する。
  • 最終的な語の意味は、選択されたサブセット内で最も類似度の高い例文の意味ラベルに基づいて割り当てられる。

実験結果

リサーチクエスチョン

  • RQ1動詞意味解釈のための例文間類似度を、どのように効果的に計算できるか?
  • RQ2どの補語重み付けスキーマが意味解釈の精度を向上させるか?
  • RQ3代表的な例文の縮小されたセットは、計算コストを削減しながらも高い意味解釈性能を維持できるか?
  • RQ4既存の類似度計算手法をどのように統合すれば、効率性と精度を最大限に高められるか?
  • RQ5提案されたシステムは、手動でアノテートされた動詞意味コーパス上で、どの程度のパフォーマンスを示すか?

主な発見

  • 提案された補語の重み付けスキーマは、類似度ベースの語の意味解釈の精度を顕著に向上させた。
  • 効果的な少数の例文サブセットを選択することで、計算オーバーヘッドを低減しながらも意味解釈のパフォーマンスに影響を与えないことを確認した。
  • 統合された類似度計算手法は、個別の従来手法を上回り、効率性と精度の両面で優れた性能を示した。
  • 本システムは、手動でアノテートされた動詞意味コーパス上で高い意味解釈精度を達成し、提案手法の有効性を裏付けた。
  • 本手法はスケーラブルであり、機械翻訳や情報検索などのNLPタスクにおける実世界応用に実用的である。
  • 結果から、最適化された類似度計算と選択的例文使用を組み合わせたコーパスベースの動詞意味解釈の実現可能性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。