Skip to main content
QUICK REVIEW

[論文レビュー] Explaining away ambiguity: Learning verb selectional preference with Bayesian networks

Massimiliano Ciaramita, Mark Johnson|ArXiv.org|Aug 22, 2000
Topic Modeling参考文献 6被引用数 5
ひとこと要約

本稿では、語の意味的意味付けの不確実性を確率的推論によって自然にモデル化するため、WordNetの語彙的階層とコーパスベースの動詞・目的語ペアを活用し、'説明の排除'(explaining away)を用いて語の意味のあいまいさを解消するベイジアンネットワークモデルを提案する。このモデルは、語の意味のあいまいさの解消というタスクにおいて、最先端の非教師ありシステムを上回り、51.4%の正答率を達成した。これはResnikの44.3%およびAbneyとLightの42.3%を上回る。

ABSTRACT

This paper presents a Bayesian model for unsupervised learning of verb selectional preferences. For each verb the model creates a Bayesian network whose architecture is determined by the lexical hierarchy of Wordnet and whose parameters are estimated from a list of verb-object pairs found from a corpus. ``Explaining away'', a well-known property of Bayesian networks, helps the model deal in a natural fashion with word sense ambiguity in the training data. On a word sense disambiguation test our model performed better than other state of the art systems for unsupervised learning of selectional preferences. Computational complexity problems, ways of improving this approach and methods for implementing ``explaining away'' in other graphical frameworks are discussed.

研究の動機と目的

  • 未タグ付きコーパスから動詞の選択性の好みを学ぶ非教師ありモデルの開発。
  • ベイジアンネットワークの'説明の排除'特性を活用して、学習データにおける語の意味のあいまいさを解消すること。
  • 語彙的階層(WordNet)と確率的推論を統合することで、選択性の好みの推定を改善すること。
  • 選択性の好みの正確さの代理指標として、語の意味のあいまいさの解消タスクにおけるモデルの評価。
  • 他のグラフィカルモデル(ベイジアンネットワーク以外)に対しても'説明の排除'を実装可能かどうかの可能性の探求。

提案手法

  • 各動詞に対してベイジアンネットワークを構築し、WordNetの語義クラス(シンセット)と、観測された動詞・目的語ペアを表す証拠ノードを含める。
  • ネットワークの構造は、WordNetの下位関係(ハイポニムィー)階層から導出され、モデルアーキテクチャにおける意味的整合性を保証する。
  • パラメータはコーパスデータから推定され、語の意味のあいまいさを式(3)を用いて補正する修正された頻度推定器が使用される:$\hat{P}(c|p,r) \approx \sum_{w \in c} \frac{count(p,r,w)}{classes(w)}$。
  • '説明の排除'メカニズムにより、ある意味が強く証拠で支持されている場合、他の意味の事後確率が低下し、自然にあいまいさが解消される。
  • モデルは周辺確率推論を用いて、観測された目的語とそのWordNetにおける意味のクラスに基づき、動詞がどの語義クラスを選択するかを特定する。
  • システムの評価には、ブラウンコーパスからのResnikのベンチマークテストセット(手動で意味が付与された)が使用された。

実験結果

リサーチクエスチョン

  • RQ1ベイジアンネットワークは、未タグ付きコーパスを用いて、非教師ありの方法で動詞の選択性の好みを効果的にモデル化できるか?
  • RQ2ベイジアンネットワークの'説明の排除'特性は、選択性の好み学習における語の意味のあいまいさの解消にどのように寄与するか?
  • RQ3提案されたモデルは、選択性の好みの正確さの代理指標としての語の意味のあいまいさの解消タスクにおいて、既存の非教師ありシステムを上回るか?
  • RQ4訓練データ内の分布的情報(頻度など)は、モデルにどの程度の恩恵をもたらすか?
  • RQ5'説明の排除'メカニズムは、ベイジアンネットワーク以外の他のグラフィカルモデルにも一般化可能か?

主な発見

  • モデルはResnikのテストセットにおいて51.4%の語の意味のあいまいさの解消正答率を達成し、Resnikの44.3%およびAbneyとLightの42.3%を上回った。
  • 頻度カウントではなく、単に単語の存在/非存在のみを用いたにもかかわらず、最先端の非教師ありシステムを上回った。
  • 分布的情報(頻度カウント)を完全に統合してもモデルの性能が安定したため、データのスパarsity(スパarsity)に対して頑健であることが示された。
  • サンホセ・マーチャンダイズ・コーパスでは正答率が35.8%に低下したが、これはデータノイズの増加とより豊富な分布的統計の影響によるものと推定された。
  • '説明の排除'メカニズムは、ある意味が強く支持されている場合に、競合する意味の事後確率を低下させることで、あいまいさの解消に有効であった。
  • 著者らは、'説明の排除'がベイジアン推論の一般的性質であり、HMMに事前分布を導入したモデルなど、他のモデルにも実装可能かもしれないと提言している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。