Skip to main content
QUICK REVIEW

[論文レビュー] Probabilistic Parsing Using Left Corner Language Models

Christopher D. Manning, Bob Carpenter|arXiv (Cornell University)|Nov 17, 1997
Natural Language Processing Techniques参考文献 16被引用数 5
ひとこと要約

この論文は、上位から下位の目標と下位から上位の導出の両方に条件づけられた規則確率を用いることで、精度を向上させるための確率的パーサフレームワークを導入する。Wall Street JournalのPenn Treebankデータを用いた評価では、標準的なトップダウン確率的文法よりも優れた性能を示すが、データセットの平坦な括弧構造および文法の過剰生成・不足生成の問題により、ベンチマークとしての有効性が制限されている。

ABSTRACT

We introduce a novel parser based on a probabilistic version of a left-corner parser. The left-corner strategy is attractive because rule probabilities can be conditioned on both top-down goals and bottom-up derivations. We develop the underlying theory and explain how a grammar can be induced from analyzed data. We show that the left-corner approach provides an advantage over simple top-down probabilistic context-free grammars in parsing the Wall Street Journal using a grammar induced from the Penn Treebank. We also conclude that the Penn Treebank provides a fairly weak testbed due to the flatness of its bracketings and to the obvious overgeneration and undergeneration of its induced grammar.

研究の動機と目的

  • 上位から下位と下位から上位の推論を組み合わせた、より良い言語モデル化を実現する確率的パーサアプローチの開発。
  • 規則の確率を上位からの目標と導出結果の両方に条件づけることで、パーサの精度が向上するかどうかの調査。
  • 提案されたパーサの性能をPenn Treebankの現実世界の構文データに対して評価すること。
  • Penn Treebankがパーサモデルの評価に用いるためのテストベッドとしての限界を評価すること。

提案手法

  • パーサは左コーナー戦略を用い、各規則適用は上位からの目標(予測されるカテゴリ)と下位からの導出(すでにパースされた構成要素)によって導かれる。
  • 規則の確率は、予測されたカテゴリと到達済みの実際の構成要素の両方に条件づけられ、確率推定におけるより豊かな文脈が可能になる。
  • 観察された左コーナー導出に基づく最尤推定を用いて、パース済みデータから文法を誘導する。
  • トップダウンの仮説生成とボトムアップの検証を統合することで、曖昧さが低減され、パーサの意思決定が改善される。
  • 従来の確率的文法に加え、パーサの両方向からの構造的制約を組み込むことで、伝統的な確率的文法を拡張する。

実験結果

リサーチクエスチョン

  • RQ1上位からの目標と下位からの導出の両方に条件づけた規則確率が、パーサの精度向上に寄与するか。
  • RQ2現実世界のテキストにおいて、左コーナーパーサ戦略は標準的なトップダウン確率的文法と比べてどのように異なるか。
  • RQ3Penn Treebankの括弧構造が、パーサモデルの評価をどの程度制限するか。
  • RQ4Penn Treebankから誘導された文法は顕著な過剰生成や不足生成を示すか。

主な発見

  • 左コーナーパーサはWall Street Journalコーパスにおいて、標準的なトップダウン確率的文法を上回る性能を示した。
  • その改善は、上位と下位の両方の情報に基づいた、より豊かな規則確率の条件づけに起因する。
  • 平坦な括弧構造のため、Penn Treebankは構造的正確性の評価が困難であるため、弱いテストベッドであると判明した。
  • 誘導された文法には過剰生成と不足生成の両方が見られ、訓練データの代表性の限界を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。