Skip to main content
QUICK REVIEW

[論文レビュー] Data-Oriented Language Processing. An Overview

Rens Bod, Remko Scha|UvA-DARE (University of Amsterdam)|Nov 14, 1996
Natural Language Processing Techniques参考文献 45被引用数 5
ひとこと要約

この論文は、文法的規則ではなく、コーパスからの具体的な言語例の統計的分析を通じて人間の言語理解をモデル化する、データ指向処理(DOP)という言語処理アプローチを紹介する。この手法は、ラベル付き句構造木のコーパスから抽出した断片を組み合わせて構文解析を構築し、断片の頻度を用いて最も確率の高い解釈を選択することで、ルールベースの解析のデータ駆動型代替手段を提供する。この手法はコーパス言語学の強固な経験的基盤を持つ。

ABSTRACT

During the last few years, a new approach to language processing has started to emerge, which has become known under various labels such as "data-oriented parsing", "corpus-based interpretation", and "tree-bank grammar" (cf. van den Berg et al. 1994; Bod 1992-96; Bod et al. 1996a/b; Bonnema 1996; Charniak 1996a/b; Goodman 1996; Kaplan 1996; Rajman 1995a/b; Scha 1990-92; Sekine & Grishman 1995; Sima'an et al. 1994; Sima'an 1995-96; Tugwell 1995). This approach, which we will call "data-oriented processing" or "DOP", embodies the assumption that human language perception and production works with representations of concrete past language experiences, rather than with abstract linguistic rules. The models that instantiate this approach therefore maintain large corpora of linguistic representations of previously occurring utterances. When processing a new input utterance, analyses of this utterance are constructed by combining fragments from the corpus; the occurrence-frequencies of the fragments are used to estimate which analysis is the most probable one. In this paper we give an in-depth discussion of a data-oriented processing model which employs a corpus of labelled phrase-structure trees. Then we review some other models that instantiate the DOP approach. Many of these models also employ labelled phrase-structure trees, but use different criteria for extracting fragments from the corpus or employ different disambiguation strategies (Bod 1996b; Charniak 1996a/b; Goodman 1996; Rajman 1995a/b; Sekine & Grishman 1995; Sima'an 1995-96); other models use richer formalisms for their corpus annotations (van den Berg et al. 1994; Bod et al., 1996a/b; Bonnema 1996; Kaplan 1996; Tugwell 1995).

研究の動機と目的

  • 手書きの文法的規則ではなく、具体的な言語経験から導かれる言語的知識を扱う、データ指向言語処理の形式的枠組みを提示すること。
  • 手動で定義された文法的規則に依存しない解析の限界を克服し、アノテート済みコーパスからの統計的パターンに根ざした構文解析を実現すること。
  • 断片の再利用と確率的選択を強調することで、多様なコーパスベースのアプローチを統一する共通の理論的モデルを確立すること。
  • ラベル付き木バンクが、強固でスケーラブルな言語処理システムの基盤として機能できることを示すこと。

提案手法

  • モデルは、構文解析の主なデータソースとして、ラベル付き句構造木のコーパスを用いる。
  • コーパスから抽出した部分構造(断片)を組み合わせることで新たな解析を構築し、その構造的および分布的性質を保持する。
  • 断片の確率は、コーパス内での観察頻度に基づいて推定され、最も可能性の高い解析の確率的選択を可能にする。
  • 構文構造の階層的分解を採用し、部分木を再結合のための基本的単位として扱う。
  • 手動で作成された文法的規則の必要性を回避するため、統計的学習とコーパス言語学の原則を統合する。
  • より頻度の高い断片の組み合わせを優先することで、意味の曖昧性を解消する。これは人間の言語処理傾向と整合する。

実験結果

リサーチクエスチョン

  • RQ1手動で定義された文法的規則に依存せずに、どのように構文解析を実行できるか?
  • RQ2コーパス頻度は、与えられた入力に対して最も妥当な構文構造を選択する上で、果たす役割は何か?
  • RQ3断片の再利用という共通の原則を用いて、多様なコーパスベースの解析手法を統一する枠組みを確立できるか?
  • RQ4断片ベースのモデルは、従来のルールベースのシステムと比較して、正確性と頑健性の面でどのように異なるか?
  • RQ5信頼できるデータ指向解析を可能にするために、ラベル付き木のコーパスが満たすべき形式的性質は何か?

主な発見

  • DOPフレームワークは、断片の再結合というプロセスとして言語理解をモデル化することで、ルールベースの解析に対する原理的でコーパスベースの代替手段を提供する。
  • コーパス内での断片頻度は、構文解析の確率を推定する信頼できる指標となり、効果的な意味の曖昧性解消を可能にする。
  • このアプローチは、木バンク文法やデータ指向解析を含む、さまざまなコーパスベースの解析技術を、共通の理論的枠組みで統合する。
  • 複数のモデルによる実験的結果から、DOPベースのシステムが、アノテート済みコーパスのみを用いても、構文解析タスクで競争力のある性能を達成することが示された。
  • モデルは、明示的な規則のエンコードなしに、実際の言語データ内の統計的パターンから人間と同様の言語処理が生じうることを示している。
  • フレームワークは段階的かつ類似する処理をサポートしており、リアルタイムおよびインタラクティブな言語システムに適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。