Skip to main content
QUICK REVIEW

[論文レビュー] Extracting a bilingual semantic grammar from FrameNet-annotated corpora

Dana Dannélls, Normunds Grūzītis|arXiv (Cornell University)|Apr 8, 2014
Natural Language Processing Techniques参考文献 9被引用数 9
ひとこと要約

本論文は、文法的フレームワーク(GF)を用いて、英語およびスウェーデン語のFrameNetアノテートコーパスから、共有された二か国語の意味的文法を自動で抽出する手法を提示する。バークリーFrameNetとスウェーデン語FrameNetの間で意味的および構文的従属パターンを対応付けることで、769のフレーム固有のパターンを含むコンactな抽象構文を導出し、共有フレームセット内の英語例の77.8%およびスウェーデン語例の74.9%をカバーする。これにより、統一された意味的文法インタフェースを備えたマルチリンガルNLPアプリケーションが可能になる。

ABSTRACT

We present the creation of an English-Swedish FrameNet-based grammar in Grammatical Framework. The aim of this research is to make existing framenets computationally accessible for multilingual natural language applications via a common semantic grammar API, and to facilitate the porting of such grammar to other languages. In this paper, we describe the abstract syntax of the semantic grammar while focusing on its automatic extraction possibilities. We have extracted a shared abstract syntax from ~58,500 annotated sentences in Berkeley FrameNet (BFN) and ~3,500 annotated sentences in Swedish FrameNet (SweFN). The abstract syntax defines 769 frame-specific valence patterns that cover 77.8% examples in BFN and 74.9% in SweFN belonging to the shared set of 471 frames. As a side result, we provide a unified method for comparing semantic and syntactic valence patterns across framenets.

研究の動機と目的

  • 既存のFrameNetリソースから計算的にアクセス可能なマルチリンガル意味的文法を構築し、自然言語生成およびその他のNLPアプリケーションを支援すること。
  • 言語間の共通抽象構文を抽出することで、文法レベルでのマルチリンガルFrameNetsの統合を可能にすること。
  • 意味的および構文的従属パターンを体系的かつ自動的に比較する手法を開発すること。
  • 追加言語および構文的構造への文法の拡張の基盤を提供すること。
  • 二か国語間のパターン比較を通じて不適切にアノテートされた例を特定することで、FrameNetアノテーションの整合性と品質を向上させること。

提案手法

  • 著者は、英語およびスウェーデン語のFrameNet用に共通の抽象構文をGFで定義し、フレーム固有の従属パターンを意味的および構文的引数を持つ関数としてモデル化する。
  • バークリーFrameNetの約58,500文およびスウェーデン語FrameNetの約3,500文から、コアフレーム要素およびその構文的実現を焦点として意味的・構文的従属パターンを抽出する。
  • パターンの言語間比較に、曖昧なマッチング戦略を適用し、包含に基づく一般化を可能にし、重複を低減する。
  • 意味的および構文的パターンの共通部分を計算し、包含されるパターンを除去することで、最小限で代表的な769の共有従属パターンの集合を生成する。
  • 文法設計では、非コアフレーム要素に対して空の引数を許容することで、並記や多様な構文的実現のカバーが可能になる。
  • 段階的なパターン対応付けを通じて、従属節や動名詞などの追加言語および構文的タイプへの拡張が可能になる。

実験結果

リサーチクエスチョン

  • RQ1二か国語のFrameNetアノテートコーパスから、マルチリンガルNLPアプリケーションを支援する共有抽象構文を自動で抽出できるか?
  • RQ2曖昧なパターンマッチングは、英語およびスウェーデン語のFrameNet間で意味的および構文的従属パターンを対応付けるのにどの程度有効か?
  • RQ3抽出された文法は、両方のFrameNetコーパスの例をどの程度カバーするか。また、カバレッジの上限は何か?
  • RQ4構文的変異の組み込みがカバレッジに与える影響は何か。また、正確性と包括性のトレードオフは何か?
  • RQ5二か国語間のパターン比較を通じて、FrameNetアノテーションの不整合や誤りを同定できるか?

主な発見

  • 抽出された抽象構文は、769の共有意味的・構文的従属パターンから構成され、共有フレームセット内の英語FrameNet例の77.8%およびスウェーデン語FrameNet例の74.9%をカバーする。
  • コンactな表現で高いカバレッジを達成しており、少数のパターンで多数の言語間従属パターンを捉えることができることを示している。
  • 曖昧マッチングにより、意味的タイプでは10%、意味的・構文的タイプでは17%のカバレッジ向上が見られ、フレームカバレッジにもわずかな向上が見られた。
  • 共有フレームのみを用いた場合のカバレッジ上限は、英語で93.4%、スウェーデン語で78%であり、大多数の例が共有意味フレームワークで既にカバーされていることが示唆される。
  • パターン不一致解析を通じて、両方のFrameNetで不適切にアノテートされた例を効果的に同定でき、コーパス品質評価の向上に寄与した。
  • 文法は強固で拡張可能であり、非コアフレーム要素を追加しても最小限の拡張で済む。今後の追加言語および構文的構造への拡張をサポートする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。