Skip to main content
QUICK REVIEW

[論文レビュー] Extraction of semantic relations from a Basque monolingual dictionary using Constraint Grammar

Eneko Agirre, Olatz Ansa|ArXiv.org|Oct 17, 2000
Natural Language Processing Techniques参考文献 8被引用数 9
ひとこと要約

本稿では、バスク語単語帳から類義関係、対義関係、上位下位関係、語彙的派生関係といった意味関係を準自動的に抽出する制約文法ベースの手法を提示する。語形素解析と表層構文解析を組み合わせることで、動詞の定義に対して92.2%のカバレッジを達成し、42,533件の関係を抽出、誤り率はたったの2.2%にとどまり、バスク語語彙的データベースの大幅な向上を実現した。

ABSTRACT

This paper deals with the exploitation of dictionaries for the semi-automatic construction of lexicons and lexical knowledge bases. The final goal of our research is to enrich the Basque Lexical Database with semantic information such as senses, definitions, semantic relations, etc., extracted from a Basque monolingual dictionary. The work here presented focuses on the extraction of the semantic relations that best characterise the headword, that is, those of synonymy, antonymy, hypernymy, and other relations marked by specific relators and derivation. All nominal, verbal and adjectival entries were treated. Basque uses morphological inflection to mark case, and therefore semantic relations have to be inferred from suffixes rather than from prepositions. Our approach combines a morphological analyser and surface syntax parsing (based on Constraint Grammar), and has proven very successful for highly inflected languages such as Basque. Both the effort to write the rules and the actual processing time of the dictionary have been very low. At present we have extracted 42,533 relations, leaving only 2,943 (9%) definitions without any extracted relation. The error rate is extremely low, as only 2.2% of the extracted relations are wrong.

研究の動機と目的

  • 語の意味、定義、意味関係といった意味情報を含めてバスク語語彙的データベース(EDBL)を拡充すること。
  • バスク語のような高い屈折性を持つ言語に対応できるスケーラブルで低負荷の意味関係抽出手法を開発すること。
  • 単言語語彙帳を出発点として自動的に語彙的知識ベースを構築することを可能にすること。
  • 関連語(例:類義語、上位語、語幹からの派生形)を構造的にリンクさせることで、語彙帳の使いやすさを向上させること。
  • 向上した語彙的リソースを通じて、将来的なバスク語自然言語処理タスクを支援すること。

提案手法

  • TEIガイドラインに従ってエントリを構造化するため、Definite Clause Grammarを用いてEuskal Hiztegia語彙帳を解析する。
  • MORFEUSを用いて、定義内の語形素をトークン化および語形素的タグ付けする。
  • 表層構文解析のための制約文法を用い、意味関係を示す文法的パターンを特定する。
  • 関係を3種類に分類する:類義関係、上位下位関係(種差パターンにより)、特定の関係語で示される関係。
  • 語幹との派生関係を処理するため、語幹を示す派生接尾語を同定する。
  • 名詞、動詞、形容詞の定義について、手動によるサンプリングと誤り分析を通じて結果の妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1表層構文的パターンを用いて、バスク語単語帳から意味関係を信頼性高く抽出する方法は何か?
  • RQ2制約文法と語形素解析は、バスク語の高い屈折的複雑性をどの程度処理できるか?
  • RQ3バスク語の品詞ごに応じて、関係抽出のカバレッジと正確性はどの程度か?
  • RQ4語幹と派生語の間の派生関係を同定する際、この手法はどの程度効果的か?
  • RQ5このアプローチは、最小限の手作業で大規模な語彙的データベースを拡充するためにスケーラブルか?

主な発見

  • システムはバスク語単語帳から42,533件の意味関係を抽出したが、抽出不能の定義は9%(2.943件)にとどまった。
  • 全体の誤り率は低く、2.2%にとどまり、動詞関係抽出では93.6%のカバレッジとたった0.8%の誤り率を達成した。
  • 名詞関係では、抽出された関係の95.0%が正しく、誤り率は0.0%であった。
  • 上位下位関係抽出では92.3%のカバレッジと1.4%の誤り率を達成し、種差パターンへの強い適応性が示された。
  • 派生関係抽出ではカバレッジが低く、92個のサンプル化された派生語のうち47個しか正しく処理されなかったが、主に語彙データベース内の派生接尾語カバー範囲の不足が原因であった。
  • この手法は非常に効率的であり、バスク語の語形素的複雑性にもかかわらず、ルール開発や処理時間の最小限に抑えられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。