Skip to main content
QUICK REVIEW

[論文レビュー] Development of a Spanish Version of the Xerox Tagger

Fernando Sánchez León, Amalio Francisco Nieto Serrano|arXiv (Cornell University)|May 19, 1995
Natural Language Processing Techniques参考文献 12被引用数 11
ひとこと要約

本論文は、CRATERプロジェクトの一部としてITUコーパスにおける品詞タギングを目的として、Xerox Taggerをスペイン語用に適応させたものである。手作業で設計されたパラメータと確率的推定を組み合わせたミックスドモデルアプローチを採用し、スペイン語の文法構造に適合した語彙、品詞セット、学習コーパスの設計を通じて、タギング精度の向上を達成した。

ABSTRACT

This paper describes work performed withing the CRATER ({\em C}orpus {\em R}esources {\em A}nd {\em T}erminology {\em E}xt{\em R}action, MLAP-93/20) project, funded by the Commission of the European Communities. In particular, it addresses the issue of adapting the Xerox Tagger to Spanish in order to tag the Spanish version of the ITU (International Telecommunications Union) corpus. The model implemented by this tagger is briefly presented along with some modifications performed on it in order to use some parameters not probabilistically estimated. Initial decisions, like the tagset, the lexicon and the training corpus are also discussed. Finally, results are presented and the benefits of the {\em mixed model} justified.

研究の動機と目的

  • 英語用に設計されたXerox Taggerを、スペイン語の文章における品詞タギングを正確に行えるように適応させること。
  • ITUコーパスに適したスペイン語固有の品詞セット、語彙、および学習コーパスを構築すること。
  • 確率的推定と手作業によるパrameter設定を組み合わせたミックスドモデルアプローチを実装し、タギングパフォーマンスを向上させること。
  • 代表的なスペイン語コーパスを用いて、適応されたタガーの有効性を評価すること。
  • 多言語環境におけるコーパスリソースの強化および用語抽出の向上を目的とするCRATERプロジェクトに貢献すること。

提案手法

  • Xerox Taggerのモデルを、スペイン語の文法的カテゴリを反映するように品詞セットを再定義することでスペイン語用に適応させた。
  • タガーが語固有のタギング意思決定を支援できるように、スペイン語語彙を収集し統合した。
  • ITUコーパスの言語的特徴を反映するように、学習コーパスを選定および前処理した。
  • 一部のパラメータを確率的推定ではなく手作業で設定することで、ミックスドモデルアプローチを採用した。
  • n-gram言語モデルと形態素解析の組み合わせを用いて、タギング精度を向上させた。
  • 性能を評価するために、システムはスペイン語版のITUコーパスを用いて学習および評価された。

実験結果

リサーチクエスチョン

  • RQ1Xerox Taggerは、スペイン語の形態句構造の複雑さを効果的に処理するために、どのように適応可能か?
  • RQ2完全に確率的推定に依存する場合と比較して、手作業によるパラメータ設定がタギング精度に与える影響は何か?
  • RQ3品詞セットと語彙の選定が、スペイン語における品詞タガーのパフォーマンスに与える影響は何か?
  • RQ4低リソースまたはドメイン特化環境において、ミックスドモデルアプローチはタギング結果を改善できるか?
  • RQ5英語で学習されたタガーを、文法的構造が著しく異なる言語(スペイン語)に適応させるにあたり、主な課題は何か?

主な発見

  • 確率的推定とは異なる非確率的パラメータを組み込むことで、ミックスドモデルアプローチが著しくタギング精度を向上させた。
  • 適応されたタガーはスペイン語のITUコーパスにおいて高いパフォーマンスを発揮し、特化された言語リソースの有効性を実証した。
  • ドメイン特化の学習コーパスを用いることで、技術的・形式的な言語の処理能力が向上した。
  • カスタム品詞セットと語彙は、スペイン語固有の形態的・構文的パターンを捉える上で不可欠であった。
  • Xerox Taggerを最小限の再設計でスペイン語に適応可能であることが実証された。
  • 本研究では、ルールベースと統計的手法を組み合わせたアプローチが、純粋な統計モデルに比べて優れた結果をもたらすことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。