Skip to main content
QUICK REVIEW

[論文レビュー] Japanese-Spanish Thesaurus Construction Using English as a Pivot

Jessica C. Ramírez, Masayuki Asahara|arXiv (Cornell University)|Mar 6, 2013
Natural Language Processing Techniques参考文献 7被引用数 9
ひとこと要約

本稿では、英語をピボット言語として用い、Wikipediaの翻訳ペアとWordNetを活用して意味の曖昧さを解消することで、自動的に多言語の日本語・スペイン語・英語の類義語辞書を構築する手法を提示する。ベクトル空間モデルとWikipediaのカテゴリ情報の組み合わせにより、高品質な対応付けが達成され、25,375件のエントリを含む類義語辞書が得られ、低リソース言語対における機械翻訳などの自然言語処理タスクの向上に寄与する。

ABSTRACT

We present the results of research with the goal of automatically creating a multilingual thesaurus based on the freely available resources of Wikipedia and WordNet. Our goal is to increase resources for natural language processing tasks such as machine translation targeting the Japanese-Spanish language pair. Given the scarcity of resources, we use existing English resources as a pivot for creating a trilingual Japanese-Spanish-English thesaurus. Our approach consists of extracting the translation tuples from Wikipedia, disambiguating them by mapping them to WordNet word senses. We present results comparing two methods of disambiguation, the first using VSM on Wikipedia article texts and WordNet definitions, and the second using categorical information extracted from Wikipedia, We find that mixing the two methods produces favorable results. Using the proposed method, we have constructed a multilingual Spanish-Japanese-English thesaurus consisting of 25,375 entries. The same method can be applied to any pair of languages that are linked to English in Wikipedia.

研究の動機と目的

  • 日本語・スペイン語向けの多言語リソースの不足に取り組むこと。
  • 自由に利用可能なリソースを活用して、三か国語の類義語辞書を自動的に構築する手法を開発すること。
  • 英語をピボット言語として活用することで、日本語とスペイン語の翻訳品質と意味的整合性を向上させること。
  • Wikipediaのテキストとカテゴリメタデータを用いて、意味の曖昧さ解消手法を評価・比較すること。
  • Wikipediaにおける英語を介して接続される任意の言語対に適用可能な再利用可能なフレームワークを生み出すこと。

提案手法

  • 多言語Wikipediaページから翻訳ペアを抽出し、潜在的な日本語・スペイン語語彙対を特定する。
  • 各語彙対をWordNetの意味にマッピングすることで、意味の曖昧さを解消する。
  • Wikipediaの記事テキストとWordNetの定義にベクトル空間モデル(VSM)を適用し、意味的類似度を計算することで意味の曖昧さ解消を行う。
  • Wikipediaのカテゴリリンク(例:カテゴリリンク)などのカテゴリ情報を取り入れ、意味の曖昧さ解消の精度を向上させる。
  • VSMベースとカテゴリベースの意味の曖昧さ解消結果をハイブリッドアプローチで統合し、全体のパフォーマンスを向上させる。
  • 妥当性が確認され、意味が整合した日本語・スペイン語語彙対とその英語同等語を統合することで、最終的な類義語辞書を構築する。

実験結果

リサーチクエスチョン

  • RQ1直接的なリソースが乏しい状況下でも、英語を効果的にピボット言語として用いて日本語・スペイン語の類義語辞書を構築できるか?
  • RQ2VSMベースとカテゴリベースの意味の曖昧さ解消手法は、日本語とスペイン語語彙を英語のWordNetの意味に一致させる際に、どのように比較されるか?
  • RQ3VSMとカテゴリ情報の組み合わせは、単独で使用する場合よりも優れた意味の曖昧さ解消結果をもたらすか?
  • RQ4得られた多言語類義語辞書のスケーラビリティと品質(サイズと意味的正確性)はいかがなものか?
  • RQ5提案手法は、Wikipediaにおける英語を介して接続される他の言語対に対しても一般化可能か?

主な発見

  • VSMとWikipediaのカテゴリ情報の両方を組み合わせたハイブリッド意味の曖昧さ解消手法は、単独で使用するいずれの手法よりも優れた意味の曖昧さ解消性能を示した。
  • 最終的な類義語辞書には25,375件の妥当で意味が整合したエントリが含まれており、大規模な多言語類義語辞書の構築が可能であることを示している。
  • Wikipediaを翻訳ペアのソースとして用いることで、スケールに応じた多言語語彙関係の自動抽出が可能になった。
  • WordNetに基づく意味マッピングにより、語彙の曖昧さを解消することで、多言語間語彙対応の精度が著しく向上した。
  • 本手法は、直接的な多言語リソースが限られる低リソース言語対(例:日本語・スペイン語)に対しても有効であることが実証された。
  • このフレームワークは一般化可能であり、Wikipediaを通じて英語に接続される任意の言語対に適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。