Skip to main content
QUICK REVIEW

[論文レビュー] A Probabilistic Translation Method for Dictionary-based Cross-lingual Information Retrieval in Agglutinative Languages

Javid Dadashkarimi, Azadeh Shakery|arXiv (Cornell University)|Nov 4, 2014
Natural Language Processing Techniques参考文献 23被引用数 6
ひとこと要約

本稿では、アラビア語に類似した語形屈曲語であるペルシャ語のような言語における、語彙ベースの対訳情報検索(CLIR)のための確率的翻訳手法MESCを提案する。単語の変形形を、単語の最小編集距離と単語頻度に基づく確率的モデルを用いて、単語語彙の単語語彙から生成することで、翻訳の正確性を向上させ、英語-ペルシャ語CLIRタスクにおいて、先行手法を著しく上回る結果を得た。

ABSTRACT

Translation ambiguity, out of vocabulary words and missing some translations in bilingual dictionaries make dictionary-based Cross-language Information Retrieval (CLIR) a challenging task. Moreover, in agglutinative languages which do not have reliable stemmers, missing various lexical formations in bilingual dictionaries degrades CLIR performance. This paper aims to introduce a probabilistic translation model to solve the ambiguity problem, and also to provide most likely formations of a dictionary candidate. We propose Minimum Edit Support Candidates (MESC) method that exploits a monolingual corpus and a bilingual dictionary to translate users' native language queries to documents' language. Our experiments show that the proposed method outperforms state-of-the-art dictionary-based English-Persian CLIR.

研究の動機と目的

  • 語彙ベースのCLIRにおける語形の曖昧さと語彙外語(OOV)問題に対処すること。
  • ペルシャ語のような語形屈曲語において、語幹抽出器が信頼できないため、対訳語彙に完全な屈曲形が欠落している問題を克服すること。
  • 単語語彙と編集距離を用いて、語彙の妥当な語形変形を生成することで、CLIRの性能を向上させること。
  • クエリ語の文脈を活用して翻訳をより的確にランク付けするための確率的候補選択モデルを開発すること。
  • 低品質な翻訳を選択することで生じるスワーピング効果を低減するため、ビグラム確率とサポート候補を統合すること。

提案手法

  • Levenshtein距離を用いて、単語語彙の語彙に最も近い単語語彙の語彙を最小編集操作で特定することで、候補語形を生成する。
  • 最小編集距離を用いて、単語語彙に近い語彙を単語語彙から特定することで、最小編集サポート候補(MESC)を構築する。
  • 語彙外語(OOV)語に対処するため、ルールベースの表音変換器を用い、非ラテン文字を最も近い音声的同等物に変換する。
  • 候補翻訳のビグラム頻度に基づく確率的翻訳モデルを構築し、文脈的に適切な語彙を選択する。
  • MESCモデルをINQUERY情報検索システムに統合し、エンドツーエンドのCLIR評価を実施する。
  • 多様な候補生成を保証するため、高カバレッジの対訳語彙を用い、ランク付けや事前の選択とは独立して運用する。

実験結果

リサーチクエスチョン

  • RQ1最小編集距離と単語語彙を用いた確率的手法が、語形屈曲語における語彙ベースのCLIRの翻訳正確性を向上させることができるか。
  • RQ2編集距離によって生成されたサポート候補が、どれほど曖昧さを低減し、検索性能を向上させることができるか。
  • RQ3ビグラム確率の統合が、文脈に応じた最適な翻訳選択をどのように向上させるか。
  • RQ4MESC手法が、英語-ペルシャ語CLIRにおいて、INQUERY やランクベースのアプローチといった既存の語彙ベースのCLIRシステムを上回るか。
  • RQ5欠落した翻訳とフレーズレベルの複雑さがMESCの性能に与える影響は何か。また、この手法はこれらの問題を緩和できるか。

主な発見

  • CLEF 2008データセットにおいて、MESCは平均平均精度(MAP)0.4449を達成し、ペルシャ語語彙ベースライン比で25.7%の改善を示した。
  • CLEF 2009では、MAPが0.407に達し、ペルシャ語語彙ベースライン比で6.1%の改善を示したが、一部のトピックでは低い改善幅であった。
  • テストされたすべての語彙に対して、INQUERYシステムを上回るMAPを達成し、CLEF 2008のペルシャ語語彙で最高で+25.7%の改善を記録した。
  • MESCのPrecision@5およびPrecision@10は、特にCLEF 2008において、ベースライン手法より一貫して高く、順位付けの質の向上を示した。
  • MESCは語形変化の処理において頑健であり、支持候補を生成する能力のおかげで、欠落した屈曲形の影響を著しく低減した。
  • 「rail」を「râh-âhn」として複数部品に分けるような多部品翻訳の処理に限界はあったが、効果的なビグラムモデリングと候補選択のおかげで、MESCの性能は依然として高く維持された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。