Skip to main content
QUICK REVIEW

[論文レビュー] Cross-Language Information Retrieval for Technical Documents

Atsushi Fujii, Tetsuya Ishikawa|ArXiv.org|Jul 6, 1999
Natural Language Processing Techniques参考文献 13被引用数 14
ひとこと要約

本稿では、語の合成語翻訳と発音表記を用いてクエリ翻訳を改善する、技術文書向けの日本語/英語クロスラングエージュアル情報検索(CLIR)システムを提示する。基本語の確率的翻訳と、カタカナ表記の借用語に対する表層的マッピングを組み合わせることで、単一言語検索と同等のCLIR性能を達成し、日本語-日本語IRに対するF1スコアは1.04倍に達する。

ABSTRACT

This paper proposes a Japanese/English cross-language information retrieval (CLIR) system targeting technical documents. Our system first translates a given query containing technical terms into the target language, and then retrieves documents relevant to the translated query. The translation of technical terms is still problematic in that technical terms are often compound words, and thus new terms can be progressively created simply by combining existing base words. In addition, Japanese often represents loanwords based on its phonogram. Consequently, existing dictionaries find it difficult to achieve sufficient coverage. To counter the first problem, we use a compound word translation method, which uses a bilingual dictionary for base words and collocational statistics to resolve translation ambiguity. For the second problem, we propose a transliteration method, which identifies phonetic equivalents in the target language. We also show the effectiveness of our system using a test collection for CLIR.

研究の動機と目的

  • 日本語と英語の間で技術用語を翻訳する課題に取り組むこと、特に技術用語の合成語や借用語に対応できない既存の二国語辞書の限界を克服すること。
  • 合成語翻訳と発音表記を統合した堅牢なCLIRフレームワークを構築し、検索精度を向上させること。
  • NACSISテストコレクションを用いて、部品レベルおよび全体のシステム性能に焦点を当てて評価すること。
  • 合成語翻訳と発音表記の組み合わせが、ベースライン手法に比べてCLIR効果を顕著に向上させることを実証すること。

提案手法

  • 基本語のための二国語辞書と語の連接統計を用いて、合成語における翻訳の曖昧さを解消する。
  • ターゲット言語における共起頻度に基づき、合成語の最も可能性の高い翻訳を選択する確率的手法を適用する。
  • 音声的類似性に基づいて英文字を日本語カタカナに変換する表層的発音表記技術を実装し、複雑な音素体系を避ける。
  • 翻訳モジュールを単一言語IRエンジンと統合し、クエリ翻訳を主な検索戦略として用いる。
  • 日本語クエリと技術論文の二国語要約を含むNACSISテストコレクションを評価に用いる。
  • 標準的なTREC評価指標(リcall-precision曲線と11ポイント平均精度)を用いて、システム性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1確率的合成語翻訳手法は、ベースラインの辞書検索に比べて、技術文書向けCLIR性能を向上させることができるか?
  • RQ2カタカナ表記の借用語の発音表記は、日本語-英語CLIRにおける検索効果をどの程度向上させるか?
  • RQ3合成語翻訳と発音表記の組み合わせが、全体のCLIRシステム性能に与える影響は何か?
  • RQ4提案されたCLIRシステムは、日本語-日本語単一言語IRと比較して、検索効果にどの程度近いか?
  • RQ5発音表記によって生成されたクエリバージョンを用いた場合、ドキュメント内のスペルミスに対してもシステムは頑健であるか?

主な発見

  • 合成語翻訳手法(CWT)は、日本語-日本語単一言語システムの平均精度の94.6%を達成し、ベースライン手法を顕著に上回った。
  • 発音表記により、検索性能が単一言語ベースラインの94.6%まで向上し、CWT手法単体の性能と同等となった。
  • CWTと発音表記を組み合わせた場合、単一言語システムに対するF1スコアが1.04倍に達し、ほぼ同等の性能を示した。
  • システムはスペルミスに対しても頑健であった。発音表記により、'reduction' → 'riduction' や 'redaction' といった複数の妥当なバリエーションが生成され、ドキュメント語と一致した。
  • 未登録のカタカナ語をすべて無視する制御ケースでは、単一言語システムの平均精度の56.4%にとどまり、発音表記の重要性が浮き彫りになった。
  • 結果から、合成語翻訳と発音表記は、技術文書向けCLIRにおいて有効かつ補完的な要素であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。