Skip to main content
QUICK REVIEW

[論文レビュー] An Algorithm for Aligning Sentences in Bilingual Corpora Using Lexical Information

Akshar Bharati, V Sriram|ArXiv.org|Feb 12, 2003
Natural Language Processing Techniques参考文献 6被引用数 6
ひとこと要約

本稿では、文の長さに基づく統計的手法に依存せず、語彙的情報とヒューリスティックを活用することで、言語に依存しない文対応付けアルゴリズムを提示する。長さに基づく手法が失敗する状況においても対応付け精度を向上させるとともに、翻訳の追加や削除を検出でき、多様な言語対において競争力のある性能を達成する。

ABSTRACT

In this paper we describe an algorithm for aligning sentences with their translations in a bilingual corpus using lexical information of the languages. Existing efficient algorithms ignore word identities and consider only the sentence lengths (Brown, 1991; Gale and Church, 1993). For a sentence in the source language text, the proposed algorithm picks the most likely translation from the target language text using lexical information and certain heuristics. It does not do statistical analysis using sentence lengths. The algorithm is language independent. It also aids in detecting addition and deletion of text in translations. The algorithm gives comparable results with the existing algorithms in most of the cases while it does better in cases where statistical algorithms do not give good results.

研究の動機と目的

  • 文の長さ統計に依存せず、語彙的情報を用いる言語に依存しない文対応付け手法の開発。
  • 統計的長さベースのアルゴリズムが性能を発揮できない状況での対応付け精度の向上。
  • 対応付けプロセス中に翻訳の追加や削除を検出すること。
  • 文の長さの統計的分析を必要としない、頑健でヒューリスティック駆動のアプローチを提供すること。
  • 既存のアルゴリズムと同等の性能を達成するとともに、エッジケースにおいてより優れた結果を提供すること。

提案手法

  • アルゴリズムは、語彙的類似性と事前に定義されたヒューリスティックに基づいて、各ソース文に対して最も可能性の高い翻訳を選択する。
  • ソース言語およびターゲット言語の両方の語彙的情報を用いて、対応付けスコアを計算する。
  • 複数のターゲット文が類似する語彙的マッチを持つ場合の曖昧性を解消するためにヒューリスティックを適用する。
  • 文の長さの統計的モデリングを回避しており、Brown (1991) や Gale and Church (1993) のような先行手法とは差別化される。
  • 反復的に対応付けを実行し、語彙的整合性と文脈的手がかりを用いてマッチングを改善する。
  • 翻訳中の追加や削除を検出し、フラグを立てるメカニズムを統合する。

実験結果

リサーチクエスチョン

  • RQ1文の長さ統計に依存せずに、二言語コーパスにおける文対応付けをどのように改善できるか?
  • RQ2長さベースの手法と比較して、語彙的情報はどのように対応付け精度を向上させるか?
  • RQ3言語に依存しない対応付けアルゴリズムは、翻訳の追加や削除を効果的に検出できるか?
  • RQ4統計的対応付けアルゴリズムが失敗する状況において、提案手法の性能はいかがなものか?
  • RQ5対応付けの過程で曖昧な語彙的マッチを解消するために、ヒューリスティックはどのような役割を果たすか?

主な発見

  • アルゴリズムは、大多数の標準的なケースにおいて、既存の統計的手法と同等の対応付け性能を達成する。
  • 非平行な文構造や異なった翻訳スタイルを含む状況では、長さベースの手法よりも顕著に優れた性能を示す。
  • 翻訳の追加や削減を効果的に検出でき、純粋に統計的手法に依存する手法に比べて大きな利点を有する。
  • 語彙的情報の活用により、リソースが少ない言語対や屈折語の対でも、より良い対応付けが可能になる。
  • 言語に依存しない設計のおかげで、多様な言語対において頑健な性能を示す。
  • International Conference on Natural Language Processing 2002 の実験結果から、特に困難な対応付けケースにおいて優れた性能が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。