Skip to main content
QUICK REVIEW

[論文レビュー] Multilingual person name recognition and transliteration

Bruno Pouliquen, Ralf Steinberger|ArXiv.org|Sep 11, 2006
Authorship Attribution and Profiling参考文献 5被引用数 5
ひとこと要約

本稿では、多言語ニュースから人名を抽出し、ラテン文字、キリル文字、ギリシャ文字、アラビア文字などの異なるスクリプト間で同一人物を示す名前のバリエーションを照合し、共起性に基づいて関係を推定する多言語名認識および表記変換システムを提示する。本システムは、従来の二国語表記変換に依存せず、内部で標準名表現を用いることで、NewsExplorerニュース分析システムにおけるスケーラブルな名前照合を可能にし、1日あたり25,000件の記事を複数言語でクラスタリングしている。

ABSTRACT

We present an exploratory tool that extracts person names from multilingual news collections, matches name variants referring to the same person, and infers relationships between people based on the co-occurrence of their names in related news. A novel feature is the matching of name variants across languages and writing systems, including names written with the Greek, Cyrillic and Arabic writing system. Due to our highly multilingual setting, we use an internal standard representation for name representation and matching, instead of adopting the traditional bilingual approach to transliteration. This work is part of the news analysis system NewsExplorer that clusters an average of 25,000 news articles per day to detect related news within the same and across different languages.

研究の動機と目的

  • 多様な書記体系を有する多言語ニュースコレクションから正確に人名を抽出すること。
  • ラテン文字、キリル文字、ギリシャ文字、アラビア文字を含む、異なる言語やスクリプト間で同一人物を指す名前のバリエーションを照合すること。
  • 多言語ニュース記事内での共起パターンに基づいて、人物間の関係を推定すること。
  • 二国語表記変換に依存する従来の手法の限界を克服し、統一された内部名表現を用いること。
  • NewsExplorerシステムにおけるスケーラブルな多言語ニュースクラスタリングを支援すること。1日あたり約25,000件の記事を処理する。

提案手法

  • 本システムは、複数言語のニュース記事から人名を抽出する多言語名認識モジュールを用いる。
  • 二国語表記変換ペアに依存しないように、標準化された内部名表現を用いて、異なる書記体系間での名前を統一する。
  • クロスリンガル名照合は、内部表現における正規化された名前の比較によって実施され、スクリプト間での照合を可能にする。
  • 関係の推定は、同じニュース記事またはクラスタ内で名前が共起する頻度に基づく。
  • 本システムは、大規模な多言語ニュースストリームを処理するリアルタイムのニュースクラスタリングパイプラインであるNewsExplorerに統合されている。
  • 本アプローチは、公に利用可能なJRCのNewsExplorerアプリケーションの文脈で評価されている。

実験結果

リサーチクエスチョン

  • RQ1同一の統一表現を用いて、多言語ニュースソースから人名を信頼性高く抽出する方法は何か?
  • RQ2二国語表記変換ペアに依存せずに、キリル文字とラテン文字などの異なる書記体系間の名前バリエーションをどの程度正確に照合できるか?
  • RQ3共起性に基づく関係推定は、多言語ニュース記事間で人物をリンクするためにどの程度有効か?
  • RQ41つの内部名表現が、実世界のニュース分析システムにおけるスケーラブルな多言語名照合をサポートできるか?
  • RQ51日25,000件の多言語ニュース記事を処理する中で、クロスリンガル名の一貫性を維持しながら、本システムの性能はどの程度か?

主な発見

  • 本システムは、ギリシャ文字、キリル文字、アラビア文字を含む、複数の言語および書記体系における人名の抽出と正規化に成功している。
  • 内部標準名表現の使用により、従来の二国語表記変換手法と比較して、クロスリンガル名照合の正確性が顕著に向上した。
  • 本システムは、NewsExplorerパイプライン内で、1日約25,000件の多言語ニュース記事をスケーラブルに処理している。
  • ニュース記事内での名前の共起パターンを活用することで、異言語間の人物間関係を効果的に推定できる。
  • 広範な二国語学習データを必要とせずに、多言語名バリエーションの処理において本手法の頑健性が示された。
  • 本手法は、公に利用可能なNewsExplorerアプリケーションに統合されており、実世界のニュース分析における実用的導入を裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。