Skip to main content
QUICK REVIEW

[論文レビュー] Learning Alternative Name Spellings

Jeffrey Sukharev, Leonid Zhukov|arXiv (Cornell University)|May 7, 2014
Data Quality and Management参考文献 10被引用数 3
ひとこと要約

本稿では、大規模な家系図データとユーザーの検索クエリログを活用して、クラウドソーシングされたトレーニングデータを構築することで、姓の代替スペルを学習する文字単位の機械翻訳(MT)手法を提案する。この手法は、精度と再現率の両面で、従来の音声的および文字列類似度手法を著しく上回り、Moses 5-gram MTモデルが検索データセットおよびレコードデータセットの両方で最良のパフォーランスを示した。

ABSTRACT

Name matching is a key component of systems for entity resolution or record linkage. Alternative spellings of the same names are a com- mon occurrence in many applications. We use the largest collection of genealogy person records in the world together with user search query logs to build name matching models. The procedure for building a crowd-sourced training set is outlined together with the presentation of our method. We cast the problem of learning alternative spellings as a machine translation problem at the character level. We use in- formation retrieval evaluation methodology to show that this method substantially outperforms on our data a number of standard well known phonetic and string similarity methods in terms of precision and re- call. Additionally, we rigorously compare the performance of standard methods when compared with each other. Our result can lead to a significant practical impact in entity resolution applications.

研究の動機と目的

  • エンティティ解決システムにおける姓の信頼できる代替スペルを特定する課題に対処すること。
  • 家系図データベースおよび検索ログにおける実際のユーザー行動から名前の変種を学ぶデータ駆動型手法を開発すること。
  • 高精度で順序付けられた代替名スペルのリストを生成することで、家系図アプリケーションにおける検索精度を向上させること。
  • 厳密な情報検索メトリクスを用いて、機械翻訳、音声的、文字列類似度手法のパフォーマンスを評価および比較すること。
  • 標準的なアルゴリズムを超えて現実世界のスペル変異を捉える、スケーラブルで実用的なエンティティ解決ソリューションを提供すること。

提案手法

  • 著者らは、名前の変種を出発名の翻訳とみなすことにより、代替スペルを学ぶ問題を文字単位の機械翻訳タスクとして定式化する。
  • 翻訳品質を向上させるために、n-gram言語モデル(5-gramおよび6-gram)を用いてMosesツールキットでニューラル機械翻訳モデルを学習する。
  • トレーニングデータは2つのソースから構築される:(1) ユーザーが作成した家族木のリンクによるスキャン済みレコードへの接続、(2) ログに記録されたユーザーのセッションにおけるクエリ再定式化。
  • データセットは、PIIを削除し、姓のペアのみを保持し、高品質な名前マッチングに絞り込むことで前処理される。
  • 評価は、10分割交差検証から得られる精度再現率曲線および信頼区間を用い、統計的有意性を確認するための楕円型密度等高線を用いる。
  • 標準的な情報検索評価手法を用いて、Soundex、NYSIIS、Jaro-Winkler、Levenshtein、Phonexといった標準的手法と性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1文字単位の機械翻訳モデルは、従来の音声的および文字列類似度手法を上回って、代替スペルを特定できるか?
  • RQ2現実世界の家系図の名前変異データにおいて、さまざまな音声的エンコード手法(例:NYSIIS、Soundex)の性能はどのように比較されるか?
  • RQ3クエリ再定式化ログとレコードリンクデータは、代替スペル検出のための高品質トレーニングセット構築にどの程度寄与するか?
  • RQ4名前変種生成のMTフレームワークにおいて、さまざまなn-gram言語モデル構成の相対的パフォーマンスはいかがなっているか?
  • RQ5MTベースのアプローチは、検索ログとレコードデータベースといった異なるデータソース間で一般化可能か?

主な発見

  • Moses 5-gram機械翻訳モデルは、『検索』および『レコード』データセットの両方で、他のすべての手法を顕著に上回った。
  • MTモデルは、精度再現率曲線の下側面積が最大であり、信頼区間が統計的に優れたパフォーマンスを示した。
  • NYSIIS音声的エンコードは、このデータセットにおいて、Soundex や Phonex よりも優れた性能を示したが、これは先行研究の結果とは相反する。
  • Levenshtein および Jaro-Winkler 類似度測定は、他の音声的手法よりも優れていたが、依然としてMTアプローチに劣っていた。
  • 5-gramおよび6-gram MTモデルは『検索』データセットでわずかに優れたパフォーマンスを示したが、『レコード』データセットではMTモデル間の性能差はほとんどなかった。
  • 最良のMTモデルの信頼区間は、Jaro-Winkler や Levenshtein との重複がわずかにしかなく、他の手法との間に明確なパフォーマンスギャップがあることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。