Skip to main content
QUICK REVIEW

[論文レビュー] Improving Entity Resolution with Global Constraints

Jim Gemmell, Benjamin I. P. Rubinstein|arXiv (Cornell University)|Aug 30, 2011
Data Quality and Management参考文献 24被引用数 11
ひとこと要約

本稿では、ウェブサイトが重複するエンティティを避ける社会的経済的インcentiveを活用して、エンティティレゾリューション(ER)におけるグローバル1対1の制約を提案する。大規模な映画ERタスクにおいて、制約付きマッチング(特に非最大重みアルゴリズム)を適用することで、クラウドソーシングされたベンチマークよりも3倍以上のリCALLを達成しながらも高い精度を維持し、病理的ケースにおいても最大重みマッチングを上回る性能を示した。

ABSTRACT

Some of the greatest advances in web search have come from leveraging socio-economic properties of online user behavior. Past advances include PageRank, anchor text, hubs-authorities, and TF-IDF. In this paper, we investigate another socio-economic property that, to our knowledge, has not yet been exploited: sites that create lists of entities, such as IMDB and Netflix, have an incentive to avoid gratuitous duplicates. We leverage this property to resolve entities across the different web sites, and find that we can obtain substantial improvements in resolution accuracy. This improvement in accuracy also translates into robustness, which often reduces the amount of training data that must be labeled for comparing entities across many sites. Furthermore, the technique provides robustness when resolving sites that have some duplicates, even without first removing these duplicates. We present algorithms with very strong precision and recall, and show that max weight matching, while appearing to be a natural choice turns out to have poor performance in some situations. The presented techniques are now being used in the back-end entity resolution system at a major Internet search engine.

研究の動機と目的

  • ウェブサイトが不要な重複を避ける社会的経済的インcentiveを活用して、エンティティレゾリューションの精度を向上させること。
  • 既存のER手法にグローバル1対1の制約を組み込む汎用的で頑健なフレームワークを開発すること。
  • IMDB、Netflix、iTunes、AMGからの大規模で現実世界のデータに対して、制約付きERの影響を評価すること。
  • 最大重みマッチングがERにおいて最適でないことを示し、深刻なケースで失敗することを証明すること。
  • スコア関数のチューニングが不十分な場合や、ソースデータ内に重複がある場合に、制約付きERがどのように動作するかを示すこと。

提案手法

  • ウェブサイトがエンティティ(例えば映画やアルバム)を重複して登録しないというグローバル1対1の制約を活用し、複数のソース間でのレゾリューションをガイドする。
  • 重み付きグラフマッチングを用いるが、総重みを最大化しても精度やリCALLを最適化するとは限らないことを示す。
  • 2段階のパイプラインを採用:ブロッキングおよびロジスティック回帰による特徴スコアリング、その後に制約付きマッチング。
  • 最小限のラベル付きデータでスコアコンビナトリを学習するためのアクティブラーニングを採用する。
  • 複数のメタアルゴリズムを比較:1対1、1対多、および制約なしの多対多マッチング。
  • クラウドソーシングされたFreebaseデータセットと大規模な現実世界の映画カタログを用いて性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1ウェブサイトのインcentiveから導かれるグローバル1対1の制約は、エンティティレゾリューションの精度を顕著に向上させることができるか?
  • RQ2最大重みマッチングは、エンティティレゾリューションにおいて一貫して精度とリCALLを最適化するものか?それともこのアプローチに根本的な欠陥があるか?
  • RQ3スコア関数が不適切にチューニングされている場合、あるいはソースデータ内に重複がある場合、制約付きERはどのように動作するか?
  • RQ4汎用的で制約ベースのフレームワークは、再トレーニングを最小限に抑えて多様なデータソースに適用可能か?
  • RQ5エンティティレゾリューションにおいて、マッチング重みと実際の精度/リCALLの関係は何か?

主な発見

  • 提案された1対1の制約付きERフレームワークは、高精度なクラウドソーシングされたFreebaseベンチマークよりも3倍以上のリCALLを達成しながら、精度を維持または向上させた。
  • 最大重みマッチングは病理的ケース(例:ボーナス映像と本編がほとんど区別できない場合)で著しく性能を発揮せず、誤検出(ファルスポジティブ)と見逃し(ファルスネガティブ)を生じた。
  • 制約付きERは、スコアコンビナトリのチューニングが不十分な場合でも頑健であり、新規ソースを統合する際のラベル付きデータの必要量を削減した。
  • 本フレームワークは、ヘッド映画(人気映画)およびテイル映画(マイナー映画)の両方で性能向上を示し、全データ分布にわたる一貫性ある改善を実証した。
  • 本研究では、マッチング重みを最大化することが、精度やリCALLを最適化する信頼できる代理指標ではないことが判明し、現在のERにおけるグラフマッチングアプローチに根本的な乖離があることが示された。
  • 本システムは、現在、主要なインターネット検索エンジンで、『レンタル』『視聴』『購入』などのエンティティアクションに実用化されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。