Skip to main content
QUICK REVIEW

[論文レビュー] Parallel Sorted Neighborhood Blocking with MapReduce

Lars Kolb, Andreas Thor|arXiv (Cornell University)|Oct 15, 2010
Data Quality and ManagementDecision Sciences参考文献 1被引用数 17
ひとこと要約

本稿では、エンティティレゾリューションにおけるソートドネルブロッキングのための、2つのMapReduceベースの並列実装—JobSNおよびRepSN—を提案する。これにより、大規模データセットのスケーラブルかつ効率的な処理が可能になる。複数のMapReduceジョブを用いるか、特化したデータ複製を用いることで、順方向処理と比較して実行時間を顕著に短縮し、データの偏りやウィンドウサイズの変化にかかわらず線形スケーラビリティを達成する。

ABSTRACT

Cloud infrastructures enable the efficient parallel execution of data-intensive tasks such as entity resolution on large datasets. We investigate challenges and possible solutions of using the MapReduce programming model for parallel entity resolution. In particular, we propose and evaluate two MapReduce-based implementations for Sorted Neighborhood blocking that either use multiple MapReduce jobs or apply a tailored data replication.

研究の動機と目的

  • 大規模データセットにおける効率的でスケーラブルなエンティティレゾリューションを、MapReduceモデルを用いて実現すること。
  • 分散環境におけるMapReduceでのソートドネルブロッキングの実装に伴う課題に対処すること。
  • ソートドネルブロッキングのための2つの異なる並列化戦略—マルチジョブおよびデータ複製—の設計と評価を行うこと。
  • 分散実行におけるデータの偏りとウィンドウサイズの変化が性能に与える影響を分析すること。
  • MapReduceが、エンティティレゾリューションのような複雑なデータ集約ワークフローを効果的にサポートできることを示すこと。

提案手法

  • JobSNは2つのMapReduceジョブを用いる:最初のジョブではエンティティをブロッキングキーでソート・パーティショニングし、2番目のジョブでは再パーティショニングを行い、ブロック内でのスライディングウィンドウマッチングを適用する。
  • RepSNは、カスタムマップ設定およびクローズ関数を用いた1つのMapReduceジョブを採用し、メモリ内複製によりマッパー間でスライディングウィンドウの状態を維持する。
  • 両手法とも、スライディングウィンドウ評価のための正しいグループ化と順序付けを保証するため、合成キー(例:reducer_id.blocking_key)を用いる。
  • パーティショニング関数はブロッキングキーをレデューサーにマッピングし、ノード間での負荷バランスと正しいデータシャッフルを確保する。
  • スライディングウィンドウサイズwがレデュースフェーズに適用され、ソート順序で隣接するエンティティ間でのみ候補マッチを生成する。
  • RepSNは、各レデューサーごとに直近のw−1個のエンティティのバッファを維持し、マッパー境界を越えてウィンドウの継続性を確保する。この際、置換には最小ヒープ論理を用いる。

実験結果

リサーチクエスチョン

  • RQ1大規模エンティティレゾリューションに適したMapReduceモデルを用いて、ソートドネルブロッキングを効果的に並列化できるか?
  • RQ2マルチジョブとデータ複製の2つの異なるMapReduceベースの設計は、性能とスケーラビリティにおいてどのように比較されるか?
  • RQ3データの偏りは、MapReduceにおける並列ソートドネルブロッキングの性能にどのような影響を与えるか?
  • RQ4ウィンドウサイズの変化が、提案手法における実行時間と負荷分散に与える影響は何か?
  • RQ5提案手法は、大規模データセットで線形スピードアップを達成する一方で、正しさとマッチング品質を維持できるか?

主な発見

  • JobSNはデータサイズの増加に伴い線形スケーリングを達成し、大規模データセットにおいて順方向処理と比較して実行時間を最大80%短縮する。
  • データの偏りが高い状況ではRepSNがJobSNを上回り、メモリ内複製によるより良い負荷バランスのおかげで、実行時間を最大40%短縮する。
  • 両手法とも高いマッチング品質を維持し、順方向のソートドネル手法と同等のリCALLとプレシジョンを達成する。
  • ウィンドウサイズが大きくなると両手法の性能が低下するが、RepSNは変動するウィンドウサイズにおいてより安定した性能を示す。
  • データの偏りはJobSNの性能に顕著な影響を与えるが、RepSNは知的で効果的なデータ複製とバッファ管理によりこれを緩和する。
  • 評価結果から、適切なパーティショニングおよびウィンドウハンドリング戦略を用いた最適化により、MapReduceが複雑なエンティティレゾリューションワークフローを効果的にサポートできることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。