Skip to main content
QUICK REVIEW

[論文レビュー] Faster Algorithm of String Comparison

Qi Yang, Sung Sam Yuan|ArXiv.org|Dec 21, 2001
Algorithms and Data Compression参考文献 18被引用数 6
ひとこと要約

本稿では、[LL+99]のトークンベース手法よりも顕著に向上した、部分文字列に基づくアルゴリズムパッケージMCWPMを提案する。最適化された境界(UBWS、LBWS)とERMAヒューリスティックを活用することで、最悪ケースでO(knm)(k < 0.75)、平均ケースでO(βn)(β < 6)、最良ケースでO(1)の時間計算量を達成する。比較的簡単な例と実験を通じて、類似度マッチングの精度が向上していることが示されている。

ABSTRACT

In many applications, it is necessary to determine the string similarity. Edit distance[WF74] approach is a classic method to determine Field Similarity. A well known dynamic programming algorithm [GUS97] is used to calculate edit distance with the time complexity O(nm). (for worst case, average case and even best case) Instead of continuing with improving the edit distance approach, [LL+99] adopted a brand new approach-token-based approach. Its new concept of token-base-retain the original semantic information, good time complex-O(nm) (for worst, average and best case) and good experimental performance make it a milestone paper in this area. Further study indicates that there is still room for improvement of its Field Similarity algorithm. Our paper is to introduce a package of substring-based new algorithms to determine Field Similarity. Combined together, our new algorithms not only achieve higher accuracy but also gain the time complexity O(knm) (k&lt;0.75) for worst case, O(*n) where &lt;6 for average case and O(1) for best case. Throughout the paper, we use the approach of comparative examples to show higher accuracy of our algorithms compared to the one proposed in [LL+99]. Theoretical analysis, concrete examples and experimental result show that our algorithms can significantly improve the accuracy and time complexity of the calculation of Field Similarity. [US97] D. Guseld. Algorithms on Strings, Trees and Sequences, in Computer Science and Computational Biology. [LL+99] Mong Li Lee, Cleansing data for mining and warehousing, In Proceedings of the 10th International Conference on Database and Expert Systems Applications (DEXA99), pages 751-760,August 1999. [WF74] R. Wagner and M. Fisher, The String to String Correction Problem, JACM 21 pages 168-173, 1974.

研究の動機と目的

  • 「[LL+99]で提案されたトークンベースのフィールド類似度アルゴリズムにおける精度と効率の限界を是正すること。
  • 意味的情報を保持しつつ計算性能を向上させる新しいアルゴリズムフレームワークの開発。
  • 特に、最悪ケースでO(knm)(k < 0.75)、平均ケースでO(βn)(β < 6)、最良ケースでO(1)の時間計算量を達成すること。精度を損なわず、性能を向上させる。
  • 理論的分析、具体的な例、および実データおよび合成データセットを用いた実験的評価を通じて、新手法の優位性を検証すること。

提案手法

  • [LL+99]のトークンベース手法に代わる部分文字列に基づく類似度アプローチを導入し、重複する部分文字列の一致に焦点を当てる。
  • 比較範囲を制限し、無駄な計算を削減するため、上限ウィンドウ戦略(UBWS)と下限ウィンドウ戦略(LBWS)を採用する。
  • 不一致の部分文字列を早期に除外するため、ERMA(効率的な不一致代替の拒否)ヒューリスティックを適用する。
  • 類似度寄与度を動的に追跡し意思決定を支援するため、SCAMSUC(現在ラウンドまでのすべての一致文字列の寄与度の合計)とMMSLFC(現在ラウンドからの最大一致文字列長)を用いる。
  • 類似度が閾値(ST)に基づいて評価される複数ラウンドの意思決定フレームワークを実装し、MMSL、LBWS、SCAMSUCの比較に基づいて重複または非重複を判断する条件を設定する。
  • MMSL * < LBWS または SCAMSUC * ≥ ST を用いて、レコードを重複または非重複として分類する閾値ベースの結論エンジンを統合する。

実験結果

リサーチクエスチョン

  • RQ1部分文字列ベースのアプローチは、フィールド類似度計算において、精度と時間計算量の両面でトークンベース手法を上回ることができるか?
  • RQ2提案された部分文字列ベースのアルゴリズムの理論的時間計算量は何か?また、[LL+99]手法のO(nm)と比べてどのように異なるか?
  • RQ3導入された境界(UBWS、LBWS)とヒューリスティック(ERMA)は、精度を損なわず計算時間を短縮するためにどのように寄与するか?
  • RQ4具体的な例と実験結果を通じて、MCWPMアルゴリズムは実用的な比較においてどれほど精度を向上させるか?
  • RQ5アルゴリズムは最良ケースでO(1)の時間計算量を達成できるか?その条件は何か?

主な発見

  • 提案されたMCWPMアルゴリズムは、最悪ケースでO(knm)(k < 0.75)の時間計算量を達成し、[LL+99]手法のO(nm)に比べ顕著な改善を示している。
  • 平均ケースでは、O(βn)(β < 6)の時間計算量で実行され、ベースライン手法に比べて顕著な性能向上が確認された。
  • 最良ケースの時間計算量はO(1)であり、これは同一の文字列の場合のように初期の部分文字列一致が類似度を決定するのに十分である場合に発生する。
  • キャンパス調査、センサス、および合成データセットを用いた実験結果から、MCWPMは[LL+99]手法よりも精度と効率の両面で優れていることが確認された。
  • SCAMSUCとMMSLFCの使用により、動的で閾値駆動の分類が可能となり、高い正確性で重複を正しく同定できるようになった。
  • UBWSとLBWSの制約、およびERMAの統合により、実際の応用で比較回数が最大75%まで削減され、時間計算量の向上に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。