Skip to main content
QUICK REVIEW

[論文レビュー] Identifying document similarity using a fast estimation of the Levenshtein Distance based on compression and signatures

Peter Coates, Frank Breitinger|arXiv (Cornell University)|Jul 21, 2023
Topic Modeling被引用数 5
ひとこと要約

本稿では、大規模な文書に対して、損失あり圧縮アルゴリズムを用いて署名に圧縮し、その短縮された署名上でLevenshtein距離(LD)を推定することで、高速なLD推定を提案する。この手法は、圧縮比Cに対して最大C²の高速化を達成しながらも、特に類似しない文書や削除の状況において高い正確性を維持しており、デジタルフォレンジックスおよびパラフレージ検出における実用的な類似性検出を可能にする。

ABSTRACT

Identifying document similarity has many applications, e.g., source code analysis or plagiarism detection. However, identifying similarities is not trivial and can be time complex. For instance, the Levenshtein Distance is a common metric to define the similarity between two documents but has quadratic runtime which makes it impractical for large documents where large starts with a few hundred kilobytes. In this paper, we present a novel concept that allows estimating the Levenshtein Distance: the algorithm first compresses documents to signatures (similar to hash values) using a user-defined compression ratio. Signatures can then be compared against each other (some constrains apply) where the outcome is the estimated Levenshtein Distance. Our evaluation shows promising results in terms of runtime efficiency and accuracy. In addition, we introduce a significance score allowing examiners to set a threshold and identify related documents.

研究の動機と目的

  • 大規模な文書(例:100 KB以上)に対して、正確なLevenshtein距離(LD)計算のO(n²)時間計算量の問題を解決すること。
  • 大規模データ向けに正確なLDが遅すぎて使用できないデジタルフォレンジックスおよびパラフレージ検出において、実用的な類似性検出を可能にすること。
  • 元の文書にアクセスする必要なく、圧縮から得られる署名のみを用いて、近似でも高い正確性を持つLD推定を提供すること。
  • 鑑識官が推定LDに基づいて関連文書を特定するためのしきい値を設定できるよう、有意性スコアを導入すること。
  • 従来の近似一致(AM)手法に比べ、二値またはヒューリスティックスコアよりも解釈可能で定量的な類似性指標を提供すること。

提案手法

  • ユーザーが指定する損失あり圧縮アルゴリズム(LCA)を用いて、入力文書を短縮された署名に圧縮し、圧縮比Cで文書サイズを可変的に縮小する。
  • 圧縮されたダイジェスト、ファイルサイズ、メタデータ(例:ファイル名)を含む「署名」を生成し、文書の識別およびサイズベースのフィルタリングを可能にする。
  • オリジナルのテキストではなく、署名上でLevenshtein距離(LD)を計算することで、署名がオリジナルのテキストと比べて桁違いに短いことを利用する。
  • 署名上のLDを、オリジナル文書上の正確なLDと比較して推定LD(eLD)とし、その計算速度はオリジナル文書上の正確なLDと比べて約C²倍高速になる。
  • 特に挿入や削除の検出において精度を向上させるために、文書サイズが10倍以内に収まる制約を課す。
  • eLDに基づく有意性スコアを導入し、鑑識官が関連文書を特定するためのしきい値を設定できるようにし、フォレンジック利用性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1損失あり圧縮に基づく署名アプローチは、大規模な文書に対して高速かつ正確なLevenshtein距離の推定を可能にするか?
  • RQ2eLDの推定正確性は、挿入、削除、置換などの異なる種類のテキスト変更に対してどのように変化するか?
  • RQ3文書サイズの類似性がeLD推定の信頼性に与える影響はどの程度で、追加の制約によってこれを軽減できるか?
  • RQ4同じまたは類似したテキストブロックが多数含まれる文書に対しても、本手法は関連文書を効果的に検出できるか?
  • RQ5デジタルフォレンジックス応用において、既存の近似一致手法と比較して、本手法の性能と正確性はどの程度か?

主な発見

  • 提案手法は、圧縮比Cに対して約C²の高速化を達成し、正確なLDが不可能な数百倍の大きさの文書に対してもLD推定が可能になる。
  • 同じサイズの類似しない文書に対しては非常に高い正確性を示し、削除の検出においても真のLD値から最小限のずれで推定される。
  • 文書サイズが10倍以内に近い場合に高い正確性を維持しており、サイズ正規化が推定信頼性の向上に寄与することが示された。
  • 有意性スコアにより、鑑識官が関連文書を特定するためのしきい値を設定できるようになり、デジタルフォレンジックスおよびパラフレージ検出における実用的価値が向上した。
  • 正確なLDがO(n²)のため実用的でない中~大規模なテキスト(例:書籍、長編記事)に対して、本手法は特に効果的である。
  • 今後の課題として、バイナリデータ(例:コンパイル済みプログラム、動画)における性能評価と、多様なデータタイプにわたるδ計算の最適化が必要である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。