Skip to main content
QUICK REVIEW

[論文レビュー] An improvement on fragmentation in Distribution Database Design Based on Knowledge-Oriented Clustering Techniques

Van Nghia Luong, Ha Huy Cuong Nguyen|arXiv (Cornell University)|May 6, 2015
Data Management and Algorithms参考文献 5被引用数 3
ひとこと要約

本稿では、分散データベース設計における水平的および垂直的フラグメンテーション最適化を目的とした、知識志向クラスタリング手法を提案する。古典的手法から導出された距離閾値および強化された類似度測定法を活用することで、実行時間とデータフラグメンテーションを低減しつつ、安定した計算量を維持し、小規模データセットにおいて古典的手法と同等の結果を得られる。

ABSTRACT

The problem of optimizing distributed database includes: fragmentation and positioning data. Several different approaches and algorithms have been proposed to solve this problem. In this paper, we propose an algorithm that builds the initial equivalence relation based on the distance threshold. This threshold is also based on knowledge- oriented clustering techniques for both of horizontal and vertical fragmentation. Similarity measures used in the algorithms are the measures developed from the classical measures. Experimental results carrying on the small data set match fragmented results based on the classical algorithm. Execution time and data fragmentation significantly reduced while the complexity of our algorithm in the general case is stable.

研究の動機と目的

  • 分散データベース設計における効率的データフラグメンテーションの課題に対処すること。
  • 知識志向クラスタリングを統合することで、既存のフラグメンテーション手法を改善すること。
  • 正確性を維持しつつ、実行時間とデータフラグメンテーションを低減すること。
  • 一般的な使用状況において、安定したアルゴリズム的計算量を確保すること。

提案手法

  • 知識志向クラスタリングから導出された距離閾値を用いて、初期の同値関係を構築する。
  • 古典的手法のメトリクスに基づいた類似度測定法を、データベースフラグメンテーションタスクに適応して強化する。
  • 統一されたクラスタリング論理により、水平的および垂直的フラグメンテーションの両方をサポートする。
  • データ分布のパターンに応じて距離閾値を動的に調整することで、クラスタリング品質を向上させる。
  • ドメイン知識を用いてクラスタリングをガイドすることで、関連性を高め、冗長性を低減する。
  • 小規模データセットを用いて性能と正確性を古典的手法と比較して検証する。

実験結果

リサーチクエスチョン

  • RQ1知識志向クラスタリングは、分散データベースにおけるフラグメンテーション品質をどのように向上させるか?
  • RQ2距離閾値の使用が、フラグメンテーション効率および実行時間に与える影響は何か?
  • RQ3提案手法は、古典的手法と比較して、正確性を維持しつつデータフラグメンテーションを低減できるか?
  • RQ4一般のデータベースワークロード下で、アルゴリズムの計算量はどのように振る舞うか?
  • RQ5ドメイン知識の統合は、フラグメンテーションにおけるクラスタリング精度をどの程度向上させるか?

主な発見

  • 提案手法は、古典的手法と比較して、著しく実行時間を短縮している。
  • データフラグメンテーションが顕著に低減され、ストレージおよびクエリ効率が向上している。
  • さまざまなデータベースワークロードにおいて、安定した計算量を維持している。
  • 小規模データセットにおける実験結果は、古典的手法が生成する結果とよく一致している。
  • 知識志向クラスタリングの統合により、クラスタリングの正確性と関連性が向上している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。