Skip to main content
QUICK REVIEW

[論文レビュー] An Efficient Technique for Text Compression

Muhammad Abul Kalam Azad, Rezwana Sharmeen|arXiv (Cornell University)|Sep 25, 2010
Algorithms and Data Compression参考文献 10被引用数 12
ひとこと要約

本論文では、まずシステム全体の語の照会テーブルを用いて繰り返し現れる語をコンactなアドレス参照に置き換えることで、語の再利用を活用した2段階の無損失テキスト圧縮技術を提案する。その後、得られたバイナリデータに対して標準の圧縮アルゴリズムを適用する。この手法により、オペレーティングシステムレベルの語インデックスを活用することで、情報の損失なしに高い圧縮比を達成し、英語テキストのメモリ使用量を顕著に削減する。

ABSTRACT

For storing a word or the whole text segment, we need a huge storage space. Typically a character requires 1 Byte for storing it in memory. Compression of the memory is very important for data management. In case of memory requirement compression for text data, lossless memory compression is needed. We are suggesting a lossless memory requirement compression method for text data compression. The proposed compression method will compress the text segment or the text file based on two level approaches firstly reduction and secondly compression. Reduction will be done using a word lookup table not using traditional indexing system, then compression will be done using currently available compression methods. The word lookup table will be a part of the operating system and the reduction will be done by the operating system. According to this method each word will be replaced by an address value. This method can quite effectively reduce the size of persistent memory required for text data. At the end of the first level compression with the use of word lookup table, a binary file containing the addresses will be generated. Since the proposed method does not use any compression algorithm in the first level so this file can be compressed using the popular compression algorithms and finally will provide a great deal of data compression on purely English text data.

研究の動機と目的

  • 永続ストレージにテキストデータを格納するためのメモリ要件を低減すること。
  • 大規模なテキスト管理に適した無損失圧縮技術を開発すること。
  • 初期圧縮段階で従来の圧縮アルゴリズムへの依存を最小限に抑えること。
  • オペレーティングシステムレベルで語の照会を統合し、システム全体の効率性を高めること。
  • ハイブリッドアプローチにより、英語テキストで高い圧縮比を達成すること。

提案手法

  • 本手法は、オペレーティングシステムに統合された事前構築済みの語照会テーブルを用い、各ユニークな語を一意のアドレス値にマッピングする。
  • 最初の圧縮段階では、テキスト内のすべての語がその対応するアドレス値に置き換えられ、バイナリファイルが生成される。
  • このバイナリファイル(生のテキストではなく語のインデックスを表す)は、その後、標準の無損失圧縮アルゴリズムを用いて圧縮される。
  • 本手法は、第一段階で従来の圧縮を避けるものであり、代わりに意味的語インデックスを用いて初期のサイズ削減を実現する。
  • 語照会テーブルは永続的であり、システム全体で共有されるため、スケールが大きくなると冗長性が低減される。
  • 最終出力は、効率的な格納と検索に適した高度に圧縮されたバイナリファイルである。

実験結果

リサーチクエスチョン

  • RQ1システムレベルの語照会テーブルを用いることで、標準圧縮を適用する前段階でテキストデータのサイズを顕著に削減できるか?
  • RQ2語インデックスと従来の圧縮アルゴリズムを組み合わせることで、英語テキストに対してどの程度の効果が得られるか?
  • RQ3従来の圧縮から語の置換を分離することで、無損失圧縮はどの程度向上できるか?
  • RQ4OS統合語照会テーブルの使用が、全体のメモリ効率に及ぼす影響は何か?
  • RQ5この2段階アプローチは、単独で使用される圧縮手法よりも優れた圧縮比を達成できるか?

主な発見

  • 繰り返し現れる語をコンパクトなアドレス参照に置き換えることで、提案手法は顕著なメモリ節約を実現する。
  • システム全体の語照会テーブルを用いることで、圧縮の前段階で語彙レベルの冗長性が低減される。
  • 語の置換後に得られるバイナリファイルは、標準アルゴリズムによるさらなる圧縮に非常に適している。
  • 本手法は、語の頻度と繰り返しが高い英語テキストに特に最適化されている。
  • インデックス化と圧縮の段階を分離することで、計算オーバーヘッドを最小限に抑え、無損失圧縮が可能になる。
  • 特に繰り返し語彙が多く含まれる大規模なテキストコーパスにおいて、高い圧縮効率を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。