[논문 리뷰] An Efficient Technique for Text Compression
이 논문은 먼저 운영체제 수준의 단어 검색 테이블을 사용하여 반복되는 단어를 압축된 주소 참조로 대체한 후, 결과로 생성된 이진 데이터에 표준 압축 알고리즘을 적용하는 이중 단계 손실 없는 텍스트 압축 기법을 제안한다. 이 방법은 운영체제 수준의 단어 색인을 활용하여 영어 텍스트의 메모리 사용량을 크게 줄이며, 정보 손실 없이 높은 압축 비율을 달성한다.
For storing a word or the whole text segment, we need a huge storage space. Typically a character requires 1 Byte for storing it in memory. Compression of the memory is very important for data management. In case of memory requirement compression for text data, lossless memory compression is needed. We are suggesting a lossless memory requirement compression method for text data compression. The proposed compression method will compress the text segment or the text file based on two level approaches firstly reduction and secondly compression. Reduction will be done using a word lookup table not using traditional indexing system, then compression will be done using currently available compression methods. The word lookup table will be a part of the operating system and the reduction will be done by the operating system. According to this method each word will be replaced by an address value. This method can quite effectively reduce the size of persistent memory required for text data. At the end of the first level compression with the use of word lookup table, a binary file containing the addresses will be generated. Since the proposed method does not use any compression algorithm in the first level so this file can be compressed using the popular compression algorithms and finally will provide a great deal of data compression on purely English text data.
연구 동기 및 목표
- 지속적 저장 장치에 텍스트 데이터를 저장하기 위한 메모리 요구량을 줄이기 위해.
- 대규모 텍스트 관리에 적합한 손실 없는 압축 기법을 개발하기 위해.
- 초기 압축 단계에서 전통적인 압축 알고리즘에 대한 의존도를 최소화하기 위해.
- 운영체제 수준에서 단어 검색을 통합하여 시스템 전체의 효율성을 높이기 위해.
- 하이브리드 접근 방식을 통해 영어 텍스트에 대해 높은 압축 비율을 달성하기 위해.
제안 방법
- 모든 고유한 단어를 고유한 주소 값으로 매핑하기 위해 운영체제에 통합된 사전에 구축된 단어 검색 테이블을 사용한다.
- 첫 번째 압축 단계에서 텍스트 내 모든 단어가 해당 주소 값으로 대체되어 이진 파일이 생성된다.
- 이진 파일은 원시 텍스트가 아니라 단어 인덱스를 나타내므로, 표준 손실 없는 압축 알고리즘을 사용하여 압축된다.
- 이 방법은 첫 번째 단계에서 전통적인 압축을 피하고, 대신 의미적 단어 색인을 통해 초기 크기 감소를 달성한다.
- 단어 검색 테이블은 지속 가능하며 시스템 전반에서 공유되어 대규모에서의 중복을 줄인다.
- 최종 출력은 효율적인 저장 및 검색에 적합한 고도로 압축된 이진 파일이다.
실험 결과
연구 질문
- RQ1운영체제 수준의 단어 검색 테이블을 사용하면 표준 압축을 적용하기 전에 텍스트 데이터 크기를 크게 줄일 수 있는가?
- RQ2기존 압축 알고리즘과 단어 색인을 조합했을 때 영어 텍스트에 대해 얼마나 효과적인가?
- RQ3전통적 압축과의 분리된 단어 대체 방식을 통해 손실 없는 압축이 얼마나 향상될 수 있는가?
- RQ4운영체제 통합 단어 검색 테이블이 전체 메모리 효율성에 미치는 영향은 어떠한가?
- RQ5이 이중 단계 접근 방식이 독립적인 압축 방법보다 더 높은 압축 비율을 달성할 수 있는가?
주요 결과
- 반복되는 단어를 압축된 주소 참조로 대체함으로써 제안된 방법은 상당한 메모리 절감 효과를 달성한다.
- 시스템 전반의 단어 검색 테이블을 사용함으로써, 압축 이전에 어휘 수준에서의 중복을 줄일 수 있다.
- 단어 대체 후 생성된 이진 파일은 표준 알고리즘에 의해 매우 효과적으로 추가로 압축될 수 있다.
- 이 기법은 단어 빈도와 반복성이 높은 영어 텍스트에 대해 특별히 최적화되어 있다.
- 색인 단계와 압축 단계를 분리함으로써 계산 오버헤드를 최소화하면서도 손실 없는 압축을 가능하게 한다.
- 특히 반복적인 어휘를 포함한 대규모 텍스트 코퍼스에 대해 높은 압축 효율성을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.