Skip to main content
QUICK REVIEW

[논문 리뷰] An Enhanced Static Data Compression Scheme Of Bengali Short Message

Abu Shamim Mohammad Arif, Asif Mahamud|ArXiv.org|2009. 09. 01.
Algorithms and Data Compression참고 문헌 1인용 수 8
한 줄 요약

이 논문은 저자원 모바일 디바이스를 위한 저비용의 정적 데이터 압축 기법을 제안한다. 문자 마스킹, 사전 매칭, 연관 규칙 추출 기반의 어휘 분석, 하이픈 기반의 음절 압축 기법을 통합한 정적 허프만 코딩 모델을 사용하여, 최소한의 계산 오버헤드로 높은 압축 효율을 달성하며, 메모리 제약과 처리 능력이 제한된 환경에 매우 적합하다.

ABSTRACT

This paper concerns a modified approach of compressing Short Bengali Text Message for small devices. The prime objective of this research technique is to establish a low complexity compression scheme suitable for small devices having small memory and relatively lower processing speed. The basic aim is not to compress text of any size up to its maximum level without having any constraint on space and time, rather than the main target is to compress short messages up to an optimal level which needs minimum space, consume less time and the processor requirement is lower. We have implemented Character Masking, Dictionary Matching, Associative rule of data mining and Hyphenation algorithm for syllable based compression in hierarchical steps to achieve low complexity lossless compression of text message for any mobile devices. The scheme to choose the diagrams are performed on the basis of extensive statistical model and the static Huffman coding is done through the same context.

연구 동기 및 목표

  • 제한된 메모리와 처리 속도를 가진 모바일 디바이스에 적합한 저복잡도 데이터 압축 기법을 설계하기.
  • 모든 텍스트 크기에서의 최대 압축률을 극대화하기보다는, 짧은 벤갈리 텍스트 메시지의 압축을 최적화하기.
  • 손실 없는 데이터 무결성을 유지하면서 공간, 시간, 프로세서 자원 사용량을 줄이기.
  • 음절 수준의 처리 및 사전 매칭과 같은 언어학적 및 통계 기법을 통합하여 맥락 인식 가능한 압축을 구현하기.
  • 벤갈리 텍스트에서 빈번히 나타나는 문자 및 음절 패턴의 통계 분 析 기반으로 사전에 계산된 정적 허프만 코딩 모델을 개발하기.

제안 방법

  • 벤갈리 텍스트의 문자 수준 표현에서의 중복을 줄이기 위해 문자 마스킹 기법 적용.
  • 빈번한 단어 패턴을 식별하고 짧은 코드로 대체하기 위해 사전 매칭 기법 사용.
  • 데이터 마이닝 기반의 연관 규칙 추출 기법을 활용해 벤갈리 텍스트 내에서 반복되는 문자 및 음절 패턴을 탐지.
  • 단어를 음절 단위로 분할하기 위해 하이픈화 알고리즘 구현하여 음절 기반 압축을 가능하게 함.
  • 계층적 압축 파이프라인: 문자 마스킹 → 사전 매칭 → 음절 기반 처리 → 정적 허프만 코딩.
  • 벤갈리 텍스트의 문자 및 음절 빈도 통계 모델을 사전에 계산하여 정적 허프만 코드북 구축.

실험 결과

연구 질문

  • RQ1저성능 모바일 디바이스에서 최소한의 계산 오버헤드로 짧은 벤갈리 텍스트 메시지를 효율적으로 압축할 수 있는 방법은 무엇인가?
  • RQ2언어학적 기법과 통계 기법의 조합 중 어떤 조합이 정적 압축 기법에서 높은 압축률과 낮은 복잡도를 동시에 달성할 수 있는가?
  • RQ3음절 분할 및 연관 규칙 추출 기법이 벤갈리 텍스트의 압축 효율에 얼마나 기여하는가?
  • RQ4고정된 통계 모델 기반 정적 허프만 코딩은 동적 기법 대비 압축 성능과 자원 사용 측면에서 어떻게 비교되는가?
  • RQ5문자 마스킹, 사전 매칭, 음절 처리를 융합한 하이브리드 접근 방식이 압축률, 속도, 메모리 사용량 간 최적의 트레이드오프를 달성할 수 있는가?

주요 결과

  • 제안된 기법은 최소한의 계산 자원으로 짧은 벤갈리 메시지에 대해 높은 압축 효율을 달성한다.
  • 하이픈 기반의 음절 분할을 통한 언어학적 분석이 패턴 인식 능력을 향상시키고 압축 성능을 향상시킨다.
  • 사전 매칭 및 연관 규칙 추출 기법은 빈번한 문자 및 음절 조합를 효과적으로 식별하고 압축하여 중복을 줄인다.
  • 사전에 계산된 통계 모델 기반 정적 허프만 코딩은 낮은 복호화 복잡도와 고속 처리를 보장한다.
  • 전체 압축 파이프라인이 저메모리 및 저처리 능력 환경에 최적화되어 있어, 소형 모바일 디바이스에의 구현에 적합하다.
  • 압축률과 계산 비용 간의 균형이 잘 잡혀 있으며, 제약 조건이 있는 환경에서 일반적인 압축 기법보다 뛰어난 성능을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.