Skip to main content
QUICK REVIEW

[논문 리뷰] LLMZip: Lossless Text Compression using Large Language Models

Chandra Shekhara Kaushik Valmeekam, Krishna R. Narayanan|arXiv (Cornell University)|2023. 06. 06.
Algorithms and Data Compression인용 수 4
한 줄 요약

이 논문은 LLaMA-7B 언어 모델을 예측 압축기로 활용하여 손실 없는 텍스트 압축 방법인 LLMZip을 제안한다. 이 방법은 다음 토큰의 확률 추정치를 이용해 산술 부호화를 이끌어내며, text8 데이터셋에서 기존 최고 성능을 뛰어넘는 기록적인 낮은 渐近 엔트로피 상한선 0.709 비트/문자와 0.7101 비트/문자 압축 비율을 달성한다. 이는 BSC, ZPAQ, paq8h와 같은 최신 도구들을 능가한다.

ABSTRACT

We provide new estimates of an asymptotic upper bound on the entropy of English using the large language model LLaMA-7B as a predictor for the next token given a window of past tokens. This estimate is significantly smaller than currently available estimates in \cite{cover1978convergent}, \cite{lutati2023focus}. A natural byproduct is an algorithm for lossless compression of English text which combines the prediction from the large language model with a lossless compression scheme. Preliminary results from limited experiments suggest that our scheme outperforms state-of-the-art text compression schemes such as BSC, ZPAQ, and paq8h.

연구 동기 및 목표

  • LLaMA-7B를 예측 모델로 사용하여 영어 텍스트의 渐近 엔트로피 상한선을 추정하는 것.
  • LLaMA-7B의 다음 토큰 예측과 산술 부호화를 조합한 손실 없는 압축 체계를 개발하는 것.
  • LLaMA-7B 기반 시스템의 압축 성능을 BSC, ZPAQ, paq8h와 같은 최신 압축 도구들과 비교 평가하는 것.
  • 대규모 언어 모델이 엔트로피 추정치를 낮추고 더 나은 압축 비율을 달성함으로써 손실 없는 텍스트 압축을 크게 향상시킬 수 있음을 입증하는 것.

제안 방법

  • 슬라이딩 윈도우 방식으로 과거 토큰의 윈도우를 기반으로 LLaMA-7B 모델을 사용해 다음 토큰에 대한 확률 분포를 추정하는 컨텍스트 인식 예측기로 활용한다.
  • 각 토큰에 대해 모델은 후보 토큰 목록과 그 확률을 순위 매겨 출력하며, 실제 다음 토큰의 순위를 기록한다.
  • 기록된 순위 정보는 예측 확률에 기반하여 효율적으로 압축하는 산술 부호화를 통해 부호화된다.
  • 압축 비율은 총 사용 비트 수를 원본 텍스트의 문자 수로 나누어 계산한다.
  • 엔트로피 상한선은 테스트 세트에서 예측된 분포의 평균 교차 엔트로피로 추정한다.
  • 이 방법은 두 가지 데이터셋에서 평가된다: text8 데이터셋의 1MB 세그먼트와 Project Gutenberg 책에서 발췌한 100KB 요약본.

실험 결과

연구 질문

  • RQ1LLaMA-7B 언어 모델을 사용해 예측할 경우 영어 텍스트의 渐近 엔트로피 상한선은 얼마인가?
  • RQ2대규모 언어 모델이 기존 최고 수준의 방법을 뛰어넘어 손실 없는 텍스트 압축을 효과적으로 향상시킬 수 있는가?
  • RQ3표준 벤치마크에서 LLM 기반 압축기의 압축 비율은 BSC, ZPAQ, paq8h와 같은 전통적 압축기와 비교해 어떻게 되는가?
  • RQ4증가하는 컨텍스트 윈도우 크기(메모리 M)에 따라 LLMZip의 압축 성능은 향상되는가?
  • RQ5text8 데이터셋과 출판된 책과 같은 다양한 텍스트 소스에서 엔트로피 추정치와 압축 비율은 어떻게 변화하는가?

주요 결과

  • LLaMA-7B 기반 압축기는 text8 데이터셋의 1MB 세그먼트에서 0.7101 비트/문자 압축 비율을 달성하여 BSC, ZPAQ, paq8h를 크게 능가했다.
  • LLaMA-7B를 사용해 영어 텍스트의 엔트로피 상한선을 0.709 비트/문자로 추정했으며, 이는 이전 문헌에서의 추정치보다 낮다.
  • Project Gutenberg 책에서 발췌한 100KB 요약본에서는 압축 비율이 0.8426 비트/문자였고, 엔트로피 상한선은 0.8417 비트/문자였다.
  • 컨텍스트 윈도우 크기(M)가 증가함에 따라 압축 비율이 향상되었으며, 최고 성능은 M=511에서 관찰되었다.
  • LLaMA-7B 기반 시스템은 0.7101 bpc의 압축 비율을 기록했으며, 이는 추정된 엔트로피 상한선 0.7093 bpc와 매우 가까워 거의 최적의 압축 효율성을 보였다.
  • zlib 알고리즘은 동일한 텍스트에서 2.80 bpc를 기록했지만, LLaMA 기반 압축기의 성능은 이에 비해 뚜렷이 뛰어나 예측에 LLM을 사용할 경우의 이점이 뚜렷하게 드러났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.