[論文レビュー] LLMZip: Lossless Text Compression using Large Language Models
本稿では、LLaMA-7B言語モデルを予測圧縮器として活用し、次トークンの確率推定値を用いて算術符号化を制御する、損失なしのテキスト圧縮手法であるLLMZipを提案する。この手法は、text8データセットにおいて記録的な低さの漸近エントロピー上限値0.709ビット/文字を達成し、圧縮比0.7101ビット/文字を実現した。これはBSC、ZPAQ、paq8hといった最先端のツールを上回る性能を示した。
We provide new estimates of an asymptotic upper bound on the entropy of English using the large language model LLaMA-7B as a predictor for the next token given a window of past tokens. This estimate is significantly smaller than currently available estimates in \cite{cover1978convergent}, \cite{lutati2023focus}. A natural byproduct is an algorithm for lossless compression of English text which combines the prediction from the large language model with a lossless compression scheme. Preliminary results from limited experiments suggest that our scheme outperforms state-of-the-art text compression schemes such as BSC, ZPAQ, and paq8h.
研究の動機と目的
- LLaMA-7Bを予測モデルとして用いて、英語テキストの漸近エントロピー上限値を推定すること。
- LLaMA-7Bの次トークン予測と算術符号化を統合した損失なしの圧縮方式を開発すること。
- BSC、ZPAQ、paq8hといった最先端の圧縮ツールと比較して、LLaMA-7Bベースのシステムの圧縮性能を評価すること。
- 大規模言語モデルがエントロピー推定値を低減させ、より優れた圧縮比を達成することで、損失なしのテキスト圧縮を顕著に改善できることを示すこと。
提案手法
- スライディングウィンドウによる過去のトークンを文脈として用い、LLaMA-7Bモデルを文脈に応じた予測器として用い、次のトークンの確率分布を推定する。
- 各トークンについて、候補トークンのランク付きリストとその確率を生成し、実際の次トークンのランクを記録する。
- 得られたランク情報を、予測確率に基づいて効率的に符号化する算術符号化を用いて符号化する。
- 圧縮比は、使用した合計ビット数を元のテキストの文字数で割ることで算出する。
- エントロピー上限値は、テストセット全体における予測分布の平均交差エントロピーとして推定する。
- 本手法は、text8データセットの1MBセグメントと、Project Gutenbergの100KBの抜粋を含む2つのデータセットで評価された。
実験結果
リサーチクエスチョン
- RQ1LLaMA-7B言語モデルを用いて予測する場合、英語テキストの漸近的エントロピー上限値はどの程度か?
- RQ2大規模言語モデルを、既存の最先端手法を上回る損失なしのテキスト圧縮に効果的に応用できるか?
- RQ3標準ベンチマークにおいて、LLMベースの圧縮器の圧縮比は、BSC、ZPAQ、paq8hといった従来の圧縮ツールと比べてどの程度か?
- RQ4文脈ウィンドウサイズ(メモリM)を増加させると、LLMZipの圧縮性能は向上するか?
- RQ5text8データセットと出版済みの書籍といった異なるテキストソースにおいて、エントロピー推定値と圧縮比はどのように変化するか?
主な発見
- LLaMA-7Bベースの圧縮器は、text8データセットの1MBセグメントにおいて、0.7101ビット/文字の圧縮比を達成し、BSC、ZPAQ、paq8hを著しく上回った。
- LLaMA-7Bを用いて推定した英語テキストの漸近的エントロピー上限値は0.709ビット/文字であり、文献に記載されたこれまでの推定値を下回った。
- Project Gutenbergの書籍から抽出した100KBの抜粋では、圧縮比が0.8426ビット/文字、エントロピー上限値が0.8417ビット/文字であった。
- 文脈ウィンドウサイズ(M)を増加させると圧縮比が向上し、特にM=511で最良の性能が得られた。
- LLaMA-7Bベースのシステムは0.7101 bpcの圧縮比を達成し、推定されたエントロピー上限値0.7093 bpcに非常に近かった。これは、近似的に最適な圧縮効率を示している。
- zlibアルゴリズムは同じテキストで2.80 bpcを達成したが、LLMベースの圧縮器は著しく優れた性能を示し、予測にLLMを用いる利点が顕著に現れた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。