Skip to main content
QUICK REVIEW

[論文レビュー] Decoding Compressed Trust: Scrutinizing the Trustworthiness of Efficient LLMs Under Compression

Junyuan Hong, Jinhao Duan|arXiv (Cornell University)|Mar 18, 2024
Cryptography and Data Security被引用数 4
ひとこと要約

本稿は、効率的に圧縮された大規模言語モデル(LLMs)における信頼性について、最初の包括的評価を実施し、8つの信頼性次元にわたって5つの最先端の圧縮技術を分析している。4ビット量子化はプルーニングよりも信頼性をよりよく保持していることが判明した一方、極端な量子化(3ビット)は安全性と公平性を著しく低下させ、単に無害なパフォーマンス指標では検出できない隠れたリスクを露呈している。

ABSTRACT

Compressing high-capability Large Language Models (LLMs) has emerged as a favored strategy for resource-efficient inferences. While state-of-the-art (SoTA) compression methods boast impressive advancements in preserving benign task performance, the potential risks of compression in terms of safety and trustworthiness have been largely neglected. This study conducts the first, thorough evaluation of three (3) leading LLMs using five (5) SoTA compression techniques across eight (8) trustworthiness dimensions. Our experiments highlight the intricate interplay between compression and trustworthiness, revealing some interesting patterns. We find that quantization is currently a more effective approach than pruning in achieving efficiency and trustworthiness simultaneously. For instance, a 4-bit quantized model retains the trustworthiness of its original counterpart, but model pruning significantly degrades trustworthiness, even at 50% sparsity. Moreover, employing quantization within a moderate bit range could unexpectedly improve certain trustworthiness dimensions such as ethics and fairness. Conversely, extreme quantization to very low bit levels (3 bits) tends to reduce trustworthiness significantly. This increased risk cannot be uncovered by looking at benign performance alone, in turn, mandating comprehensive trustworthiness evaluation in practice. These findings culminate in practical recommendations for simultaneously achieving high utility, efficiency, and trustworthiness in LLMs. Code and models are available at https://decoding-comp-trust.github.io.

研究の動機と目的

  • モデル圧縮が、無害なパフォーマンスを超えてLLMsの信頼性に与える影響を調査すること。
  • 圧縮による効率性の向上が、実用的展開における安全性、公平性、倫理、耐性に悪影響を及えるかどうかを特定すること。
  • 事前学習からスクラッチで訓練したモデルと、大規模モデルからの圧縮を、信頼性と効率性の観点から比較すること。
  • 実世界の応用において、効率的かつ信頼性のあるLLMsを展開するための実行可能な提言を提供すること。
  • 標準的なベンチマーキングでは検出できない、圧縮モデルに潜む隠れたリスクを明らかにすること。

提案手法

  • 3つの主要なLLMsに対して、5つの最先端の圧縮技術(AWQ、GPTQ、GGUF、GPTQ-INT4、プルーニング)を評価した。
  • 8つの信頼性次元(毒性、ステレオタイプ、プライバシー、公平性、倫理、耐性:敵対的、OOD、敵対的デモ)を評価するために、DecodingTrustベンチマーク(Wang et al., 2023a)を用いた。
  • 13bから7bに圧縮されたモデルを、元の密なモデルおよびスクラッチで訓練した7bモデルと比較した。
  • ジャイルブレーキング攻撃を含む、無害および敵対的システムプロンプトを用いてパフォーマンスを測定した。
  • Perspective APIを用いて毒性スコアを計算し、コンテンツポリシーへの抵抗性を評価するための拒否率を測定した。
  • 標的および非標的のバイアス誘導プロンプトを用いて、ステレオタイプの正確性と拒否行動を評価した。

実験結果

リサーチクエスチョン

  • RQ1モデル圧縮は、複数の安全性および公平性次元にわたってLLMsの信頼性にどのように影響するか?
  • RQ2同等の圧縮率において、量子化はプルーニングと比較して信頼性を保持するか、それとも損なうか?
  • RQ3極端な量子化(例:3ビット)は、効率性の向上を犠牲にして、毒性とバイアスを増加させるか?
  • RQ4なぜ一部の圧縮手法は、無害なパフォーマンスと同等であるにもかかわらず、敵対的プロンプト下で高い拒否率や毒性を示すのか?
  • RQ5事前学習済みの7bモデルは、圧縮された13bモデルと比較して、信頼性次元でどの程度優れているか?

主な発見

  • 4ビット量子化は、倫理、公平性、毒性を含む、多くの信頼性次元において元の13b LLMの信頼性を維持している。
  • 50%のスパarsityを実現するプルーニングは、無害なパフォーマンスにほとんど影響を与えないにもかかわらず、公平性およびステレオタイプ検出において信頼性を著しく低下させている。
  • 3ビット量子化は、毒性スコアの大幅な上昇と拒否率の急激な低下を引き起こしており、有害な出力に対する抵抗性が低下していることを示している。
  • AWQおよびGPTQ量子化手法は、特に非標的プロンプト下で、より高いバイアスを示しており、有害な傾向を強化するリスクがあることを示唆している。
  • 悪意あるシステムプロンプトは高い拒否率を引き起こすが、これは逆説的にステレオタイプ検出における耐性を向上させる一方で、モデル行動における根本的なバイアスリスクを隠蔽している。
  • 本研究は、信頼性の低下を検出するには、無害なパフォーマンス指標だけでは不十分であり、包括的な評価フレームワークの必要性を強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。