Skip to main content
QUICK REVIEW

[論文レビュー] Are Large Language Models Really Robust to Word-Level Perturbations?

H. Wang, Guozheng Ma|arXiv (Cornell University)|Sep 20, 2023
Topic Modeling被引用数 4
ひとこと要約

本稿では、大規模言語モデル(LLMs)の単語レベルの摂動に対する耐性を、事前学習済みのレーティングモデルを用いて評価する新しい評価フレームワークTREvaLを提案する。この手法により、LLMsが一般的な言語的摂動に対して脆弱であることが明らかになり、驚くべきことに、ファインチューニング、特にRLHF段階で耐性が低下することが判明したが、一方で有用性スコアは向上している。

ABSTRACT

The swift advancement in the scales and capabilities of Large Language Models (LLMs) positions them as promising tools for a variety of downstream tasks. In addition to the pursuit of better performance and the avoidance of violent feedback on a certain prompt, to ensure the responsibility of the LLM, much attention is drawn to the robustness of LLMs. However, existing evaluation methods mostly rely on traditional question answering datasets with predefined supervised labels, which do not align with the superior generation capabilities of contemporary LLMs. To address this issue, we propose a novel rational evaluation approach that leverages pre-trained reward models as diagnostic tools to evaluate the longer conversation generated from more challenging open questions by LLMs, which we refer to as the Reward Model for Reasonable Robustness Evaluation (TREvaL). Longer conversations manifest the comprehensive grasp of language models in terms of their proficiency in understanding questions, a capability not entirely encompassed by individual words or letters, which may exhibit oversimplification and inherent biases. Our extensive empirical experiments demonstrate that TREvaL provides an innovative method for evaluating the robustness of an LLM. Furthermore, our results demonstrate that LLMs frequently exhibit vulnerability to word-level perturbations that are commonplace in daily language usage. Notably, we are surprised to discover that robustness tends to decrease as fine-tuning (SFT and RLHF) is conducted. The code of TREval is available in https://github.com/Harry-mic/TREvaL.

研究の動機と目的

  • 既存のLLM耐性評価手法が閉形式または短い回答タスクに依存しており、生成的機能を十分に捉えていないという限界を是正すること。
  • オープンエンドで長文の対話に用いられるLLMの実世界での使用を反映する、より包括的な評価手法の開発。
  • 異なるトレーニング段階(事前学習、SFT、RLHF)およびモデルサイズにおける耐性の変化を調査すること。
  • 単語レベルの摂動がLLMのパフォーマンスを顕著に低下させることを実証的に示すこと、特にファインチューニング済みモデルにおいて顕著である。
  • TREvaLフレームワークをオープンソース化し、再現可能で標準化された耐性評価を可能にすること。

提案手法

  • 自然質問データセットから抽出した1,000件のオープンエンドの質問を、LLMが長文応答を生成するためのプロンプトとして使用する。
  • プロンプトに対して、3段階の単語レベルの摂動(スペルミス、同義語置換、語順入れ替え)を適用する。
  • 事前学習済みのレーティングモデルが生成された応答の質(有用性と無害性)を評価する。
  • 耐性は、クリーンな入力と摂動を加えた入力の間でのレーティングスコアの低下率として定量化される。
  • このフレームワークにより、モデルの段階(事前学習、SFT、RLHF)およびモデル(Llama-7B、Alpaca-7B、Beaver-7B)間の比較が可能になる。
  • モデルパラメータを摂動させることで、平坦性と耐性のトレンドを可視化するためのランドスケープ分析を実施する。

実験結果

リサーチクエスチョン

  • RQ1大規模言語モデルは、オープンエンドで長文の会話において一般的な単語レベルの摂動に対して耐性を保っているのか?
  • RQ2事前学習、教師強化学習(SFT)、人間からの強化学習(RLHF)という異なるトレーニング段階において、LLMの耐性はどのように変化するのか?
  • RQ3特にファインチューニング後において、有用性と耐性の間にトレードオフが生じているのか?
  • RQ4モデルサイズやパラメータ分布は、摂動下での耐性にどのように影響するのか?
  • RQ5レーティングモデルは、生成的設定におけるLLM耐性の評価に信頼できる評価者として機能できるのか?

主な発見

  • 評価されたすべてのLLMが、単語レベルの摂動によって顕著なパフォーマンス低下を示しており、実世界の使用において耐性が欠如していることが示された。
  • 事前学習済みのLLMは有用性が最も低かったが、耐性は最も高かった。一方、RLHFでファインチューニングされたモデルは、有用性が最も高く、耐性が最も低かった。
  • ファインチューニングの各段階で耐性が一貫して低下しており、SFTおよびRLHFがモデルのパラメータ分布を不安定化させている可能性が示唆された。
  • ランドスケープ分析により、ファインチューニングが進むにつれてモデルが段階的に平坦化(感受性が増加)することが確認され、Beaver-7Bは感受性が最も高く、Llama-7Bは最も低かった。
  • 耐性の低下は、有害な出力を誘発するように摂動が設計されていないため、無害性の低下によるものではない。
  • これらの結果から、現在のSFTおよびRLHFのアプローチは、展開済みのLLMにおける安定性と耐性を向上させるために再設計を要することが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。