[論文レビュー] Fool Your (Vision and) Language Model With Embarrassingly Simple Permutations
この論文は、大規模言語モデル(LLM)およびビジョン・ランゲージ・モデル(VLLM)に深刻な脆弱性が存在することを明らかにしている。複数選択式の質問・回答(MCQA)タスクにおいて、選択肢の順序をランダムに並び替えると、モデルの性能が著しく低下する。標準ベンチマークでは高い正確性を示すが、Llama2-13Bのようなモデルでは正確性が最大33.89%低下し、ランダム選択以下の水準にまで下がる。これは、入力の順序変更に対して不変性を欠いている根本的な欠陥を示しており、モデルの信頼性に疑問を呈するものである。
Large language and vision-language models are rapidly being deployed in practice thanks to their impressive capabilities in instruction following, in-context learning, and so on. This raises an urgent need to carefully analyse their robustness so that stakeholders can understand if and when such models are trustworthy enough to be relied upon in any given application. In this paper, we highlight a specific vulnerability in popular models, namely permutation sensitivity in multiple-choice question answering (MCQA). Specifically, we show empirically that popular models are vulnerable to adversarial permutation in answer sets for multiple-choice prompting, which is surprising as models should ideally be as invariant to prompt permutation as humans are. These vulnerabilities persist across various model sizes, and exist in very recent language and vision-language models. Code is available at https://github.com/ys-zong/FoolyourVLLMs.
研究の動機と目的
- 複数選択式質問・回答(MCQA)タスクにおける、LLMおよびVLLMの単純な入力摂動に対するロバスト性を調査すること。
- 高いベンチマークスコアが、モデル行動における潜在的な脆さを隠しているかどうかを特定すること。
- メジャー投票やキャリブレーションといった一般的な緩和戦略が、並び替えに起因する性能低下を効果的に是正できるかどうかを検討すること。
- この脆弱性が位置バイアスに起因するのか、それともモデル推論における根本的なシステム的欠陥に起因するのかを特定すること。
提案手法
- 質問およびコンテンツを変更せずに、MCQAデータセット内の選択肢の順序を体系的に並び替える。
- すべての並び替えに対してモデルの予測を評価し、誤った予測が初めて出力されるまでの順列の数を測定し、ロバスト性を「故障までの順列数」として定義する。
- 誤り選択肢を除去することでアブレーションスタディを実施し、選択肢数の削減が耐性向上に寄与するかを検証する。
- MMLU、AGI-Eval、ScienceQAを含む多様なMCQAベンチマークで、複数のLLMおよびVLLMの行動を比較する。
- 同一の意味的コンテンツであっても並び替えによってモデル予測がどのように変化するかを、定性的な例を用いて説明する。
- メジャー投票やキャリブレーション技術を用いた緩和戦略をテストし、その有効性を評価する。

実験結果
リサーチクエスチョン
- RQ1LLMおよびVLLMは、MCQAタスクにおける選択肢の順序をランダムに並び替えた場合、どの程度正確性を維持できるか?
- RQ2性能低下は位置バイアスに起因するのか、それとも入力順序に対するモデルの不変性の欠如に起因するのか?
- RQ3メジャー投票やキャリブレーションといった既存の緩和技術が、並び替え攻撃に起因する性能低下を効果的に是正できるか?
- RQ4誤り選択肢の削除は、モデルの並び替え攻撃に対する脆弱性にどのような影響を与えるか?
- RQ5観察された脆さは、異なるモデルアーキテクチャ、サイズ、モダリティ(テキストのみ vs. ビジョン・ランゲージ)の間で一貫しているか?
主な発見
- Llama2-13Bは、MMLUベンチマークで選択肢の順序をランダムに並び替えた後、正確性が33.89%低下し、ランダム選択の水準を下回る。
- この脆弱性は、Llama、Llama2、Otter-Llamaといった最近のモデルを含む広範なLLMおよびVLLMに共通しており、システム的問題であることが示唆される。
- 誤り選択肢を除去しても、モデルの性能は依然として並び替えに極めて敏感であり、選択肢数が減れば耐性が向上すると予想されるのとは逆に、脆弱性は持続する。
- 位置バイアスだけでは攻撃の強度を説明できない。選択肢の位置に関係なく性能低下が発生するため、推論やアテンション機構に根本的な欠陥があることが示唆される。
- 並び替えのメジャー投票ですら、計算コストがk!倍に増加しても、元の性能を回復させない。
- キャリブレーション技術(例:使用前キャリブレーション)は、この脆弱性を効果的に是正できない。これは、アーキテクチャ的またはトレーニング段階での解決策の必要性を強調する。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。