Skip to main content
QUICK REVIEW

[논문 리뷰] Fool Your (Vision and) Language Model With Embarrassingly Simple Permutations

Yongshuo Zong, Tingyang Yu|arXiv (Cornell University)|2023. 10. 02.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)과 시각-언어 모델(Vision-Language Models, VLLMs)에 심각한 취약성이 존재함을 드러낸다: 다중선택형 질의응답(MCQA) 작업에서 답변 선택지를 무작위로 재배열할 경우 성능 저하가 심각하게 발생한다. 표준 벤치마크에서 높은 정확도를 보이지만, Llama2-13B와 같은 모델은 정확도가 최대 33.89% 감소하여 무작위 추측 수준 이하로 떨어지며, 입력 순서에 대한 불변성의 근본적인 결여를 보여주며 이는 모델의 견고성에 대한 신뢰를 훼손한다.

ABSTRACT

Large language and vision-language models are rapidly being deployed in practice thanks to their impressive capabilities in instruction following, in-context learning, and so on. This raises an urgent need to carefully analyse their robustness so that stakeholders can understand if and when such models are trustworthy enough to be relied upon in any given application. In this paper, we highlight a specific vulnerability in popular models, namely permutation sensitivity in multiple-choice question answering (MCQA). Specifically, we show empirically that popular models are vulnerable to adversarial permutation in answer sets for multiple-choice prompting, which is surprising as models should ideally be as invariant to prompt permutation as humans are. These vulnerabilities persist across various model sizes, and exist in very recent language and vision-language models. Code is available at https://github.com/ys-zong/FoolyourVLLMs.

연구 동기 및 목표

  • 다중선택형 질의응답(MCQA) 작업에서 단순한 입력 변형에 대한 LLM과 VLLM의 견고성을 조사하기 위해.
  • 높은 벤치마크 성능이 모델 행동의 잠재적 취약성을 가리고 있는지 확인하기 위해.
  • 일반적인 완화 전략인 다수결 투표나 校정(calibration)이 순서 변경에 의한 성능 저하를 효과적으로 완화할 수 있는지 검토하기 위해.
  • 이 취약성이 위치적 편향에서 비롯되는지, 아니면 모델 추론의 더 깊은 체계적 결함에서 비롯되는지 판단하기 위해.

제안 방법

  • 질문과 내용은 그대로 유지하면서 MCQA 데이터셋의 답변 선택지 순서를 체계적으로 재배열하기.
  • 모든 순서 변경에 대해 모델 예측을 평가하여 잘못된 예측이 발생할 때까지 진행하고, 실패 전까지의 순서 수를 견고성으로 측정하기.
  • 잡다한 선택지를 제거하여 선택지 수를 줄여 모델의 내성적 저항력 향상 여부를 테스트하기 위한 분석 수행하기.
  • MMLU, AGI-Eval, ScienceQA 등 다양한 MCQA 벤치마크에서 여러 LLM과 VLLM 간의 모델 행동 비교하기.
  • 같은 의미적 내용임에도 불구하고 순서 변경으로 인해 모델 예측이 어떻게 달라지는지 보여주는 정성적 사례 제시하기.
  • 다수결 투표나 校정 기법 등 완화 전략의 효과를 평가하기 위해 테스트 수행하기.
Figure 1: Schematic Illustration of a MCQA permutation attack.
Figure 1: Schematic Illustration of a MCQA permutation attack.

실험 결과

연구 질문

  • RQ1LLM과 VLLM은 MCQA에서 답변 선택지를 무작위로 재배열할 경우 얼마나 정확도를 유지하는가?
  • RQ2성능 저하의 원인이 위치적 편향인지, 아니면 입력 순서에 대한 모델의 불변성에 대한 더 깊은 실패인지 여부는 무엇인가?
  • RQ3다수결 투표나 校정과 같은 기존 완화 기법이 순서 변경 공격에 의한 성능 저하를 효과적으로 복구할 수 있는가?
  • RQ4잡다한 선택지를 제거하면 모델의 순서 변경 공격에 대한 취약성은 어떻게 변화하는가?
  • RQ5관찰된 취약성은 다양한 모델 아키텍처, 크기, 모odalities(텍스트 전용 대비 시각-언어) 간에 일관되게 나타나는가?

주요 결과

  • Llama2-13B는 MMLU 벤치마크에서 답변 선택지의 무작위 재배열 후 정확도가 33.89% 감소하여 무작위 추측 수준 이하로 떨어지며, 이는 정확도가 무작위 수준 이하로 떨어지는 것을 의미한다.
  • 이 취약성은 LLaMA, LLaMA2, Otter-Llama와 같은 최신 모델을 포함한 광범위한 LLM과 VLLM 전반에 걸쳐 지속되며, 체계적 문제임을 시사한다.
  • 잡다한 선택지를 제거한 후에도 모델 성능은 여전히 순서 변경에 매우 민감하여, 선택지 수가 줄어들면 내성적 저항력이 향상된다는 기대와는 정반대의 결과를 보인다.
  • 위치적 편향만으로는 공격의 강도를 설명할 수 없으며, 답변 위치와 관계없이 성능 저하가 발생하므로, 추론 또는 어텐션 메커니즘의 더 깊은 결함을 시사한다.
  • 다수결 투표를 순서 변경에 대해 적용하더라도 원래 성능을 복구하지 못하며, 이는 k! 배수의 계산 비용 증가에도 불구하고 성능 향상이 없다는 것을 의미한다.
  • 캘리브레이션 기법인 calibrate-before-use도 이 취약성을 효과적으로 완화하지 못하며, 이는 아키텍처 또는 학습 수준의 해결책이 필요함을 강조한다.
Figure 2: Summary of MCQA adversarial attack results for both LLMs and VLLMs. The values are average accuracy across all benchmarking datasets.
Figure 2: Summary of MCQA adversarial attack results for both LLMs and VLLMs. The values are average accuracy across all benchmarking datasets.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.