Skip to main content
QUICK REVIEW

[논문 리뷰] Certified Robustness for Large Language Models with Self-Denoising

Zhen Zhang, Guanhua Zhang|arXiv (Cornell University)|2023. 07. 14.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)을 위한 인증된 강건성 프레임워크인 SelfDenoise를 제안한다. 이 방법은 랜덤화 스무딩을 향상시키기 위해 LLM 자체가 훼손된 입력을 마스크된 토큰 복원을 통해 복원하는 방식으로, 입력의 훼손을 사전에 제거함으로써 더 큰 인증 반경을 달성한다. 예측 이전에 자기 복원(self-denoising)을 적용함으로써, SST-2 및 Agnews 데이터셋에서 기존의 베이스라인 대비 인증된 강건성과 실증적 강건성 측면에서 뛰어난 성능을 달성한다.

ABSTRACT

Although large language models (LLMs) have achieved great success in vast real-world applications, their vulnerabilities towards noisy inputs have significantly limited their uses, especially in high-stake environments. In these contexts, it is crucial to ensure that every prediction made by large language models is stable, i.e., LLM predictions should be consistent given minor differences in the input. This largely falls into the study of certified robust LLMs, i.e., all predictions of LLM are certified to be correct in a local region around the input. Randomized smoothing has demonstrated great potential in certifying the robustness and prediction stability of LLMs. However, randomized smoothing requires adding noise to the input before model prediction, and its certification performance depends largely on the model's performance on corrupted data. As a result, its direct application to LLMs remains challenging and often results in a small certification radius. To address this issue, we take advantage of the multitasking nature of LLMs and propose to denoise the corrupted inputs with LLMs in a self-denoising manner. Different from previous works like denoised smoothing, which requires training a separate model to robustify LLM, our method enjoys far better efficiency and flexibility. Our experiment results show that our method outperforms the existing certification methods under both certified robustness and empirical robustness. The codes are available at https://github.com/UCSB-NLP-Chang/SelfDenoise.

연구 동기 및 목표

  • 입력 훼손 상황에서 대규모 언어 모델(LLMs)의 제한된 인증 강건성 문제를 해결하기 위해.
  • 원시 랜덤화 스무딩이 훼손된 입력에서 성능이 열악한 데 기인하는 LLM의 성능 저하 문제를 해결하기 위해.
  • 모델 가중치 접근이나 재학습이 필요 없이도 효율적이고 파rameter-free인 방법을 개발하여 강건성을 향상시키기 위해.
  • LLM의 인증 강건성(지역적 안정성)과 실증적 강건성(대부분의 적대적 공격에 대한 저항성)을 동시에 향상시키기 위해.

제안 방법

  • 랜덤화 스무딩을 적용하기 위해 랜덤 단어 마스킹을 통해 다수의 훼손된 입력을 생성한다.
  • 훼손된 입력을 그대로 LLM에 입력하는 대신, 마스킹된 토큰을 완성하도록 프롬프트를 제공함으로써 먼저 복원한다. 이를 통해 의미적 일관성을 회복한다.
  • 복원된 입력을 사용하여 예측 및 인증을 수행함으로써, 훼손된 입력에 대한 모델의 성능을 향상시킨다.
  • 예측의 일致성에 기반해 다수의 복원 및 스무딩된 입력에서의 예측 결과를 종합함으로써 인증 반경을 도출한다. 이는 일致 예측의 빈도에 기반한다.
  • 모델에 대한 미세조정이나 아키텍처 변경 없이도 적용 가능한 플러그 앤 플레이 방식이며, 프롬프트 기반 추론을 통해 어떤 LLM과도 호환된다.
  • 자기 복원 메커니즘은 복원된 스무딩에서 영감을 받았지만, 외부 복원기 대신 LLM 자체를 사용함으로써 효율성과 유연성을 향상시킨다.

실험 결과

연구 질문

  • RQ1모델 미세조정 없이도 자기 복원이 랜덤화 스무딩 하에서 LLM의 인증 강건성을 향상시킬 수 있는가?
  • RQ2RanMask 및 Safer와 같은 기존의 베이스라인 대비 자기 복원 전략이 인증 및 실증적 강건성 측면에서 어떻게 성능을 냈는가?
  • RQ3자기 복원 메커니즘이 높은 정순 정확도를 유지하면서도 더 큰 인증 반경을 달성하는가?
  • RQ4LLM이 자신의 훼손된 입력을 효과적으로 복원하여 예측의 안정성을 높일 수 있는가?

주요 결과

  • SST-2 데이터셋에서 SelfDenoise는 DeepWordBug 공격 하에 64.5%의 실증적 강건 정확도를 달성했으며, 두 번째로 우수한 방법보다 13.2% 높았다.
  • Agnews 데이터셋에서 SelfDenoise는 DeepWordBug 공격 하에 70.0%의 실증적 강건 정확도를 달성했으며, 두 번째로 뛰어난 방법보다 19.7% 높았다.
  • 훼손 스케일 d=5% 조건에서 SelfDenoise는 RanMask 대비 SST-2에서 11.5% 향상된 인증 정확도, Agnews에서는 26.3% 향상된 인증 정확도를 기록했다.
  • SelfDenoise는 정순 정확도 90.0%를 유지하면서도, 정순 정확도와 강건성 간의 최적 균형을 달성했다.
  • Agnews 데이터셋에서 TextBugger 공격 하에 SelfDenoise는 66.0%의 실증적 강건 정확도를 기록했으며, 두 번째로 뛰어난 방법보다 24.5% 높았다.
  • 자기 복원 전략 덕분에, 원시 Alpaca 모델 대비 정순 정확도가 1.2% 떨어지기만 하고도 SST-2에서 실증적 강건 정확도가 19.7% 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.