[논문 리뷰] XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models
XSTest는 대규모 언어 모델에서 유해한 쿼리와 어휘적 유사성이 있는 허용 가능한 쿼리를 거부하는 과도한 안전성 행동을 탐지하기 위해 설계된 진단 테스트 세트로, 안전한 프롬프트 250개와 유해한 프롬프트 200개로 구성되어 있다. 연구 결과, Llama2는 심각한 과도한 안전성 문제를 보이며, GPT-4는 유용성과 무해성 사이의 최적의 균형을 유지하고 있음을 확인했다. 이는 안전성 트리거에 과도하게 피팅되는 데서 비롯하는 위험을 드러낸다.
Without proper safeguards, large language models will readily follow malicious instructions and generate toxic content. This risk motivates safety efforts such as red-teaming and large-scale feedback learning, which aim to make models both helpful and harmless. However, there is a tension between these two objectives, since harmlessness requires models to refuse to comply with unsafe prompts, and thus not be helpful. Recent anecdotal evidence suggests that some models may have struck a poor balance, so that even clearly safe prompts are refused if they use similar language to unsafe prompts or mention sensitive topics. In this paper, we introduce a new test suite called XSTest to identify such eXaggerated Safety behaviours in a systematic way. XSTest comprises 250 safe prompts across ten prompt types that well-calibrated models should not refuse to comply with, and 200 unsafe prompts as contrasts that models, for most applications, should refuse. We describe XSTest's creation and composition, and then use the test suite to highlight systematic failure modes in state-of-the-art language models as well as more general challenges in building safer language models.
연구 동기 및 목표
- 어휘적으로 해로운 콘텐츠와 유사한 안전한 프롬프트가 해로운 것으로 잘못 인식되어 거부되는 체계적인 실패를 식별하기 위해.
- 모델이 도움이 되는 요청을 과도하게 거부하는, 아직 잘 다뤄지지 않은 과도한 안전성 문제를 해결하기 위해.
- 최첨단 대규모 언어 모델에서 이러한 행동을 진단하기 위한 표준화된 수작업 테스트 세트를 개발하기 위해.
- 시스템 프롬프트와 가드레일이 모델의 안전성 행동에 미치는 영향을 평가하여, 일관되지 않거나 뜻하지 않은 부작용을 드러내기 위해.
제안 방법
- XSTest는 10종류의 다른 프롬프트 유형에 걸쳐 250개의 안전 프롬프트를 포함하며, 각각 명백하게 안전하고 거부를 유도하지 않도록 설계되었다.
- 유해한 요청에 대해 정확히 거부해야 하는 대조용 200개의 유해 프롬프트 세트가 포함되어 있다.
- 테스트 세트는 최신 대규모 언어 모델 세 종류를 평가하기 위해 적용되었으며, Llama2(시스템 프롬프트 유무 포함), Mistral 7B(가드레일 프롬프트 유무 포함), GPT-4이다.
- 모델의 응답은 안전한 프롬프트에 대한 거부 행동을 분석하며, 거부는 명백히 정당한 요청에 대한 비준수로 정의된다.
- 평가에서는 특정 단어나 어구가 해로운 콘텐츠와 관련이 있을 때 모델이 반응하는 어휘 과도 피팅을 탐지하는 데 집중된다.
- 평가자들이 응답의 거부 여부를 평가하고, 결과를 모델 간 비교하여 체계적인 실패 유형을 식별한다.

실험 결과
연구 질문
- RQ1최신 대규모 언어 모델이 어휘적으로 해로운 것과 유사한 안전한 프롬프트를 얼마나 자주 거부하는가? 이는 과도한 안전성의 정도를 나타낸다.
- RQ2시스템 프롬프트와 가드레일은 대규모 언어 모델의 유용성과 무해성의 균형에 어떻게 영향을 미치는가?
- RQ3XSTest와 같은 표준화된 테스트 세트가 다양한 모델 간 과도한 안전성 행동을 신뢰성 있게 탐지하고 정량화할 수 있는가?
- RQ4왜 일부 모델, 예를 들어 Llama2는 다른 측면에서 잘 校정되어 있음에도 불구하고 안전한 프롬프트를 심각하게 거부하는가?
- RQ5개인 정보 관련 프롬프트의 포함 여부가 모델의 거부 행동에 어떻게 영향을 미치며, 이는 개인 데이터에 대한 민감도를 어떻게 드러내는가?
주요 결과
- Llama2는 심각한 과도한 안전성을 보이며, 안전한 프롬프트의 28%를 거부한다. 특히 민감한 주제나 해로운 콘텐츠와 어휘적 유사성이 있는 프롬프트에서 두드러진다.
- Llama2의 원래 시스템 프롬프트를 제거하면 거부 비율은 감소하지만 과도한 안전성은 여전히 존재하므로, 지속적인 과도 피팅이 있음을 시사한다.
- 원래 상태의 Mistral 7B는 과도한 안전성을 보이지 않지만, 매우 유해한 요청에도 응답을 따르므로 무해성 확보가 부족하다.
- Mistral에 가드레일 프롬프트를 추가하면 유해 응답은 줄어들지만, 안전한 프롬프트의 거부 비율은 증가하여 안전성 목표 간의 상충관계를 보여준다.
- GPT-4는 가장 우수한 균형을 유지하며, 한 개의 유해 프롬프트만 거부하고 거의 모든 안전 프롬프트에 응답한다. 유일한 예외는 개인정보 관련 프롬프트이다.
- 연구는 어휘 과도 피팅이 과도한 안전성의 핵심 원인임을 규명하였으며, 이는 모델이 맥락적 의도보다 특정 키워드에 반응하기 때문임을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.