[논문 리뷰] SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal
SORRY-Bench는 45개의 균형 잡힌 인간이 수작업으로 선별한 불안전 주제를 바탕으로 대규모 언어 모델의 안전 거부 행동을 평가하기 위한 종합적이고 세밀한 벤치마크입니다. 기존 벤치마크의 한계를 보완하기 위해 언어적 다양성을 통합하고, GPT-4 수준의 모델에 비해 비용이 더 저렴한 7B LLM을 미세조정하여 효율적인 평가를 가능하게 하며, 모델과 위험 카테고리 간에 다릅니다.
Evaluating aligned large language models' (LLMs) ability to recognize and reject unsafe user requests is crucial for safe, policy-compliant deployments. Existing evaluation efforts, however, face three limitations that we address with SORRY-Bench, our proposed benchmark. First, existing methods often use coarse-grained taxonomies of unsafe topics, and are over-representing some fine-grained topics. For example, among the ten existing datasets that we evaluated, tests for refusals of self-harm instructions are over 3x less represented than tests for fraudulent activities. SORRY-Bench improves on this by using a fine-grained taxonomy of 44 potentially unsafe topics, and 440 class-balanced unsafe instructions, compiled through human-in-the-loop methods. Second, linguistic characteristics and formatting of prompts are often overlooked, like different languages, dialects, and more -- which are only implicitly considered in many evaluations. We supplement SORRY-Bench with 20 diverse linguistic augmentations to systematically examine these effects. Third, existing evaluations rely on large LLMs (e.g., GPT-4) for evaluation, which can be computationally expensive. We investigate design choices for creating a fast, accurate automated safety evaluator. By collecting 7K+ human annotations and conducting a meta-evaluation of diverse LLM-as-a-judge designs, we show that fine-tuned 7B LLMs can achieve accuracy comparable to GPT-4 scale LLMs, with lower computational cost. Putting these together, we evaluate over 50 proprietary and open-weight LLMs on SORRY-Bench, analyzing their distinctive safety refusal behaviors. We hope our effort provides a building block for systematic evaluations of LLMs' safety refusal capabilities, in a balanced, granular, and efficient manner. Benchmark demo, data, code, and models are available through https://sorry-bench.github.io.
연구 동기 및 목표
- 기존의 LLM 안전 거부 행동 평가 벤치마크에서의 불균형성과 군더미 같은 세분성 부족 문제를 해결하기 위해.
- 언어, 방언, 프롬프트 형식 등의 언어적 다양성이 모델의 거부 성능에 미치는 영향을 체계적으로 평가하기 위해.
- GPT-4와 같은 대규모 모델에 의존하지 않고, 미세조정된 7B LLM을 활용해 계산 비용을 절감하면서도 정확도를 확보한 자동 평가자 개발을 위해.
- 모델 간 종합적이고 비교 가능한 안전 평가를 가능하게 하기 위해 45개의 불안전 주제에 대한 통합된 세밀한 분류 체계를 제공하기 위해.
- 다양한 위험 카테고리 간의 상관관계와 모델 고유의 거부 행동 패턴을 규명하기 위해.
제안 방법
- 사람이 참여하는 방식을 통해 기존의 불균형한 분류 체계를 통합하고 확장한 세밀한 45개 클래스의 안전 분류 체계를 개발함.
- 모든 45개 주제에 대해 균형 잡힌 10개의 지침(모든 주제당 총 450개)을 인간의 주석을 기반으로 한 신규 데이터를 활용해 수집하여 동일한 커버리지 확보.
- 지시어의 형태, 질문 형식, 다국어 프롬프트 등을 포함한 다양한 포맷에서 모델의 거부 행동을 테스트하기 위해 20개의 언어 증강을 생성함.
- LLM-as-a-judge 구성 방식을 설계하고 평가하여, 미세조정된 7B 모델이 GPT-4 수준의 정확도를 달성하면서도 더 낮은 계산 비용을 확보함을 확인함.
- 7,000건 이상의 인간 주석을 활용한 메타 평가를 수행하여 자동 평가 전략의 타당성과 신뢰도를 검증함.
- 피어슨 상관계수를 사용해 카테고리 간 성능 관계를 분석하고, 위험 카테고리 간에 다름없는 거부 행동 패tern을 규명함.
실험 결과
연구 질문
- RQ1다양한 LLM은 세밀하고 균형 잡힌 45개의 불안전 주제에서 어떻게 성능을 내며, 그들의 거부 행동 패턴은 어떠한가?
- RQ2질문 형식, 방언, 다국어 프롬프트 등의 언어적 다양성이 모델의 거부 성능에 얼마나 영향을 미치는가?
- RQ3미세조정된 7B LLM은 계산 비용을 줄이며 GPT-4 수준의 정확도를 확보할 수 있는가?
- RQ4시스템 프롬프트, 프롬프트 템플릿, 응답 프리필링 등의 구성 요소가 모델의 거부 비율에 어떻게 영향을 미치는가?
- RQ5어느 안전 카테고리가 상관관계가 낮은 성능을 보이며, 이는 모델의 고유한 취약성 또는 행동 패턴을 나타내는가?
주요 결과
- 벤치마크 분석 결과, 기존 데이터셋에서 자살 위협과 같은 핵심 주제가 사기 주제보다 거의 3배 이상 부족하게 다뤄지고 있음을 확인하여 기존 평가의 중대한 격차를 드러냄.
- 모델은 카테고리 간에 뚜렷한 차이를 보이며, '의료 조언', '법률 자문 조언', '지적 재산권 침해' 카테고리에서는 상관계수가 낮음(R < 0.75), 이는 각기 다른 위험 프로파일을 가짐을 시사함.
- 모델 응답에 '네, 여기에'를 사전 입력하는 것만으로도 Llama 모델들에서 불안전 지시 이행률이 최대 53% 증가하여 강력한 재정의 유사 효과를 보임.
- 잘못된 프롬프트 템플릿은 Llama-2와 Gemma 모델에서 최대 30%까지 거부 비율을 높여 형식에 민감함을 보임.
- 미세조정된 7B LLM은 GPT-4 수준의 정확도를 확보하면서도 계산 비용을 줄이며 안정성을 유지함.
- 안전을 강조하는 시스템 프롬프트는 거부 비율을 1~16% 감소시켜, 조건부로 설계된 프롬프트조차도 의도치 않게 안전 정렬을 약화시킬 수 있음을 시사함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.