[논문 리뷰] SafetyPrompts: a Systematic Review of Open Datasets for Evaluating and Improving Large Language Model Safety
이 논문은 대규모 언어 모델(Large Language Model, LLM)의 안전성 평가 및 향상을 위한 102개의 개방형 데이터셋에 대한 체계적인 리뷰를 제시하며, 합성 및 전문화된 데이터셋의 부상, 영어 자료의 지배적 우세, 그리고 최신 데이터셋의 실무에서의 낮은 활용도와 같은 추세를 밝혀낸다. 주요 기여는 연구 및 산업 전반에서 LLM 안전성 평가 관행을 표준화하고 향상시키기 위해 공동으로 유지 관리되는 생동하는 카탈로그인 SafetyPrompts.com를 제공하는 것이다.
The last two years have seen a rapid growth in concerns around the safety of large language models (LLMs). Researchers and practitioners have met these concerns by creating an abundance of datasets for evaluating and improving LLM safety. However, much of this work has happened in parallel, and with very different goals in mind, ranging from the mitigation of near-term risks around bias and toxic content generation to the assessment of longer-term catastrophic risk potential. This makes it difficult for researchers and practitioners to find the most relevant datasets for their use case, and to identify gaps in dataset coverage that future work may fill. To remedy these issues, we conduct a first systematic review of open datasets for evaluating and improving LLM safety. We review 144 datasets, which we identified through an iterative and community-driven process over the course of several months. We highlight patterns and trends, such as a trend towards fully synthetic datasets, as well as gaps in dataset coverage, such as a clear lack of non-English and naturalistic datasets. We also examine how LLM safety datasets are used in practice -- in LLM release publications and popular LLM benchmarks -- finding that current evaluation practices are highly idiosyncratic and make use of only a small fraction of available datasets. Our contributions are based on SafetyPrompts.com, a living catalogue of open datasets for LLM safety, which we plan to update continuously as the field of LLM safety develops.
연구 동기 및 목표
- 빠르게 확장되고 분산되어 있는 LLM 안전성 데이터셋 생태계로 인해 연구자들이 특정 안전 목표에 적합한 데이터셋을 선정하는 데 어려움을 겪는 문제를 해결한다.
- 데이터셋 개발 지침을 안내하기 위해 데이터셋 생성, 포맷, 언어 커버리지, 라이선스 등의 측면에서 핵심 추세, 격차, 패턴을 식별한다.
- 모델 출시 논문과 주요 LLM 벤치마크에서 개방형 안전성 데이터셋이 어떻게 현재 사용되고 있는지 평가하여 일관성 부족과 낮은 활용도를 드러낸다.
- 연구 및 산업 전반에서 LLM 안전성 평가 관행을 표준화하고 향상시키기 위해 SafetyPrompts.com에서 지속적으로 업데이트되는 생동하는 개방형 LLM 안전성 데이터셋 카탈로그를 구축한다.
- 최신 안전성 데이터셋의 가용성과 실제 모델 평가에서의 활용 간 괴리를 드러내며, 표준화를 향한 개선이 필요하다고 주장한다.
제안 방법
- 2018년 6월부터 2024년 2월까지의 기간 동안 학술 논문, GitHub, Hugging Face를 대상으로 체계적이고 공동으로 참여하는 방식으로 LLM 안전성과 관련된 개방형 데이터셋을 탐색하였다.
- 엄격한 포함 기준을 적용: 텍스트 전용 데이터셋, 안전성과 관련된 내용(예: 편향, 독성, 일치성, 제어 회피), GitHub 또는 Hugging Face를 통한 가용성, 그리고 라이선스나 언어에 제한이 없는 것.
- 목적, 생성 방법(예: 합성, 실제 세계 데이터), 포맷, 크기, 접근 방식, 라이선스, 출판력역사 등 핵심 차원에서 102개의 데이터셋을 분석하였다.
- 125개의 모델 출시 논문과 10개의 주요 LLM 벤치마크에서 데이터셋 사용을 맵핑하여 실제 적용 패턴을 평가하였다.
- 안전성 초점(예: 사회적·인구학적 편향, 독성 생성, 권력 추구 행동 등)에 따라 데이터셋을 분류하고 언어 다양성과 합성 데이터의 확산 정도를 평가하였다.
- SafetyPrompts.com에서 지속적으로 업데이트되는 공개 접근이 가능한 동적 데이터셋 카탈로그를 유지 관리하였다.
실험 결과
연구 질문
- RQ1LLM 안전성에 대한 개방형 데이터셋의 생성 및 설계에서 지배적인 추세는 무엇인가? 특히 데이터 모odal리티, 언어, 합성 대비 실제 세계 자료의 비중에 대해 설명하라.
- RQ2현재 개방형 안전성 데이터셋은 모델 출시 논문과 확립된 LLM 벤치마크에서 어떻게 사용되고 있으며, 가용한 데이터셋의 다양성을 얼마나 반영하고 있는가?
- RQ3언어 다양성과 같은 측면에서 현재 데이터셋 커버리지의 주요 격차는 무엇인가? 특히 사기성 또는 권력 추구 행동과 같은 새로운 안전 위험과의 일치 여부를 고려할 것.
- RQ4최근에 출시된 고품질의 안전성 데이터셋이 존재하는 데도 불구하고, 왜 그들이 주류 평가 관행에 통합되지 않는가?
- RQ5기존의 개방형 데이터셋 전반을 활용하여 LLM 안전성 평가 관행을 어떻게 표준화할 수 있는가?
주요 결과
- LLM 안전성 데이터셋의 개방형 생성은 예상치 못한 속도로 증가했으며, 분석된 102개 데이터셋 중 절반 이상이 2023년 또는 이후에 출간되었다.
- 완전히 합성된 데이터셋으로의 경향이 뚜렷하며, 특히 레드팀, 제어 회피, 일치성 테스트와 같은 전문화된 안전성 평가에 주로 사용되고 있다.
- 영어가 데이터셋 생태계를 지배하고 있으며, 특히 미국 이외의 기관에서 제작된 비영어 안전성 데이터셋이 극도로 부족한 상황이다.
- 최신 데이터셋이 가용한 상황에도 불구하고, 모델 출시 논문과 벤치마크는 주로 2021~2022년도의 오래된 데이터셋(예: BOLD, ToxiGen)에 의존하고 있으며, 이는 현재 LLM의 행동을 반영하지 못하고 있다.
- 모델 출시와 벤치마크 양쪽 모두에서 평가 관행이 매우 특수화되어 있으며, 데이터셋 사용에 대한 겹침이 극히 적어 표준화 부족을 시사한다.
- 최신의 더 맥락에 부합하는 데이터셋을 주요 벤치마크와 출시 평가에 통합함으로써 LLM 안전성 평가를 향상시킬 수 있는 중대한 기회를 식별하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.