[論文レビュー] SafetyPrompts: a Systematic Review of Open Datasets for Evaluating and Improving Large Language Model Safety
本論文は、大規模言語モデル(LLM)の安全性を評価・向上させるための102のオープンデータセットについて体系的レビューを行い、合成データや専門的データセットの増加、英語資源の優位性、最新のデータセットの実践的活用不足といったトレンドを同定した。主な貢献は、研究および産業分野におけるLLM安全性評価の実践を標準化・改善するための、継続的に更新されるコミュニティメンテナンス型のデータベースであるSafetyPrompts.comの構築である。
The last two years have seen a rapid growth in concerns around the safety of large language models (LLMs). Researchers and practitioners have met these concerns by creating an abundance of datasets for evaluating and improving LLM safety. However, much of this work has happened in parallel, and with very different goals in mind, ranging from the mitigation of near-term risks around bias and toxic content generation to the assessment of longer-term catastrophic risk potential. This makes it difficult for researchers and practitioners to find the most relevant datasets for their use case, and to identify gaps in dataset coverage that future work may fill. To remedy these issues, we conduct a first systematic review of open datasets for evaluating and improving LLM safety. We review 144 datasets, which we identified through an iterative and community-driven process over the course of several months. We highlight patterns and trends, such as a trend towards fully synthetic datasets, as well as gaps in dataset coverage, such as a clear lack of non-English and naturalistic datasets. We also examine how LLM safety datasets are used in practice -- in LLM release publications and popular LLM benchmarks -- finding that current evaluation practices are highly idiosyncratic and make use of only a small fraction of available datasets. Our contributions are based on SafetyPrompts.com, a living catalogue of open datasets for LLM safety, which we plan to update continuously as the field of LLM safety develops.
研究の動機と目的
- 急速に拡大するが断片的であるLLM安全性データセットの生態を是正し、研究者が特定の安全性の目的に適したデータセットを選定しにくくなる問題に対処する。
- データセット作成、フォーマット、言語カバレッジ、ライセンスに関する主要なトレンド、ギャップ、パターンを同定し、今後のデータセット開発を支援する。
- オープンな安全性データセットが現在、モデルリリース論文および人気のあるLLMベンチマークでどの程度活用されているかを評価し、不整合性や活用不足を暴露する。
- SafetyPrompts.comにて、継続的に更新されるオープンLLM安全性データセットの動的かつ公開可能なデータベースを構築し、標準化を促進し、評価実践を改善する。
- 最新の安全性データセットの可用性と、それらが現実のモデル評価で実際にどのように使われているかの間には顕著な乖離が存在することを強調し、標準化の改善を求める。
提案手法
- 2018年6月から2024年2月までの期間にわたり、学術論文、GitHub、Hugging Faceを対象とした体系的かつコミュニティ主導のサーチを実施し、LLM安全性に関連するオープンデータセットを同定した。
- 厳密な適合基準を適用:テキストのみのデータセット、安全性(例:バイアス、毒性、アライメント、ジャイルブレーキング)に関連するもの、GitHub や Hugging Face での公開、ライセンスや言語に制限がないこと。
- 目的、作成方法(例:合成、実世界データ)、フォーマット、サイズ、アクセス方法、ライセンス、出版履歴の観点から102のデータセットを分析した。
- 125件のモデルリリース論文および10の代表的なLLMベンチマークにおけるデータセット使用状況をマッピングし、実世界での採用パターンを評価した。
- 安全性の焦点(例:社会的・文化的バイアス、毒性生成、権力志向行動)ごとにデータセットを分類し、言語多様性と合成データの普及度を評価した。
- SafetyPrompts.comにて、継続的に更新される動的で公開可能なデータセットデータベースを維持し、新規データセットの追加とメタデータの更新を実施した。
実験結果
リサーチクエスチョン
- RQ1LLM安全性のためのオープンデータセットの作成・設計における支配的トレンドは何か。特に、データモダリティ、言語、合成対比実世界データソースの観点から。
- RQ2オープンな安全性データセットは現在、モデルリリース論文および確立されたLLMベンチマークでどの程度活用されており、利用可能なデータセットの多様性をどの程度反映しているか。
- RQ3言語多様性や、サキュファニー(的外れな賛辞)や権力志向行動といった新たな安全性リスクに適合していない点を含め、現在のデータセットカバレッジにおける主なギャップは何か。
- RQ4新規で高品質な安全性データセットが利用可能であるにもかかわらず、なぜそれらが主流の評価実践に採用されないのか。
- RQ5既存のオープンデータセットの幅広い活用を活かして、LLM安全性評価の実践をどのように標準化できるか。
主な発見
- オープンLLM安全性データセットの作成は、前例のない速さで拡大しており、レビュー対象の102データセットの半数以上が2023年以降に公開された。
- 完全に合成されたデータセットへの傾向が強く、特にレッドチーム、ジャイルブレーキング、アライメントテストなどの専門的評価分野で顕著である。
- 英語が支配的であり、特に米国外の機関から作成された非英語の安全性データセットが著しく不足している。
- 最新のデータセットが利用可能であるにもかかわらず、モデルリリース論文およびベンチマークは主に2021–2022年の古いデータセット(例:BOLD や ToxiGen)に依存しており、現在のLLMの挙動を反映していない。
- モデルリリースとベンチマークの両方の評価実践は極めて個別的であり、データセット使用の重複がほとんどなく、標準化の欠如が顕著である。
- 本レビューは、最新で文脈的に関連性の高いデータセットを主流のベンチマーキングおよびリリース評価に統合することで、LLM安全性評価の改善に大きな機会があると同定した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。