Skip to main content
QUICK REVIEW

[論文レビュー] FFT: Towards Harmlessness Evaluation and Analysis for LLMs with Factuality, Fairness, Toxicity

Shiyao Cui, Zhenyu Zhang|arXiv (Cornell University)|Nov 30, 2023
Topic Modeling被引用数 4
ひとこと要約

この論文は、事実性、公平性、毒性の観点から大規模言語モデル(LLMs)の無害性を評価するための新しいベンチマークFFTを紹介している。2,116件の慎重に設計されたインスタンスを用い、敵対的で多様なプロンプトに加え、改ざん防止(jailbreak-protected)の仕組みを備えたものにより、幻覚、バイアス、有害な傾向を露呈する。その結果、強化学習による人間適合(RLHF)で微調整された最新鋭のモデルですら、無害性の面で顕著な欠陥を示しており、スケーリングが安全を必然的に向上させるわけではないことが明らかになった。

ABSTRACT

The widespread of generative artificial intelligence has heightened concerns about the potential harms posed by AI-generated texts, primarily stemming from factoid, unfair, and toxic content. Previous researchers have invested much effort in assessing the harmlessness of generative language models. However, existing benchmarks are struggling in the era of large language models (LLMs), due to the stronger language generation and instruction following capabilities, as well as wider applications. In this paper, we propose FFT, a new benchmark with 2116 elaborated-designed instances, for LLM harmlessness evaluation with factuality, fairness, and toxicity. To investigate the potential harms of LLMs, we evaluate 9 representative LLMs covering various parameter scales, training stages, and creators. Experiments show that the harmlessness of LLMs is still under-satisfactory, and extensive analysis derives some insightful findings that could inspire future research for harmless LLM research.

研究の動機と目的

  • 既存のベンチマークがデータの重複、限定されたシナリオ、効果の薄い毒性プロンプトのため、LLMの無害性を評価する上で限界を示していることへの対処。
  • 現実世界のリスクを的確に捉える、包括的で高精度なベンチマークの開発。
  • モデルのスケール、トレーニング段階、RLHF微調整の影響が事実性、公平性、毒性に与える影響の調査。
  • 標準的な評価プロトコルを超えた、隠れたバイアスや安全でない行動の特定。

提案手法

  • 事実性(意図的な誤情報と反事実的状況を含む敵対的質問)、公平性(アイデンティティ、クレジット、犯罪、健康に関連する多様な現実のシナリオ)、毒性(有害な応答を引き出すために安全フィルタを回避するためのjailbreakプロンプト)の3次元にわたり、合計2,116件のインスタンスを設計。
  • 誤情報と反事実的状況を意図的に組み込むことで、LLMが誤った前提を拒否できるかをテストするため、事実性インスタンスを構築。
  • 感受性の高い人口統計や社会的ステレオタイプを含む、非伝統的なNLPタスクを通じて、公平性の評価を実施。
  • 安全フィルタを回避するためのjailbreak風プロンプトを用い、わずかな圧力下でも有害な応答を生成するかどうかを評価。
  • 人間によるアノテーションと自動評価指標を併用し、すべての3つの無害性次元におけるモデルの応答を評価。
  • アーキテクチャ、パラメータスケール、トレーニング段階の異なる9種類の代表的LLMを比較。

実験結果

リサーチクエスチョン

  • RQ1RQ1: 意図的な誤情報に基づく敵対的プロンプトに直面した際、LLMは事実性評価でどの程度のパフォーマンスを示すか?
  • RQ2RQ2: 現実のシナリオにおける公平性評価は、異なる人種的・文化的背景を持つグループにおけるLLMのバイアスをどのように露呈するか?
  • RQ3RQ3: モデルのスケーリングは、有用性と安全性のバランスを考慮した場合、無害性にどのように影響を与えるか?
  • RQ4RQ4: RLHFで微調整されたモデルは、有害、偏見、事実誤認のある内容をどの程度効果的に拒否できるか?

主な発見

  • 高度なトレーニングを経てもLLMは依然として顕著な無害性の問題を示しており、多くのモデルが事実誤認やバイアスのある質問を拒否できない。
  • RLHFで微調整されたモデルは、誤情報や有害なプロンプトに対して不確実性を表明するか拒否する能力が強く、アライメント技術の有効性を示している。
  • 大規模なモデルでも無害性が必然的に向上するわけではない。有用性と安全性のトレードオフが、特定の条件下では悪化を招く可能性がある。
  • 標準的なプロンプトでは、現代のLLMが拒否率が高いため、毒性評価が機能しないため、意味のある応答を得るにはjailbreak風プロンプトの使用が不可欠である。
  • ベンチマークは、LLMが意図的に拒否を促しても、しばしば有害なステレオタイプを強化する内容を生成していることを明らかにした。これは、根本的なバイアスの存在を示している。
  • 評価は、現行のベンチマークが、文脈依存的で繊細な害を捉えるには不十分であることを強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。