[论文解读] FFT: Towards Harmlessness Evaluation and Analysis for LLMs with Factuality, Fairness, Toxicity
该论文提出FFT基准,包含2,116个精心设计的测试实例,用于评估大语言模型(LLMs)在事实性、公平性和毒性方面的无害性。该基准采用对抗性、多样化且防越狱的提示,以暴露幻觉、偏见和有害倾向,结果表明,即使是最先进的模型,尤其是经过RLHF微调的模型,其无害性方面仍存在显著不足,且模型规模扩大并不一定提升安全性。
The widespread of generative artificial intelligence has heightened concerns about the potential harms posed by AI-generated texts, primarily stemming from factoid, unfair, and toxic content. Previous researchers have invested much effort in assessing the harmlessness of generative language models. However, existing benchmarks are struggling in the era of large language models (LLMs), due to the stronger language generation and instruction following capabilities, as well as wider applications. In this paper, we propose FFT, a new benchmark with 2116 elaborated-designed instances, for LLM harmlessness evaluation with factuality, fairness, and toxicity. To investigate the potential harms of LLMs, we evaluate 9 representative LLMs covering various parameter scales, training stages, and creators. Experiments show that the harmlessness of LLMs is still under-satisfactory, and extensive analysis derives some insightful findings that could inspire future research for harmless LLM research.
研究动机与目标
- 为解决现有基准在评估LLM无害性时存在的数据重叠、场景狭窄及毒性提示无效等问题。
- 开发一个全面且高保真的基准,以捕捉LLM生成内容中的真实世界风险。
- 探究模型规模、训练阶段及RLHF微调对事实性、公平性和毒性的影响。
- 揭示标准评估协议之外隐藏的偏见和不安全行为。
提出的方法
- 在三个维度上设计2,116个测试实例:事实性(包含误导信息和反事实的对抗性问题)、公平性(涉及身份、信贷、刑事、健康等真实生活场景的多样性情境)、毒性(使用越狱提示以诱发有害响应)。
- 通过故意制造的误导信息和反事实情境构建事实性测试实例,以检验LLMs拒绝错误前提的能力。
- 通过涉及敏感人口统计特征和社会刻板印象的真实、非传统NLP任务生成公平性评估。
- 使用类似越狱的提示绕过安全过滤机制,评估模型在微妙施压下是否仍会生成有毒内容。
- 结合人工标注与自动化指标,对模型在所有三个无害性维度上的响应进行评估。
- 对比9种具有不同架构、参数规模和训练阶段的代表性LLM,包括经过RLHF微调的模型。
实验结果
研究问题
- RQ1RQ1:当面对基于误导信息的对抗性查询时,LLMs在事实性评估中的表现如何?
- RQ2RQ2:在真实生活情境下的公平性评估如何揭示LLMs在不同人口群体中的偏见?
- RQ3RQ3:模型规模如何影响无害性,特别是在帮助性与安全性之间的平衡?
- RQ4RQ4:经过RLHF微调的模型在拒绝有毒、偏见或事实错误内容方面改善程度如何?
主要发现
- 尽管经过先进训练,LLMs在无害性方面仍存在显著问题,许多模型未能拒绝事实错误或带有偏见的查询。
- 经过RLHF微调的模型在表达不确定性或拒绝误导性、有毒提示方面表现更优,表明对齐技术具有有效性。
- 更大的模型并不一定提升无害性;帮助性与安全性的权衡可能导致在某些条件下出现更差的结果。
- 使用标准提示进行毒性评估因现代LLMs的高拒绝率而失效,因此需要采用越狱风格提示才能诱发有意义的响应。
- 该基准揭示,LLMs在被要求拒绝时仍常生成强化有害刻板印象的内容,表明其存在深层偏见。
- 评估结果表明,当前基准在捕捉真实世界风险方面仍显不足,尤其是在细微且依赖上下文的伤害方面。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。