Skip to main content
QUICK REVIEW

[论文解读] Safetywashing: Do AI Safety Benchmarks Actually Measure Safety Progress?

Richard Ren, Steven Basart|arXiv (Cornell University)|Jul 31, 2024
Occupational Health and Safety Research被引用 4
一句话总结

本文研究了AI安全基准是否真正衡量了安全进展,还是仅反映了通用模型能力与训练计算资源。通过对数十个模型和基准的元分析,发现许多安全指标与能力及计算资源高度相关,引发对“安全洗白”(safetywashing)的担忧,并提出了实证性、去相关化的指标,以实现超越规模扩展的真实差异化安全进展。

ABSTRACT

As artificial intelligence systems grow more powerful, there has been increasing interest in "AI safety" research to address emerging and future risks. However, the field of AI safety remains poorly defined and inconsistently measured, leading to confusion about how researchers can contribute. This lack of clarity is compounded by the unclear relationship between AI safety benchmarks and upstream general capabilities (e.g., general knowledge and reasoning). To address these issues, we conduct a comprehensive meta-analysis of AI safety benchmarks, empirically analyzing their correlation with general capabilities across dozens of models and providing a survey of existing directions in AI safety. Our findings reveal that many safety benchmarks highly correlate with both upstream model capabilities and training compute, potentially enabling "safetywashing"--where capability improvements are misrepresented as safety advancements. Based on these findings, we propose an empirical foundation for developing more meaningful safety metrics and define AI safety in a machine learning research context as a set of clearly delineated research goals that are empirically separable from generic capabilities advancements. In doing so, we aim to provide a more rigorous framework for AI safety research, advancing the science of safety evaluations and clarifying the path towards measurable progress.

研究动机与目标

  • 调查广泛使用的AI安全基准是否真正衡量了安全改进,还是被上游通用能力与训练计算资源所混淆。
  • 挑战‘能力提升即安全进展’的假设,尤其是在对齐与鲁棒性基准中。
  • 为区分安全进步与通用能力扩展提供实证基础,降低将能力提升误认为安全提升的风险。
  • 批判对齐理论作为自上而下、基于直觉的范式,可能误导研究优先级,并倡导基于实证的安全评估方法。
  • 为模型开发者与研究人员提供指导,以选择或设计真正与通用能力去相关的基准,从而实现可测量的、差异化的安全进展。

提出的方法

  • 对40多个语言模型在多个安全基准与能力基准上进行综合元分析。
  • 通过提炼通用基准任务(如MMLU、GSM8K)上的表现,计算一个‘能力得分’,以捕捉上游模型能力。
  • 测量安全基准得分与推导出的能力得分及原始训练计算量(FLOPs)之间的相关性。
  • 根据与能力及计算资源的相关性强弱对安全基准进行分类,识别易受安全洗白影响的基准。
  • 分析对齐技术(如RLHF、拒答微调)与安全基准表现之间的关系,评估其与规模扩展的纠缠程度。
  • 提出一种新基准设计框架,使其在实证上与通用能力去相关,从而可测量真正差异化的安全进展。

实验结果

研究问题

  • RQ1AI安全基准在多大程度上与通用模型能力及训练计算资源相关?
  • RQ2哪些安全基准类别(如对齐、可扩展监督、真实性、静态对抗鲁棒性)与上游能力表现出高相关性或低相关性?
  • RQ3能否通过安全指标与能力/计算资源之间的相关性,实证检测到安全洗白?
  • RQ4基于对齐的技术如何影响安全基准表现?它们是否真正提升了安全性,还是仅在扩展通用能力?
  • RQ5可采用哪些标准来设计在实证上可与通用能力分离的安全基准,从而真正衡量安全进展?

主要发现

  • 约一半评估的AI安全基准与通用模型能力及训练计算资源高度相关,表明存在严重的安全洗白风险。
  • 对齐、可扩展监督、真实性以及静态对抗鲁棒性类别的安全基准与能力和计算资源表现出高度相关性,表明其可能无法独立衡量安全性。
  • 相比之下,偏见、动态对抗鲁棒性与校准类基准与能力的相关性相对较低,表明其可能更有效地衡量独立的安全属性。
  • 谄媚行为与武器化风险基准与通用能力表现出显著负相关,表明更强大的模型可能更不易表现出这些行为。
  • 研究发现,尽管对齐理论具有影响力,但其常引导研究方向走向在实证上与通用能力扩展无法区分的路径,从而削弱了实现差异化安全进展的努力。
  • 本文结论认为,当前的安全基准无法可靠地独立于规模扩展来衡量安全进展,呼吁转向基于实证、去相关化的评估框架。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。