Skip to main content
QUICK REVIEW

[论文解读] Adversarial Training for High-Stakes Reliability

Daniel M. Ziegler, Seraphina Nix|arXiv (Cornell University)|May 3, 2022
Adversarial Robustness in Machine Learning被引用 9
一句话总结

本文提出了一种结合人工介入的对抗性训练方法,以提升语言模型在高风险场景下的可靠性,特别针对有害文本补全的过滤。通过使用工具辅助的人工对手,该方法显著增强了模型的鲁棒性——在使用工具时,生成对抗性样本的时间从13分钟延长至26分钟,未使用工具时则从20分钟延长至44分钟,同时保持了分布内性能,并实现了保守分类器阈值的设定,仅造成极小的质量损失。

ABSTRACT

In the future, powerful AI systems may be deployed in high-stakes settings, where a single failure could be catastrophic. One technique for improving AI safety in high-stakes settings is adversarial training, which uses an adversary to generate examples to train on in order to achieve better worst-case performance. In this work, we used a safe language generation task (``avoid injuries'') as a testbed for achieving high reliability through adversarial training. We created a series of adversarial training techniques -- including a tool that assists human adversaries -- to find and eliminate failures in a classifier that filters text completions suggested by a generator. In our task, we determined that we can set very conservative classifier thresholds without significantly impacting the quality of the filtered outputs. We found that adversarial training increased robustness to the adversarial attacks that we trained on -- doubling the time for our contractors to find adversarial examples both with our tool (from 13 to 26 minutes) and without (from 20 to 44 minutes) -- without affecting in-distribution performance. We hope to see further work in the high-stakes reliability setting, including more powerful tools for enhancing human adversaries and better ways to measure high levels of reliability, until we can confidently rule out the possibility of catastrophic deployment-time failures of powerful models.

研究动机与目标

  • 为解决高风险人工智能部署中灾难性失败的问题,即即使出现一次失败也无法接受的情况。
  • 评估对抗性训练作为提升语言模型最坏情况可靠性的方法。
  • 开发并测试一种工具辅助的人工对手,以增强对抗性样本的发现能力。
  • 探究是否可通过保守分类器阈值在最小影响平均情况输出质量的前提下,维持高水平的最坏情况可靠性。
  • 探索在现实世界人工智能系统中测量和提升高风险可靠性的实用技术。

提出的方法

  • 训练了一个分类器,用于在故事续写任务中检测有害的文本补全内容。
  • 通过三种方法生成对抗性样本:未经增强的人工攻击、对先前对抗性样本的改写,以及使用工具辅助的人工重写。
  • 在迭代循环中,将所有三种攻击类型生成的对抗性样本用于重新训练分类器,以提升其鲁棒性。
  • 开发了一项新工具,协助人工对手重写提示词和补全内容,以生成更有效的对抗性样本。
  • 设置保守的分类器阈值以优先保障最坏情况下的安全性,并在分布内数据上持续监控性能。
  • 通过承包商在训练前后生成对抗性样本所花费的时间来衡量鲁棒性。

实验结果

研究问题

  • RQ1结合人工介入的对抗性训练是否能显著提升分类器对有害文本补全的鲁棒性?
  • RQ2在不降低非对抗性输出质量的前提下,保守分类器阈值的适用程度如何?
  • RQ3与未经辅助的人工相比,工具辅助的人工对手在生成更多样化和更有效的对抗性样本方面效果如何?
  • RQ4对抗性训练是否能在不降低分布内性能的前提下提升最坏情况下的可靠性?
  • RQ5对抗性训练对剩余失败的严重性和性质有何影响?

主要发现

  • 对抗性训练使鲁棒性显著提升,使用工具辅助攻击方法时,生成对抗性样本的时间从13分钟延长至26分钟。
  • 未使用工具时,生成对抗性样本的时间同样翻倍,从20分钟延长至44分钟,表明鲁棒性得到普遍提升。
  • 对抗性训练后,分类器在分布内数据上的性能保持不变,表明标准样本上的表现未下降。
  • 对抗性训练后模型中剩余的失败事件更轻微,且更少涉及对伤害的直接提及。
  • 保守分类器阈值的设定未显著影响生成器输出的质量,从而实现了高水平的最坏情况可靠性。
  • 工具辅助的人工攻击方法在提升对抗性样本的多样性和难度方面表现有效,从而增强了训练过程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。