[论文解读] Watermarking for Out-of-distribution Detection
本文提出了一种新颖的水印技术,通过将可学习的、数据级的水印模式注入测试输入,在不修改模型权重的情况下,重新配置已训练好的深度模型以实现分布外(OOD)检测。该水印通过增大分布内与分布外数据之间的得分差距,提升了OOD检测性能,在多个基准测试中实现了最先进结果。
Out-of-distribution (OOD) detection aims to identify OOD data based on representations extracted from well-trained deep models. However, existing methods largely ignore the reprogramming property of deep models and thus may not fully unleash their intrinsic strength: without modifying parameters of a well-trained deep model, we can reprogram this model for a new purpose via data-level manipulation (e.g., adding a specific feature perturbation to the data). This property motivates us to reprogram a classification model to excel at OOD detection (a new task), and thus we propose a general methodology named watermarking in this paper. Specifically, we learn a unified pattern that is superimposed onto features of original data, and the model's detection capability is largely boosted after watermarking. Extensive experiments verify the effectiveness of watermarking, demonstrating the significance of the reprogramming property of deep models in OOD detection.
研究动机与目标
- 解决在分布外数据稀少且模型微调成本高昂的安全关键深度学习系统中,分布外检测的挑战。
- 探索深度模型的重编程特性——即通过输入转换可重新利用模型——是否可用于OOD检测。
- 开发一种数据级水印技术,在不修改模型参数的前提下增强OOD检测得分。
- 学习一种统一的、静态的水印模式,在保持输入语义内容的同时提升检测性能。
提出的方法
- 在推理过程中,将可学习的水印模式叠加到输入特征上,同时保留原始输入的语义结构,并嵌入具有区分性的模式。
- 通过可微分的目标函数优化水印,以最大化在预定义评分函数(如自由能、Softmax)下,水印化分布内数据与分布外数据之间的得分差距。
- 优化过程确保模型对水印化分布内输入赋予高置信度,而对分布外输入赋予低置信度,即使水印对模型而言在语义上无意义。
- 采用正则化损失防止模型将水印误认为有效的分布内模式,从而保持鲁棒性。
- 该框架具有通用性,兼容多种评分函数(如logit、梯度、基于嵌入的)和数据集(CIFAR-10、CIFAR-100、SVHN、Places365、iSUN、Texture)。
- 通过验证集(如tiny-ImageNet)调整超参数,并通过消融实验验证不同水印区域的贡献。
实验结果
研究问题
- RQ1能否利用预训练深度模型的重编程特性,在不进行模型微调的情况下提升分布外检测性能?
- RQ2可学习的数据级水印是否能改善分布内与分布外输入之间的得分分离?
- RQ3水印的空间分布(中心 vs. 边缘)如何影响OOD检测性能?
- RQ4该水印方法是否在不同评分函数和数据集上具有泛化能力?
- RQ5水印强度与稀疏性对检测性能有何影响?
主要发现
- 在CIFAR-10上使用自由能评分时,水印将FPR95从基线的55.00%降低至29.75%,同时将AUROC从89.69%提升至95.16%。
- 在CIFAR-100上,水印方法实现了平均AUROC 76.47%,而无水印时为73.77%,表明性能持续提升。
- 仅遮蔽最高幅度水印组件的10%(χ₁=0.10)即导致AUROC显著下降至94.41%,表明整个水印模式对性能至关重要。
- 该方法在多个基准测试中优于基线OOD检测方法,包括iSUN、SVHN、Places365和LSUN,FPR95、AUROC和AUPR均实现一致提升。
- 性能增益在不同评分函数(自由能、Softmax及其他)下均表现稳健,证实了该方法的泛化能力。
- 消融实验表明,水印的中心与边缘区域均对检测有贡献,其中边缘模式编码了隐藏知识,可增强OOD区分能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。