[论文解读] Self-Supervised Losses for One-Class Textual Anomaly Detection
该论文提出了一种简单而有效的自监督方法,通过在正常数据上微调 BERT 来实现单类文本异常检测,采用掩码语言建模(MLM)、因果语言建模(CLM)或对比学习(SimCSE)作为预训练目标,然后将模型的损失作为异常得分。与现有方法相比,该方法在语义异常上的 AUROC 提升了 11.6%,在句法异常上提升了 22.8%,性能表现取决于异常类型及表示特性。
Current deep learning methods for anomaly detection in text rely on supervisory signals in inliers that may be unobtainable or bespoke architectures that are difficult to tune. We study a simpler alternative: fine-tuning Transformers on the inlier data with self-supervised objectives and using the losses as an anomaly score. Overall, the self-supervision approach outperforms other methods under various anomaly detection scenarios, improving the AUROC score on semantic anomalies by 11.6% and on syntactic anomalies by 22.8% on average. Additionally, the optimal objective and resultant learnt representation depend on the type of downstream anomaly. The separability of anomalies and inliers signals that a representation is more effective for detecting semantic anomalies, whilst the presence of narrow feature directions signals a representation that is effective for detecting syntactic anomalies.
研究动机与目标
- 解决在训练阶段仅能获取正常样本的单类文本异常检测挑战。
- 评估自监督微调目标是否能在无需监督信号或复杂架构的前提下,作为有效的异常检测器。
- 研究不同自监督目标对语义异常与句法异常检测性能的影响。
- 分析与检测性能相关的表示属性,如可分性与特征脆弱性。
提出的方法
- 使用三种自监督目标对预训练的 BERT BASE 编码器进行微调:掩码语言建模(MLM)、因果语言建模(CLM)和对比学习(SimCSE)。
- 在推理阶段,使用每个微调模型的交叉熵损失作为异常得分,损失越高表示异常可能性越大。
- 通过在两类异常上计算 AUROC 来评估性能:语义异常(通过类别划分生成)和句法异常(通过句子重排生成)。
- 提取最后一层隐藏表示,并分析其属性:通过逻辑分类准确率衡量可分性,通过平均 L2 梯度范数衡量特征脆弱性。
- 将端到端损失得分方法与使用嵌入表示在 k-NN 分类器中的表现进行比较,以评估表示的实用性。
- 对排列强度(1-gram 到 4-gram 重排)进行消融实验,评估不同目标在句法扰动增强下的鲁棒性。
实验结果
研究问题
- RQ1能否通过使用损失作为异常得分,对预训练 Transformer 模型进行自监督微调,在单类设置下超越更复杂的监督异常检测方法?
- RQ2自监督目标的选择(MLM、CLM、SimCSE)如何影响在语义异常与句法异常上的性能表现?
- RQ3哪些表示属性(如类别可分性或特征脆弱性)能预测更好的异常检测性能?
- RQ4直接使用模型损失作为异常得分,是否优于将学习到的嵌入表示作为下游分类器的特征?
主要发现
- 与现有方法相比,使用自监督目标微调 BERT 后,语义异常的 AUROC 平均提升 11.6%,句法异常的 AUROC 提升 22.8%。
- CLM 目标在句法异常难度逐渐增加时表现最稳定,从 1-gram 到 4-gram 重排仅导致 AUROC 下降 4%,优于 MLM 和 SimCSE。
- 对于语义异常检测,正常样本与异常样本之间的表示可分性是性能的强预测因子,分类准确率与 AUROC 之间存在高度相关性。
- 对于句法异常,更高的梯度范数(表示特征更脆弱)与更好的检测性能强相关,尤其在基于 CLM 的模型中表现明显。
- 端到端使用损失作为异常得分的方法始终优于将学习到的嵌入表示用于 k-NN 分类器的性能。
- SimCSE 目标生成的表示最接近各向同性,而 CLM 生成的表示最具有各向异性和脆弱性,这与它在句法异常检测中的优越表现一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。