[论文解读] Generating Plausible Counterfactual Explanations for Deep Transformers in Financial Text Classification
本文提出了一种新颖的方法,通过对抗性训练的变换器模型,在金融文本分类中生成更可信的反事实解释。通过利用掩码语言建模和三种不同的编辑策略——替换、插入和删除,该方法在人类评估中显著提升了解释的可信度和合理性,相较于最先进的方法如HotFlip,p < 0.001 和 p < 0.05。
Corporate mergers and acquisitions (M&A) account for billions of dollars of investment globally every year, and offer an interesting and challenging domain for artificial intelligence. However, in these highly sensitive domains, it is crucial to not only have a highly robust and accurate model, but be able to generate useful explanations to garner a user's trust in the automated system. Regrettably, the recent research regarding eXplainable AI (XAI) in financial text classification has received little to no attention, and many current methods for generating textual-based explanations result in highly implausible explanations, which damage a user's trust in the system. To address these issues, this paper proposes a novel methodology for producing plausible counterfactual explanations, whilst exploring the regularization benefits of adversarial training on language models in the domain of FinTech. Exhaustive quantitative experiments demonstrate that not only does this approach improve the model accuracy when compared to the current state-of-the-art and human performance, but it also generates counterfactual explanations which are significantly more plausible based on human trials.
研究动机与目标
- 为解决金融文本分类中可解释人工智能的缺乏,特别是在高风险并购预测中的应用。
- 生成既可信又合理的反事实解释,以增强用户对模型预测结果的信任。
- 通过对抗性训练提升模型鲁棒性,同时在真实世界并购数据上保持高准确率。
- 克服现有事后解释方法存在的局限性,这些方法常产生不可信或难以解释的解释。
- 建立一个可扩展、自动化的框架,用于在金融科技应用中生成类人的反事实解释。
提出的方法
- 该方法采用经过微调的变换器模型,通过对抗性正则化进行训练,以增强金融文本上的鲁棒性和泛化能力。
- 提出三种基于编辑的策略——REP-SCD(替换)、INS-SCD(插入)和RM-SCD(删除),从原始并购文本生成反事实实例。
- 每个反事实实例均通过掩码语言模型生成,以确保语法正确性和语义连贯性。
- 该方法采用事后解释框架,识别出其修改会导致预测结果发生改变的关键词或短语。
- 通过领域专家进行人工评估,采用1–5分制对解释的可信度和合理性进行评分,并与HotFlip方法进行比较。
- 模型在真实世界、自收集的并购数据集上进行评估,确保其相关性和实际适用性。
实验结果
研究问题
- RQ1对抗性训练的变换器能否在金融文本分类中生成更具鲁棒性和准确性的并购预测?
- RQ2通过受控文本编辑生成的反事实解释,是否会被领域专家视为更具可信度和合理性?
- RQ3所提出的编辑策略(替换、插入、删除)在生成有意义且语言上有效的反事实解释方面,表现如何比较?
- RQ4该方法在生成有用反事实解释方面,相较于最先进的基线方法(如HotFlip)的优越程度如何?
- RQ5对抗性训练的引入是否同时提升了模型的准确率和生成解释的质量?
主要发现
- 在人工评估中,与HotFlip相比,该方法在可信度方面提升了2.35分(4.35 vs. 2.00),p值 < 0.001。
- 在合理性方面,相比HotFlip提升了0.85分(4.00 vs. 3.15),p值 < 0.05,表明具有统计显著性。
- 该模型在并购数据集上的分类准确率,优于最先进的方法和人类表现。
- 对抗性训练的使用增强了模型的鲁棒性,从而带来了更可靠和可泛化的预测结果。
- 生成的反事实解释在自然性和语言连贯性方面,持续优于基于梯度的基线方法。
- REP-SCD、INS-SCD和RM-SCD策略的结合,产生了最有效且多样化的反事实实例集合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。