Skip to main content
QUICK REVIEW

[论文解读] Towards Grad-CAM Based Explainability in a Legal Text Processing Pipeline

Łukasz Górski, Shashishekar Ramakrishna|arXiv (Cornell University)|Dec 15, 2020
Artificial Intelligence in Law被引用 5
一句话总结

本文首次将Grad-CAM这一计算机视觉可解释性技术应用于法律文本处理流程。通过将Grad-CAM适配至法律文本上的卷积神经网络(CNN),作者展示了不同词嵌入(如DistilBERT、word2vec、Law2Vec)如何影响模型注意力与预测结果,表明DistilBERT能带来更广泛的关注范围,而Grad-CAM引导的剪枝方法可在减少输入数据的同时保持模型准确率。

ABSTRACT

Explainable AI(XAI)is a domain focused on providing interpretability and explainability of a decision-making process. In the domain of law, in addition to system and data transparency, it also requires the (legal-) decision-model transparency and the ability to understand the models inner working when arriving at the decision. This paper provides the first approaches to using a popular image processing technique, Grad-CAM, to showcase the explainability concept for legal texts. With the help of adapted Grad-CAM metrics, we show the interplay between the choice of embeddings, its consideration of contextual information, and their effect on downstream processing.

研究动机与目标

  • 将Grad-CAM引入为法律文本处理流程的后处理可解释性方法。
  • 评估不同词嵌入(上下文相关与非上下文相关)对法律文本分类中CNN注意力模式的影响。
  • 开发用于量化和比较不同嵌入类型下模型注意力范围的指标。
  • 探索通过Grad-CAM引导的词选择实现数据优化,减少输入规模而不损失准确率。
  • 为未来将可解释性与法律决策透明化(认识论视角)相结合奠定基础。

提出的方法

  • 将Grad-CAM适配用于生成处理法律文本输入的CNN的类别激活热力图。
  • 对Grad-CAM热力图应用二值化阈值(如0.15)以识别对预测有贡献的关键词。
  • 定义指标$\mathcal{F}(t)$,用于计算CNN在测试句子中为预测而考虑的输入标记的平均比例。
  • 提出一种基于Grad-CAM注意力的白名单策略,在推理过程中仅保留高注意力词。
  • 比较完整输入与Grad-CAM优化后输入的模型性能(准确率),以评估数据效率。
  • 应用指标$\mathcal{F}(t)$与$\mathcal{I}$(Jaccard指数)量化不同嵌入类型之间的注意力分布范围与相似性。

实验结果

研究问题

  • RQ1词嵌入的选择(如DistilBERT、word2vec、Law2Vec)如何影响CNN在法律文本上的注意力分布?
  • RQ2基于Grad-CAM的注意力图能否揭示上下文相关与非上下文相关嵌入在法律NLP中处理上下文差异的能力?
  • RQ3Grad-CAM在多大程度上可用于识别和提取法律句子中最关键的词语,以支持下游数据优化?
  • RQ4将输入句子剪枝为仅包含Grad-CAM识别的关键词是否能保持法律文本分类任务中的模型准确率?
  • RQ5所提出的指标能否作为低资源或半监督法律NLP设置中评估嵌入质量的可靠代理?

主要发现

  • DistilBERT嵌入的$\mathcal{F}(t)$平均值最高,表明其在输入句子中具有更广泛的关注范围,优于word2vec与Law2Vec。
  • word2vec与Law2Vec在注意力模式上表现出高度相似性,这由较高的$\mathcal{I}$指标(Jaccard指数)证实,表明其注意力行为相近。
  • Grad-CAM引导的输入剪枝在减少输入规模的同时保持了模型准确率——对于PTSD-word2vec(GoogleNews)达到0.7的准确率,对于PTSD-DistilBERT达到0.85。
  • 该方法可识别每句话中的关键词语,从而为数据处理流程优化和计算负载降低提供可能。
  • 所提出的指标$\mathcal{F}(t)$与$\mathcal{I}$为从注意力覆盖范围与一致性角度量化比较嵌入模型提供了定量依据。
  • 结果表明,Grad-CAM可作为分析法律嵌入中上下文依赖性的工具,支持模型可解释性与优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。