Skip to main content
QUICK REVIEW

[论文解读] Sensitive Data Detection with High-Throughput Neural Network Models for Financial Institutions

Anh T. Truong, Austin Walters|arXiv (Cornell University)|Dec 17, 2020
Topic Modeling参考文献 22被引用 8
一句话总结

本文提出了一种高吞吐量的字符级卷积神经网络(CNN)模型,用于在金融机构的多种数据格式中检测非公开个人身份信息(NPI)。在合成数据、电子邮件和内部结构化数据上的评估表明,该CNN模型在准确率(F1分数)和吞吐量方面均优于BiLSTM-CRF、spaCy和正则表达式基线模型,是生产环境中敏感数据检测流水线的最优选择。

ABSTRACT

Named Entity Recognition has been extensively investigated in many fields. However, the application of sensitive entity detection for production systems in financial institutions has not been well explored due to the lack of publicly available, labeled datasets. In this paper, we use internal and synthetic datasets to evaluate various methods of detecting NPI (Nonpublic Personally Identifiable) information commonly found within financial institutions, in both unstructured and structured data formats. Character-level neural network models including CNN, LSTM, BiLSTM-CRF, and CNN-CRF are investigated on two prediction tasks: (i) entity detection on multiple data formats, and (ii) column-wise entity prediction on tabular datasets. We compare these models with other standard approaches on both real and synthetic data, with respect to F1-score, precision, recall, and throughput. The real datasets include internal structured data and public email data with manually tagged labels. Our experimental results show that the CNN model is simple yet effective with respect to accuracy and throughput and thus, is the most suitable candidate model to be deployed in the production environment(s). Finally, we provide several lessons learned on data limitations, data labelling and the intrinsic overlap of data entities.

研究动机与目标

  • 解决金融机构中非公开个人身份信息(NPI)检测缺乏公开可用标注数据集的问题。
  • 开发并评估神经网络模型,用于在非结构化文本和结构化表格数据格式中检测敏感实体。
  • 通过在CPU和GPU硬件上平衡准确率、F1分数、精确率、召回率和吞吐量,优化模型性能以适用于生产环境。
  • 研究使用字符级模型克服领域特定NPI实体常见之OOV(词汇表外)问题的可行性。
  • 提供关于数据生成、标注挑战以及现实世界NER系统中实体重叠的实际见解,适用于金融数据。

提出的方法

  • 在非结构化文本和结构化格式(CSV、JSON、Parquet)中生成包含真实NPI实体(如SSN、银行账户号码、电话号码)的合成数据集。
  • 训练并评估多种字符级神经网络模型:CNN、LSTM、BiLSTM-CRF、CNN-CRF以及混合架构,包括微调后的spaCy NER模型。
  • 采用CRF层作为条件随机场标签解码器,以提升在标记级别预测上的序列标注性能。
  • 通过在CPU(c5.2xlarge)和GPU实例(g4dn.xlarge、g4dn.8xlarge、p3.2xlarge)上进行硬件感知的模型推理优化,测量吞吐量和延迟。
  • 通过修改输入预处理方式,将CNN模型适配为表格数据的列级实体预测,实现跨数据格式的通用应用。
  • 将模型与手工设计的正则表达式过滤器及带手工特征的CRF模型进行对比,以确立基线性能。

实验结果

研究问题

  • RQ1在金融数据的生产级NPI检测中,哪种神经网络架构在检测准确率(F1分数)和推理吞吐量之间实现了最佳权衡?
  • RQ2字符级模型与词级模型(如spaCy)相比,在检测金融文本中词汇表外的领域特定NPI实体方面表现如何?
  • RQ3当合成数据缺乏上下文真实性时,模型性能相较于真实电子邮件和内部数据会下降到何种程度?
  • RQ4是否可以有效将单一模型架构(如CNN)适配于非结构化文本和结构化列级实体检测,且仅需极少的流水线修改?
  • RQ5重叠敏感实体(如SSN、电话号码、BAN)引入了哪些关键挑战,以及它们如何影响模型性能和标注一致性?

主要发现

  • 字符级CNN模型在所有测试集(真实邮件、内部数据和合成数据)中均取得了最高的F1分数,优于BiLSTM-CRF、spaCy和正则表达式基线模型。
  • CNN模型表现出最高的吞吐量——比基于CRF的模型(如BiLSTM-CRF)快达10倍,比字符级CNN模型快3倍至10倍,使其在生产环境中最为高效。
  • 在GPU实例上,CNN模型的吞吐量超过每秒1,000个token,显著优于spaCy(虽使用CuPy但缺乏TensorFlow优化)和基于CRF的模型。
  • 尽管参数量更大且未进行展平处理,Char-CNN-Retrained和Char-CNN-Pretrained模型在列级预测上的宏F1分数与Column-CNN-CRF模型相当,但吞吐量低3至10倍。
  • 尽管通过增加上下文改进了数据生成,但缺乏上下文真实性的合成数据仍导致模型在真实邮件数据上的泛化能力下降,表明需要更真实的模拟数据。
  • 实体重叠(如SSN、电话号码、BAN之间)是持续存在的挑战,若无额外元数据(如列名、取值范围),此类重叠无法被有效解决。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。