Skip to main content
QUICK REVIEW

[论文解读] Audio De-identification: A New Entity Recognition Task

Ido Cohn, Itay Laish|arXiv (Cornell University)|Mar 17, 2019
Topic Modeling参考文献 24被引用 5
一句话总结

本文提出了一种新型任务——音频去标识化,用于保护临床音频记录中的个人健康信息(PHI)。该方法提出一个结合自动语音识别(ASR)、基于文本的命名实体识别(NER)以及音视频对齐的处理流程,以检测并遮蔽PHI片段,在50%覆盖阈值下实现了0.53的召回率,尽管ASR和对齐组件的误差累积导致性能下降。

ABSTRACT

Named Entity Recognition (NER) has been mostly studied in the context of written text. Specifically, NER is an important step in de-identification (de-ID) of medical records, many of which are recorded conversations between a patient and a doctor. In such recordings, audio spans with personal information should be redacted, similar to the redaction of sensitive character spans in de-ID for written text. The application of NER in the context of audio de-identification has yet to be fully investigated. To this end, we define the task of audio de-ID, in which audio spans with entity mentions should be detected. We then present our pipeline for this task, which involves Automatic Speech Recognition (ASR), NER on the transcript text, and text-to-audio alignment. Finally, we introduce a novel metric for audio de-ID and a new evaluation benchmark consisting of a large labeled segment of the Switchboard and Fisher audio datasets and detail our pipeline's results on it.

研究动机与目标

  • 定义并形式化临床对话中音频去标识化的任务。
  • 开发一个结合ASR、文本NER和音视频对齐的处理流程,以检测并遮蔽音频中的PHI。
  • 基于Switchboard和Fisher音频数据集,构建一个包含人工标注PHI片段的新基准数据集。
  • 提出一种新型评估指标Recallρ和Precisionρ,用于衡量对词语部分遮蔽(至少ρ比例)的效果。
  • 端到端评估处理流程的整体性能及各组件性能,识别关键错误来源和性能瓶颈。

提出的方法

  • 该流程首先使用自动语音识别(ASR)对音频进行转录,生成词级别的时序标记。
  • 使用最先进的模型(Lample et al., 2016)对ASR转录文本应用命名实体识别(NER),识别文本中的PHI片段。
  • 利用ASR生成的词级别时间边界,执行文本到音频的对齐,将NER预测结果映射回原始音频。
  • 对识别出的PHI词语对应的音频片段执行遮蔽,覆盖阈值ρ可配置,用于部分遮蔽。
  • 定义了一种新型评估指标Recallρ和Precisionρ,用于评估PHI词语被遮蔽的程度(至少ρ比例),同时保留非PHI内容。
  • 通过在Switchboard和Fisher数据集的大量子集中标注PHI片段,构建了新基准SWFI,支持在真实对话音频上进行评估。

实验结果

研究问题

  • RQ1结合ASR、NER和对齐的流程在临床音频PHI去标识化中的有效性如何?
  • RQ2ASR和对齐组件的误差累积在多大程度上降低了端到端性能,相较于基于文本的NER?
  • RQ3ASR的替代词候选和置信度分数的选择如何影响遮蔽的鲁棒性?
  • RQ4通过覆盖阈值ρ实现的部分遮蔽对音频去标识化中的召回率和精确率有何影响?
  • RQ5PHI词与非PHI词在遮蔽覆盖度方面的性能特征有何不同?

主要发现

  • 该流程在覆盖阈值ρ=0.5时实现了0.53的端到端召回率,高于由误差累积推导出的预期召回率0.44,表明存在非平凡的误差共现依赖关系。
  • M_SWFI_MixCase+Asr模型在端到端评估中表现优于其他变体,表明在混合大小写转录文本和ASR产物上进行训练可提升鲁棒性。
  • PHI词的词错误率(WER)为17.5%,非PHI词为10.5%,表明ASR错误显著影响去标识化性能。
  • 非PHI词的覆盖度分布呈双峰特征——主要集中在0或1附近,而PHI词的覆盖度主要超过50%,表明对齐和分类错误对非PHI词的影响方式不同。
  • 结合ASR替代词候选可略微提升M_SWFI_MixCase+Asr模型的性能,但简单的OR融合策略因引入低置信度候选而降低性能,凸显了对更优融合策略的需求。
  • 填充大小并未提升性能,但改变了最优覆盖阈值,表明对输入预处理选择较为敏感。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。