Skip to main content
QUICK REVIEW

[논문 리뷰] Audio De-identification: A New Entity Recognition Task

Ido Cohn, Itay Laish|arXiv (Cornell University)|2019. 03. 17.
Topic Modeling참고 문헌 24인용 수 5
한 줄 요약

이 논문은 임상 음성 기록에서 개인 건강 정보(PHI)를 보호하기 위한 새로운 과제인 오디오 탈식별을 제안한다. 자동 음성 인식(ASR), 텍스트 기반 NER, 오디오-텍스트 정렬을 조합한 파이프라인을 제안하며, ASR 및 정렬 구성 요소의 누적 오류에도 불구하고 50% 커버리지 임계값에서 재현율(recall)이 0.53에 도달함으로써 성능을 확보한다.

ABSTRACT

Named Entity Recognition (NER) has been mostly studied in the context of written text. Specifically, NER is an important step in de-identification (de-ID) of medical records, many of which are recorded conversations between a patient and a doctor. In such recordings, audio spans with personal information should be redacted, similar to the redaction of sensitive character spans in de-ID for written text. The application of NER in the context of audio de-identification has yet to be fully investigated. To this end, we define the task of audio de-ID, in which audio spans with entity mentions should be detected. We then present our pipeline for this task, which involves Automatic Speech Recognition (ASR), NER on the transcript text, and text-to-audio alignment. Finally, we introduce a novel metric for audio de-ID and a new evaluation benchmark consisting of a large labeled segment of the Switchboard and Fisher audio datasets and detail our pipeline's results on it.

연구 동기 및 목표

  • 임상 대화에서 오디오 탈식별 과제를 정의하고 체계화한다.
  • ASR, 텍스트 기반 NER, 오디오-텍스트 정렬을 조합하여 오디오 내 PHI를 탐지하고 제거하는 파이프라인을 개발한다.
  • Switchboard 및 Fisher 음성 데이터셋에서 인간이 주석 처리한 PHI 스팸을 포함한 새로운 벤치마크 데이터셋을 구축한다.
  • 부분적 제거를 고려한 새로운 평가 지표인 Recallρ 및 Precisionρ를 도입한다.
  • 파이프라인의 종단 간 성능과 구성 요소별 성능을 평가하여 주요 오류 원인과 성능 저하 요인을 규명한다.

제안 방법

  • 파이프라인은 자동 음성 인식(ASR)을 사용해 오디오를 텍스트로 변환하며, 단어 수준의 타임스탬프를 생성한다.
  • 최신 기술 모델(Lample et al., 2016)을 사용해 ASR 텍스트 전사에 명명된 실체 인식(NER)을 적용하여 텍스트 내 PHI 스팸을 식별한다.
  • ASR의 단어 수준 타임스탬프 경계를 활용해 텍스트-오디오 정렬을 수행하여 NER 예측 결과를 원본 오디오로 다시 매핑한다.
  • 식별된 PHI 단어에 해당하는 오디오 세그먼트에 대해 제거를 적용하며, 부분적 제거를 위한 가변 커버리지 임계값 ρ를 설정할 수 있다.
  • PHI 단어의 적어도 ρ 비율이 제거되었는지 평가하기 위해 Recallρ 및 Precisionρ라는 새로운 평가 지표를 정의한다.
  • SWFI 벤치마크는 Switchboard 및 Fisher 데이터셋의 대규모 서브셋에 대해 인간이 주석 처리한 PHI 스팸을 포함하여, 실제 대화형 음성에서의 평가를 가능하게 한다.

실험 결과

연구 질문

  • RQ1ASR, NER, 정렬을 조합한 파이프라인 접근 방식이 임상 음성에서 PHI 탈식별에 얼마나 효과적인가?
  • RQ2ASR 및 정렬의 누적 오류가 텍스트 기반 NER에 비해 종단 간 성능을 얼마나 떨어뜨리는가?
  • RQ3ASR의 대안적 가설 및 신뢰도 점수의 선택이 제거의 강건성에 어떤 영향을 미치는가?
  • RQ4커버리지 임계값 ρ를 통한 부분적 제거가 오디오 탈식별의 재현율과 정밀도에 어떤 영향을 미치는가?
  • RQ5PHI 단어와 비-PHI 단어 간 제거 커버리지 특성은 어떻게 다를까?

주요 결과

  • 커버리지 임계값 ρ=0.5에서 종단 간 재현율이 0.53을 기록하여, 오류 누적으로 예상되는 0.44를 초월함으로써 비정상적인 오류 상호의존성이 존재함을 시사한다.
  • M_SWFI_MixCase+Asr 모델이 종단 간 평가에서 다른 변종보다 우수한 성능을 보였으며, 혼합 케이스 전사 및 ASR 아티팩트를 학습에 활용함으로써 강건성이 향상됨을 시사한다.
  • PHI 단어의 WER은 17.5%이며 비-PHI 단어는 10.5%로, ASR 오류가 탈식별 성능에 상당한 영향을 미침을 보여준다.
  • 비-PHI 단어는 대부분 0 또는 1에 가까운 양면 분포를 보이며, 반면 PHI 단어는 대부분 50% 이상의 커버리지로 분포함을 확인하여, 정렬 및 분류 오류가 비-PHI 단어에 다른 방식으로 영향을 미침을 시사한다.
  • 대안적 ASR 가설을 사용하면 M_SWFI_MixCase+Asr 모델과 조합했을 때 성능이 약간 향상되지만, 난이도가 낮은 가설을 단순히 OR 병합하면 성능이 저하됨을 확인하여, 더 나은 병합 전략이 필요함을 시사한다.
  • 패딩 크기의 변화는 성능 향상에 기여하지 않았지만 최적의 커버리지 임계값을 이동시켰으며, 입력 전처리 선택에 민감함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.