Skip to main content
QUICK REVIEW

[논문 리뷰] TranssionADD: A multi-frame reinforcement based sequence tagging model for audio deepfake detection

Jie Liu, Zhiba Su|arXiv (Cornell University)|2023. 06. 27.
Speech and Audio ProcessingComputer Science인용 수 3
한 줄 요약

TranssionADD는 음성 딥패키지 탐지의 새로운 다중 프레임 강화 기반 시퀀스 태깅 모델을 제안하며, 작업을 프레임 수준의 레이블링으로 프레임화하여 조작된 영역을 국소화한다. RCNN-BLSTM 특징 추출, 다중 프레임 탐지, 데이터 증강 및 고립 프레임 페널티 손실을 통합함으로써, ADD 2023 조작 영역 국소화 트랙에서 2위를 기록하여 뛰어난 강건성과 이방성 처리 능력을 입증하였다.

ABSTRACT

Thanks to recent advancements in end-to-end speech modeling technology, it has become increasingly feasible to imitate and clone a user`s voice. This leads to a significant challenge in differentiating between authentic and fabricated audio segments. To address the issue of user voice abuse and misuse, the second Audio Deepfake Detection Challenge (ADD 2023) aims to detect and analyze deepfake speech utterances. Specifically, Track 2, named the Manipulation Region Location (RL), aims to pinpoint the location of manipulated regions in audio, which can be present in both real and generated audio segments. We propose our novel TranssionADD system as a solution to the challenging problem of model robustness and audio segment outliers in the trace competition. Our system provides three unique contributions: 1) we adapt sequence tagging task for audio deepfake detection; 2) we improve model generalization by various data augmentation techniques; 3) we incorporate multi-frame detection (MFD) module to overcome limited representation provided by a single frame and use isolated-frame penalty (IFP) loss to handle outliers in segments. Our best submission achieved 2nd place in Track 2, demonstrating the effectiveness and robustness of our proposed system.

연구 동기 및 목표

  • 노이즈가 많고 변수가 많은 데이터에서 실생활 상황에서 조작된 음성 세그먼트를 탐지하고 국소화하는 도전 과제를 해결하기 위해.
  • 시간적 순서 기반 음성 데이터에서 이상치에 대한 모델의 일반화 능력과 강건성을 향상시키기 위해.
  • 이진 분류를 넘어서 조작된 영역을 정밀하게 국소화할 수 있는 시퀀스 태깅 프레임워크를 개발하기 위해.
  • 고립되거나 분리된 프레임 예측으로 인한 오진 양성률을 줄이기 위해 새로운 손실 함수를 도입하기 위해.

제안 방법

  • 모델는 음성 딥패키지 탐지를 시퀀스 태깅 작업으로 간주하여 각 음성 프레임에 대해 레이블(진짜/가짜)을 예측하고, 동일한 레이블을 가진 연속된 프레임을 통합하여 조작된 세그먼트를 식별한다.
  • 멜스펙트로그램에서 공간적 및 시간적 특징을 추출하기 위해 RCNN-BLSTM 기반 아키텍처를 활용하여 스펙트럼적 및 순차적 패턴을 모두 캡처한다.
  • 다중 프레임 탐지(MFD) 모듈은 인접한 다수의 프레임에 걸쳐 정보를 집계하여 국소 표현을 향상시키고 노이즈에 대한 강건성을 높인다.
  • 학습 이전 및 동안 데이터 증강 기법을 적용하며, 음성 변환, 톤 이동, 무작위 노이즈 주입(SNR < 15 dB)을 포함하여 일반화 능력을 향상시킨다.
  • 고립 프레임 페널티(IFP) 손실을 도입하여 6 프레임 미만의 고립된 프레임이 가짜로 예측되는 것을 방지함으로써 오진 양성률을 감소시킨다.
  • 최종 점수는 문장 수준 정확도(A_sentence)의 30%와 세그먼트 수준 F1 점수(F1_segment)의 70%를 조합하며, 이방성 처리 능력을 평가하기 위한 보조적인 iso-rate 지표도 포함된다.
Figure 1: Overview of our proposed system. Subfigure (a) illustrates the overall structure of our model. Subfigure (b) is the RCNN encoder. Subfigure (c) shows the multi-frame detection module (MFD).
Figure 1: Overview of our proposed system. Subfigure (a) illustrates the overall structure of our model. Subfigure (b) is the RCNN encoder. Subfigure (c) shows the multi-frame detection module (MFD).

실험 결과

연구 질문

  • RQ1시퀀스 태깅 접근 방식이 전통적인 이진 분류보다 조작된 음성 영역 국소화에서 더 우수한 성능을 내는가?
  • RQ2다중 프레임 특징 집합이 노이즈 또는 이방성 프레임에 대한 모델의 강건성을 향상시키는 데 얼마나 효과적인가?
  • RQ3사전 학습 및 학습 중 데이터 증강 기법을 병행할 경우, 음성 딥패키지 탐지에서 모델의 일반화 능력 향상에 어느 정도 기여하는가?
  • RQ4고립 프레임 페널티 손실이 분리되거나 고립된 프레임 예측으로 인한 오진 양성률을 효과적으로 줄일 수 있는가?
  • RQ5탐지 정확도와 이방성에 대한 저항력 측면에서 제안된 시스템은 기준 모델 대비 어떻게 비교되는가?

주요 결과

  • TranssionADD는 ADD 2023 조작 영역 국소화 트랙에서 기준 RCNN-BLSTM 및 수정된 RawNet2 모델을 모두 앞서 2위를 기록하였다.
  • 기준 모델 대비 유의미하게 낮은 iso-rate(0.085)를 기록하여 고립되거나 분리된 예측에 대한 처리 능력이 뛰어나다는 것을 시사한다.
  • 고립 프레임 페널티(IFP) 손실은 기준 모델 대비 iso-rate를 44% 감소시켜 이방성 예측 억제에 효과적임을 입증하였다.
  • 절단 실험 결과, MFD 모듈을 제거할 경우 탐지 점수에 뚜렷한 하락이 발생하여, 이는 문맥적 특징 학습에서 MFD의 핵심적 역할을 반영한다.
  • 사전 학습 및 학습 중 데이터 증강(BefAug & InAug)을 병행할 경우 성능 향상이 가장 크게 나타났으며, 특히 증강된 개발 및 테스트 세트에서 두드러진 성능 향상을 보였다.
  • 최종 가중 점수는 0.3*A_sentence + 0.7*F1_segment이며, 모든 제출물 중에서 가장 높은 F1_segment 및 A_sentence 점수를 기록하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.