Skip to main content
QUICK REVIEW

[논문 리뷰] Online End-to-End Neural Diarization with Speaker-Tracing Buffer

Yawen Xue, Shota Horiguchi|arXiv (Cornell University)|2020. 06. 04.
Speech Recognition and Synthesis참고 문헌 42인용 수 10
한 줄 요약

이 논문은 스피커 순서 뒤바꿈 문제를 해결하기 위해 스피커 추적 버퍼(Speaker-Tracing Buffer, STB)를 사용하는 온라인 엔드 투 엔드 신경망 다이아라이제이션 시스템을 제안한다. 이는 조각 간 일관성 있는 다이아라이제이션을 가능하게 하며, 낮은 지연 시간을 제공한다. 이전 조각들에서 얻은 순서 정보를 담고 있는 프레임을 저장하고 재사용함으로써, 다양한 조각 크기로 훈련함으로써, CALLHOME에서 12.54%의 DER, CSJ에서 20.77%의 DER를 달성하였으며, 실제 지연 시간은 1.4초에 불과하다.

ABSTRACT

This paper proposes a novel online speaker diarization algorithm based on a fully supervised self-attention mechanism (SA-EEND). Online diarization inherently presents a speaker's permutation problem due to the possibility to assign speaker regions incorrectly across the recording. To circumvent this inconsistency, we proposed a speaker-tracing buffer mechanism that selects several input frames representing the speaker permutation information from previous chunks and stores them in a buffer. These buffered frames are stacked with the input frames in the current chunk and fed into a self-attention network. Our method ensures consistent diarization outputs across the buffer and the current chunk by checking the correlation between their corresponding outputs. Additionally, we trained SA-EEND with variable chunk-sizes to mitigate the mismatch between training and inference introduced by the speaker-tracing buffer mechanism. Experimental results, including online SA-EEND and variable chunk-size, achieved DERs of 12.54% for CALLHOME and 20.77% for CSJ with 1.4s actual latency.

연구 동기 및 목표

  • 온라인 스피커 다이아라이제이션에서 조각 간 일관성 없이 변하는 스피커 할당 문제를 해결하기 위해.
  • 재학습 없이 오프라인 SA-EEND 모델을 온라인 환경에서 사용할 수 있도록 하기 위해.
  • 오프라인 방법과 유사한 성능을 유지하면서도 지연 시간을 최소화하기 위해.
  • 스피커 추적 버퍼의 가변 입력 길이로 인해 발생하는 훈련과 추론 간 불일치 문제를 완화하기 위해.

제안 방법

  • 이전 조각들에서 얻은 대표 프레임을 저장하여 스피커 순서 정보를 유지하는 스피커 추적 버퍼(STB)를 도입한다.
  • 버퍼에 저장된 프레임을 현재 조각 입력과 함께 스택하여 자기주의어 네트워크에 입력함으로써, 버퍼 세그먼트와 현재 세그먼트 간 일관된 다이아라이제이션 출력을 보장한다.
  • 버퍼 프레임과 현재 프레임의 출력 간 상관관계를 확인하여 스피커 일관성을 유지한다.
  • STB 메커니즘으로 인해 발생하는 가변 길이 입력을 고려해, 다양한 조각 크기로 SA-EEND 모델을 훈련시켜 훈련 분포를 일치시킨다.
  • 순서 정보를 담고 있는 프레임을 우선순위로 고려하여 STB에 가중치 샘플링을 적용한다.
  • CALLHOME, CSJ, 그리고 제어된 오버랩 비율을 가진 이중 스피커 녹음 데이터를 포함한 실제 및 시뮬레이션 데이터 세트를 조합하여 성능을 평가한다.

실험 결과

연구 질문

  • RQ1스피커 추적 버퍼는 온라인 다이아라이제이션에서 스피커 순서 뒤바꿈 문제를 효과적으로 해결할 수 있는가?
  • RQ2기본적인 온라인 조각화 방식과 비교했을 때, STB 메커니즘은 다이아라이제이션 오류율(DER)에 어떤 영향을 미치는가?
  • RQ3가변 조각 크기 훈련이 온라인 SA-EEND에서 훈련과 추론 간 불일치를 얼마나 줄일 수 있는가?
  • RQ4STB는 장시간 녹음에서 오프라인 SA-EEND 성능에 가까운 성능을 달성할 수 있는가?
  • RQ5다양한 오버랩 비율과 실제 환경 조건에서 시스템은 어떤 성능을 보이는가?

주요 결과

  • 제안된 STB와 가변 조각 크기 훈련을 적용한 온라인 SA-EEND는 CALLHOME 데이터셋에서 12.54%의 DER을 달성하여 다른 온라인 시스템을 능가했다.
  • CSJ 데이터셋에서는 20.77%의 DER을 기록하여, 오프라인 SA-EEND의 20.48% 성능에 거의 근접했다.
  • 시스템은 실제 지연 시간이 1.4초로, 실시간 응용에 적합한 낮은 지연 시간을 확보했다.
  • CSJ(평균 767.0초)와 같은 장시간 녹음에서 STB 기반 방법이 뛰어난 성능을 보여, 장기 음성에 대한 확장성도 입증했다.
  • 가변 조각 크기 훈련 방식은 입력 길이 불일치로 인한 성능 저하를 줄였으며, 특히 장시간 시퀀스에서 두드러졌다.
  • 30초 이내 처리 시, 가변 조각 크기 훈련 모델은 초기에 고정 조각 크기 훈련보다 성능이 열 劣했지만, 이후 이 시점 이후로는 두 모델 모두 거의 오프라인 성능에 도달했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.