Skip to main content
QUICK REVIEW

[논문 리뷰] Visual Keyword Spotting with Attention

K R Prajwal, Liliane Momeni|arXiv (Cornell University)|2021. 10. 29.
Speech and Audio Processing참고 문헌 72인용 수 6
한 줄 요약

이 논문은 시각적 영상 특징과 음소 키워드 임베딩 간의 전체적인 크로스모달 어텐션을 사용하는 Transformer 기반 모델인 Transpotter를 제안한다. 이는 침묵된 영상에서 말하는 키워드를 국소화하는 데에 사용되며, LRW, LRS2, LRS3 데이터셋에서 최신 기술 수준(SOTA)의 성능을 달성하고, 수수어 영상에서 고립된 입모양을 탐지하는 데 있어 기존 방법보다 뚜렷하게 뛰어난 성능을 보이며 극단적인 도메인 이동 상황에서도 강력한 일반화 능력을 입증한다.

ABSTRACT

In this paper, we consider the task of spotting spoken keywords in silent video sequences -- also known as visual keyword spotting. To this end, we investigate Transformer-based models that ingest two streams, a visual encoding of the video and a phonetic encoding of the keyword, and output the temporal location of the keyword if present. Our contributions are as follows: (1) We propose a novel architecture, the Transpotter, that uses full cross-modal attention between the visual and phonetic streams; (2) We show through extensive evaluations that our model outperforms the prior state-of-the-art visual keyword spotting and lip reading methods on the challenging LRW, LRS2, LRS3 datasets by a large margin; (3) We demonstrate the ability of our model to spot words under the extreme conditions of isolated mouthings in sign language videos.

연구 동기 및 목표

  • 침묵 영상에서 전체 번역이 아닌 특정 키워드만 국소화해야 하는 시각적 키워드 탐지(KWS) 문제를 해결하기 위해.
  • 기존의 시각적 발화 인식(VSR) 방법이 언어 모델링에 크게 의존하고, 가림이나 짧은 발화 상황에서 성능이 저하되는 한계를 극복하기 위해.
  • 목표 키워드에 대한 사전 지식을 활용하여 키워드 국소화의 정확성과 내성 강도를 향상시키는 모델을 개발하기 위해.
  • 입모양이 고립된 수수어 영상에서의 도메인 이동과 부분적인 발화가 흔한 도전적인 실제 환경 상황, 예를 들어 수수어 영상에서의 고립된 입모양 탐지에 대한 성능 평가를 위해.
  • 표준 입술 읽기 데이터셋을 넘어 새로운 노이즈가 있는 수수어 코퍼스(수동으로 애너테이션된 부분적 입모양 포함)를 테스트하여 일반화 능력을 입증하기 위해.

제안 방법

  • Transpotter 모델은 두 개의 별도 스트림을 사용한다: 하나는 3D CNN를 통해 영상 프레임을 시각적 특징으로 인코딩하는 스트림이고, 다른 하나는 학습 가능한 위치 인코딩을 사용해 목표 키워드를 음소 임베딩으로 인코딩하는 스트림이다.
  • 시각적 스트림과 음소 스트림 간에 전체 크로스어텐션을 적용하여, 키워드의 음소 구조에 해당하는 관련 시각적 영역에 동적으로 주의를 기울일 수 있도록 한다.
  • 키워드가 존재할 경우 시각적 표현과 음소 표현 간의 정렬을 장려하는 대비 학습 목적함수를 사용하여 모델을 훈련시킨다.
  • 최종 예측 헤드는 영상 시퀀스 전반에 걸쳐 시간적 국소화 점수를 출력하여 키워드의 시작 및 종료 시간을 식별한다.
  • 모델 아키텍처는 엔드 투 엔드로 미분 가능하며, 특징 학습과 국소화를 동시에 최적화한다.
  • 사전 처리 파이프라인은 수수어 영상에서 얼굴 컷 영상 트랙을 추출하여 추론 시 일관된 입력을 확보한다.

실험 결과

연구 질문

  • RQ1시각적 모달리티와 음소 모달리티 간의 크로스어텐션 메커니즘이 기존 방법에 비해 시각적 키워드 탐지 성능을 크게 향상시킬 수 있는가?
  • RQ2수수어 영상에서 고립된 입모양과 같은 극단적인 도메인 이동 상황에 대해 모델의 일반화 능력은 어느 정도인가?
  • RQ3부분적인 입술 운동, 가림, 비표준 발화 조건과 같은 어려운 상황에서도 모델의 성능 유지 능력은 어느 정도인가?
  • RQ4표준 벤치마크 데이터셋인 LRW, LRS2, LRS3에서 최신 기술 수준의 KWS 및 VSR 기반 모델을 모두 능가할 수 있는가?
  • RQ5키워드가 부분적으로만 입모양이 날 경우 또는 강한 공음화가 일어나는 경우 모델의 성능은 어느 정도 저하되는가?

주요 결과

  • Transpotter 모델은 수수어 영상에서 입모양을 탐지하는 데 있어 BSL-Corpus에서 mAP 29.6을 기록했으며, 이는 이전 SOTA KWS-Net 기반 모델(15.6 mAP)에 비해 뚜렷한 향상이다.
  • LRS2 데이터셋에서 Transpotter는 mAP 47.1을 기록하여 이전 SOTA KWS 방법보다 큰 격차로 승리했다.
  • 모델은 유사 발음어(동음이의어)에 대해서도 강력한 내성 강도를 보이며, 목표어와 음소적으로 유사한 동음이의어를 모두 동일한 참값 위치에서 정확히 국소화했다.
  • qualitative 결과를 통해 고립된 입모양이 존재하는 경우에도 모델이 성공적으로 키워드를 국소화했으며, 높은 도메인 이동과 수동 애너테이션 노이즈가 존재하는 상황에서도 효과를 보였다.
  • BSL-Corpus에서 모델은 top-1 정확도 22.5%와 top-5 정확도 47.1%를 기록하여 저자원, 실제 세계의 수수어 데이터에 대한 강력한 일반화 능력을 입증했다.
  • Transpotter는 도전적인 LRW, LRS2, LRS3 데이터셋에서 기존의 시각적 KWS 및 최신 기술 수준의 입술 읽기 기반 모델을 모두 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.