Skip to main content
QUICK REVIEW

[논문 리뷰] Lip-reading with Hierarchical Pyramidal Convolution and Self-Attention

Hang Chen, Jun Du|arXiv (Cornell University)|2020. 12. 28.
Speech and Audio Processing참고 문헌 25인용 수 4
한 줄 요약

이 논문은 단어 수준의 입술 읽기용 새로운 딥러닝 모델을 제안하며, 표준 합성곱 대신 계층적 피라미드 합성곱(HPConv)을 사용해 다중 척도 공간 특징을 추출하고, 평균 풀링 공식화 대신 자기주의 기반 시간 축합을 도입한다. 이 모델은 LRW 데이터셋에서 86.83%의 정확도를 기록하여 이전 최고 성능 대비 1.53%p 향상되었으며, 미세한 입술 운동의 검출 능력 향상과 관련 영상 프레임에 대한 개선된 주의 집중을 입증한다.

ABSTRACT

In this paper, we propose a novel deep learning architecture to improving word-level lip-reading. On the one hand, we first introduce the multi-scale processing into the spatial feature extraction for lip-reading. Specially, we proposed hierarchical pyramidal convolution (HPConv) to replace the standard convolution in original module, leading to improvements over the model's ability to discover fine-grained lip movements. On the other hand, we merge information in all time steps of the sequence by utilizing self-attention, to make the model pay more attention to the relevant frames. These two advantages are combined together to further enhance the model's classification power. Experiments on the Lip Reading in the Wild (LRW) dataset show that our proposed model has achieved 86.83% accuracy, yielding 1.53% absolute improvement over the current state-of-the-art. We also conducted extensive experiments to better understand the behavior of the proposed model.

연구 동기 및 목표

  • 미세한 입술 운동의 공간 특징 추출 능력을 향상시켜 단어 수준의 입술 읽기 성능을 향상시키기.
  • 평균 풀링 공식화의 한계를 해결하기 위해 동적이고 주의 기반의 프레임 가중치를 학습함으로써 시간 축합 방식을 개선하기.
  • 다중 척도 처리를 입술 읽기 모델의 프론트엔드에 통합하여 비세미(비음운 단위) 변형을 더 잘 표현하기.
  • LRW 벤치마크에서 계층적 피라미드 합성곱과 자기주의 기반 축합의 효과를 추론 및 비교 실험을 통해 검증하기.

제안 방법

  • 다중 공간 해상도에서 입력 특징을 처리할 수 있도록 계층적 피라미드 합성곱(HPConv)을 제안하여 국소적이고 전반적인 입술 운동 패턴을 더 잘 포착할 수 있도록 한다.
  • ResNet-18의 표준 2D 합성곱을 HPConv로 대체하여 계층적 특징 학습을 유지하면서 다중 척도 공간 특징을 추출한다.
  • 목표 단어에 대한 관련성이 높은 프레임을 기반으로 동적으로 프레임을 가중치 부여하는 자기주의 기반 공식화 모듈을 도입한다.
  • 학습 가능한 주의 메커니즘을 사용해 부드러운 단어 경계를 생성함으로써 고정 또는 균일한 평균화보다 더 나은 프레임 선택을 가능하게 한다.
  • 장거리 시간적 의존성을 모델링하기 위해 다중 척도 시간 합성곱 신경망(MS-TCN)을 백엔드로 활용한다.
  • 프론트엔드에 HPConv를, 시간 축합에 자기주의 기반 방법을 통합하여 공간 인식 능력 향상과 시간적 관련성 모델링을 동시에 향상시킨다.

실험 결과

연구 질문

  • RQ1계층적 피라미드 합성곱을 통한 다중 척도 공간 특징 추출이 단어 수준의 입술 읽기에서 미세한 입술 운동을 인식하는 데 향상되는가?
  • RQ2자기주의 기반 시간 축합이 분류 과정에서 관련 영상 프레임에 집중하는 데 있어 평균 풀링을 초월하는가?
  • RQ3HPConv와 자기주의 기반 축합이 LRW 데이터셋에서 개별적으로나 함께 작용할 때 성능에 어떤 영향을 미치는가?
  • RQ4수동 애너테이션과 비교해 주의 메커니즘이 얼마나 정확한 단어 경계를 학습할 수 있는가?

주요 결과

  • 제안된 모델은 LRW 데이터셋에서 86.83%의 상위-1 정확도를 기록하여 이전 최고 성능 대비 1.53%p의 절대적 향상을 달성하였다.
  • HPConv는 비세미 수가 적은 단어의 분류 정확도를 크게 향상시켜 미세한 입술 운동의 검출 능력을 강화한다.
  • 자기주의 기반 축합은 특히 단어 경계가 모호할 경우 평균 풀링을 능가하며 더 정확한 프레임 관련성 학습을 가능하게 한다.
  • 추론 실험 결과, HPConv와 자기주의 기반 축합이 성능 향상에 독립적으로 기여함과 동시에 상호 보완적인 효과를 보임을 확인하였다.
  • 모델이 학습한 주의 가중치는 수동 애너테이션과 상관관계가 있으며, 에디트 거리가 증가할수록 정확도가 감소함을 확인하여 모델이 의미 있는 시간적 구조를 학습하고 있음을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.