Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-scale temporal network for continuous sign language recognition

Qidan Zhu, Jing Li|arXiv (Cornell University)|2022. 04. 08.
Hand Gesture Recognition Systems인용 수 7
한 줄 요약

이 논문은 다중 척도 수신장과 트랜스포머 기반 모듈을 사용하여 시간 특징 추출을 향상시키는 연속된 수어 인식을 위한 다중 척도 시간 네트워크(MSTNet)를 제안한다. 다중 수준의 연결주의적 시간 분류(CTC) 손실을 통합함으로써 파rameter 증가 없이도 엔드 투 엔드 인식 정확도를 향상시켜 두 개의 공개 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Continuous Sign Language Recognition (CSLR) is a challenging research task due to the lack of accurate annotation on the temporal sequence of sign language data. The recent popular usage is a hybrid model based on "CNN + RNN" for CSLR. However, when extracting temporal features in these works, most of the methods using a fixed temporal receptive field and cannot extract the temporal features well for each sign language word. In order to obtain more accurate temporal features, this paper proposes a multi-scale temporal network (MSTNet). The network mainly consists of three parts. The Resnet and two fully connected (FC) layers constitute the frame-wise feature extraction part. The time-wise feature extraction part performs temporal feature learning by first extracting temporal receptive field features of different scales using the proposed multi-scale temporal block (MST-block) to improve the temporal modeling capability, and then further encoding the temporal features of different scales by the transformers module to obtain more accurate temporal features. Finally, the proposed multi-level Connectionist Temporal Classification (CTC) loss part is used for training to obtain recognition results. The multi-level CTC loss enables better learning and updating of the shallow network parameters in CNN, and the method has no parameter increase and can be flexibly embedded in other models. Experimental results on two publicly available datasets demonstrate that our method can effectively extract sign language features in an end-to-end manner without any prior knowledge, improving the accuracy of CSLR and achieving competitive results.

연구 동기 및 목표

  • 기존의 CNN+RNN 모델에서 고정된 수신장으로 인해 발생하는 연속된 수어 인식(CSLR)의 정확하지 않은 시간 특징 추출 문제를 해결하기 위해.
  • 다양한 시간 척도에서 수어 특징을 캡처하여 시간 모델링 능력을 향상시키기 위해.
  • 새로운 다중 수준 CTC 손실 메커니즘을 통해 얕은 CNN 레이어에서의 학습 효율성과 파ram터 학습을 향상시키기 위해.
  • 사전 지식 없이도 엔드 투 엔드 인식을 가능하게 하고, 공개 벤치마크에서 경쟁 가능한 성능을 달성하기 위해.

제안 방법

  • 모델은 프레임 단위 특징 추출을 위해 두 개의 완전 연결 계층을 갖춘 ResNet을 사용한다.
  • 다양한 수신장 크기에서 시간 특징을 추출하기 위해 다중 척도 시간 블록(MST-block)을 설계한다.
  • 다양한 척도에서 유도된 시간 특징은 융합되고, 트랜스포머 모듈을 통해 장거리 의존성을 향상시켜 추가로 인코딩된다.
  • 다중 수준의 연결주의적 시간 분류(CTC) 손실이 도입되어 네트워크의 여러 깊이에서 학습을 감독함으로써 얕은 레이어에 더 나은 기울기 흐름을 제공한다.
  • 다중 수준 CTC 손실은 파rameter가 없으며, 기존 모델에 쉽게 통합될 수 있다.
  • 전체 네트워크는 공간적 및 시간적 표현의 공동 최적화를 위한 엔드 투 엔드로 훈련된다.

실험 결과

연구 질문

  • RQ1다중 척도 시간 모델링이 연속된 수어 인식 시스템의 인식 정확도를 향상시킬 수 있는가?
  • RQ2제안된 다중 수준 CTC 손실은 얕은 CNN 레이어에서의 학습 효율성과 성능 향상에 어떻게 기여하는가?
  • RQ3트랜스포머와 다중 척도 시간 블록을 통합할 경우 시간 특징 학습이 얼마나 향상되는가?
  • RQ4추가 파rameter나 사전 지식 없이도 제안된 방법이 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ5모델은 다양한 공개 CSLR 데이터셋에서 얼마나 강인한가?

주요 결과

  • 제안된 MSTNet은 두 개의 공개 연속된 수어 인식 데이터셋에서 최신 기술 수준의 성능을 달성한다.
  • 다중 수준 CTC 손실은 얕은 네트워크 레이어에서 더 나은 파ram터 갱신을 가능하게 하여 전체 학습의 안정성과 수렴성을 향상시킨다.
  • 다중 척도 시간 블록과 트랜스포머의 통합은 시간 특징 표현 학습을 크게 향상시킨다.
  • 모델은 파ram터 수를 늘리지 않으면서도 인식 정확도를 향상시켜 높은 효율성을 보여준다.
  • 제거 실험을 통해 MST-블록과 다중 수준 CTC 손실의 각 구성 요소의 효과성이 확인된다.
  • 방법은 기존의 CNN+RNN 베이스라인보다 뛰어난 성능을 보이며, 엔드 투 엔드 수어 인식에서 경쟁적인 결과를 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.