Skip to main content
QUICK REVIEW

[논문 리뷰] Self-Supervised Video Transformers for Isolated Sign Language Recognition

Marcelo Sandoval-Castañeda, Yanhong Li|arXiv (Cornell University)|2023. 09. 02.
Hand Gesture Recognition SystemsComputer Science인용 수 3
한 줄 요약

이 논문은 고립된 수어 인식(ISLR)을 위한 자기지도 학습 비디오 트랜스포머를 제안하며, 마스크된 재구성 전훈(MaskFeat)과 계층적 비전 트랜스포머를 활용하여 최신 기술 수준의 성능을 달성한다. WLASL2000 데이터셋에서 MaskFeat 전훈을 적용한 MViTv2는 상위 1위 정확도 79.02%를 기록하여 자세 기반 및 지도 학습 모델보다 1.59% 높으며, 선형 프로브 분석을 통해 계층적 아키텍처가 수어의 음소적 특징인 손모양과 운동을 더 잘 포착하는 것으로 나타났다.

ABSTRACT

This paper presents an in-depth analysis of various self-supervision methods for isolated sign language recognition (ISLR). We consider four recently introduced transformer-based approaches to self-supervised learning from videos, and four pre-training data regimes, and study all the combinations on the WLASL2000 dataset. Our findings reveal that MaskFeat achieves performance superior to pose-based and supervised video models, with a top-1 accuracy of 79.02% on gloss-based WLASL2000. Furthermore, we analyze these models' ability to produce representations of ASL signs using linear probing on diverse phonological features. This study underscores the value of architecture and pre-training task choices in ISLR. Specifically, our results on WLASL2000 highlight the power of masked reconstruction pre-training, and our linear probing results demonstrate the importance of hierarchical vision transformers for sign language representation.

연구 동기 및 목표

  • 낮은 데이터 환경에서 고립된 수어 인식(ISLR)을 위한 자기지도 학습 비디오 트랜스포머의 효과성을 평가하기 위해.
  • 다양한 전훈 작업과 아키텍처가 수어 표현 학습에 미치는 영향을 조사하기 위해.
  • Brentari의 수어(prosodic model of ASL)에서 유래한 음소적 특징을 활용해 모델 표현을 분석하기 위해.
  • 글로스 기반 WLASL2000 벤치마크에서 새로운 최신 기술 수준을 수립하기 위해.

제안 방법

  • 비디오 트랜스포머를 네 가지 자기지도 학습 방법을 사용해 전훈: VideoMAE(픽셀 재구성), MaskFeat(특징 재구성), BEVT(BERT 스타일 비디오 전훈), SVT(DINO 기반 대비 학습).
  • WLASL2000 데이터셋에서 글로스 기반 수어 분류를 위해 선형 프로브와 종단 간 학습을 사용해 전훈된 모델을 미세조정.
  • 계층적 비전 트랜스포머 아키텍처(예: MViTv2, VideoSwin)를 사용해 수어 영상의 공간적 및 시간적 계층성을 더 잘 모델링.
  • Brentari의 수어 prosodic 모델에서 유래한 15개의 음소적 특징(손모양, 운동, 대칭성, 위치 등)을 기반으로 표현을 평가.
  • 전훈 데이터 제도 두 가지로 학습: Kinetics400(행동 영상) 및 WLASL2000(수어 영상), 또는 이들의 조합.
  • 모델 깊이에 따라 계층별 프로브 정확도를 분석해 미세조정이 언어적 특징 인코딩을 어떻게 향상시키는지 평가.
Figure 1 : Sample frames from isolated sign language video extracted from the WLASL2000 dataset [ 19 ] .
Figure 1 : Sample frames from isolated sign language video extracted from the WLASL2000 dataset [ 19 ] .

실험 결과

연구 질문

  • RQ1WLASL2000에서 ISLR에 대해 가장 높은 성능을 내는 자기지도 학습 전훈 작업은 무엇인가?
  • RQ2다양한 비전 트랜스포머 아키텍처(예: 일반 ViT 대비 계층적 아키텍처)가 수어 표현 품질에 어떤 영향을 미치는가?
  • RQ3자기지도 학습 모델이 수어의 언어학적으로 의미 있는 특징, 예를 들어 손모양과 운동을 어느 정도 학습할 수 있는가?
  • RQ4ISLR에서의 미세조정은 명시적으로 학습하지 않은 음소적 특징을 모델이 표현할 수 있도록 하는 데 어떤 영향을 미치는가?
  • RQ5전훈 중 비디오 샘플링 전략이 시간 의존적 특징, 예를 들어 수어 운동을 포착하는 데 모델의 능력에 어떤 영향을 미치는가?

주요 결과

  • MViTv2에 MaskFeat 전훈을 적용한 결과 WLASL2000에서 상위 1위 정확도 79.02%를 기록하여 새로운 최신 기술 수준을 수립하였으며, 이는 이전 자세 기반 최신 기술 수준보다 1.59% 높다.
  • 계층적 비전 트랜스포머(예: BEVT, MaskFeat)는 모든 15개의 음소적 특징에서 일반 ViT보다 선형 프로브 성능이 뛰어나, 더 나은 언어 표현 학습을 함의한다.
  • ISLR에서의 미세조정은 특히 경로 운동(Path Movement)과 같은 운동 기반 특징의 선형 프로브 정확도를 크게 향상시키며, 희소 샘플링 전략을 사용해 전훈한 모델에서 두드러진다.
  • 연속적인 수어 영상(예: Kinetics400)에서 전훈한 모델는 희소 프레임 샘플링으로 인해 시간 의존적 특징을 잘 포착하지 못하지만, 짧고 단일 수어 영상에서의 미세조정을 통해 성능을 복구한다.
  • 계층별 프로브 분석 결과, 미세조정이 모델의 최종 레이어에 가까워질수록 선형 프로브 정확도가 단조롭게 증가함을 보여, 언어적 특징 인코딩이 향상됨을 시사한다.
  • MaskFeat와 BEVT는 모든 음소적 특징에서 I3D(강력한 CNN 기반 베이스라인)와 유사하거나 뛰어난 성능을 보였고, VideoMAE와 SVT는 대부분의 특징에서 I3D에 미치지 못했다.
Figure 2 : Sample frames extracted from ASL to English translation dataset OpenASL [ 32 ] .
Figure 2 : Sample frames extracted from ASL to English translation dataset OpenASL [ 32 ] .

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.