Skip to main content
QUICK REVIEW

[논문 리뷰] BEST: BERT Pre-Training for Sign Language Recognition with Coupling Tokenization

Weichao Zhao, Hezhen Hu|arXiv (Cornell University)|2023. 02. 10.
Hand Gesture Recognition Systems인용 수 4
한 줄 요약

BEST는 수동 및 신체 운동을 자세 삼중체 단위로 모델링하고, 커플링 토크나이제이션을 사용하여 연속적인 비디오 신호와 이산적인 BERT 목표 간의 의미 갭을 해소함으로써 수동으로 학습하는 BERT 유사 프리트레인 프레임워크를 제안한다. 이는 네 가지 벤치마크에서 최신 기술을 달성하며, WLASL2000에서 19.12%의 정확도 향상을 기록한다.

ABSTRACT

In this work, we are dedicated to leveraging the BERT pre-training success and modeling the domain-specific statistics to fertilize the sign language recognition~(SLR) model. Considering the dominance of hand and body in sign language expression, we organize them as pose triplet units and feed them into the Transformer backbone in a frame-wise manner. Pre-training is performed via reconstructing the masked triplet unit from the corrupted input sequence, which learns the hierarchical correlation context cues among internal and external triplet units. Notably, different from the highly semantic word token in BERT, the pose unit is a low-level signal originally located in continuous space, which prevents the direct adoption of the BERT cross-entropy objective. To this end, we bridge this semantic gap via coupling tokenization of the triplet unit. It adaptively extracts the discrete pseudo label from the pose triplet unit, which represents the semantic gesture/body state. After pre-training, we fine-tune the pre-trained encoder on the downstream SLR task, jointly with the newly added task-specific layer. Extensive experiments are conducted to validate the effectiveness of our proposed method, achieving new state-of-the-art performance on all four benchmarks with a notable gain.

연구 동기 및 목표

  • 텍스트와는 달리 연속적인 비디오 신호를 포함하는 수동 언어 인식에 BERT의 자기지도 학습 프리트레인 성공을 적용하기 위해.
  • 저수준의 연속적인 자세 시퀀스에 BERT의 교차 엔트로피 목표를 적용하는 데 도전하는 데, 의미 갭을 메우는 메커니즘을 도입하기 위해.
  • 수동 언어 내 수동 및 신체 운동 간의 계층적 맥락 신호를 새로운 사전 과제를 통해 모델링하기 위해.
  • 대규모 약한 레이블이 부여된 비디오 데이터를 활용한 프리트레인을 통해 다운스트림 고립형 수동 언어 인식 성능을 향상시키기 위해.
  • 커플링 토크나이제이션의 효과를 입증하기 위해 연속적인 자세 삼중체 단위에 대한 이산적 의사라벨 생성에 사용되는 방법을 제시하기 위해.

제안 방법

  • 손과 신체 관절 시퀀스에서 자세 삼중체 단위를 구성하여 수동 언어 제스처의 공간적 및 시간적 구성 요소를 표현한다.
  • 마스킹된 단위 모델링(MUM) 사전 과제를 도입하여 임의의 자세 삼중체 단위를 마스킹하고, 맥락에서 재구성하도록 모델을 학습시킨다.
  • 커플링 토크나이제이션을 사용하여 연속적인 자세 삼중체 단위에서 이산적 의사라벨을 생성함으로써 BERT의 교차 엔트로피 목표를 사용할 수 있도록 한다.
  • 프리트레인 단계에서는 MUM을 통해 손상된 입력 시퀀스로부터 계층적 맥락을 학습하기 위해 트랜스포머 백본을 사용한다.
  • 프리트레인 후, 다운스트림 고립형 SLR 벤치마크에서 작업 전용 분류 헤드를 사용하여 인코더를 미세조정한다.
  • 최종적으로, 엔드 투 엔드 미세조정을 통해 맥락 모델링과 의미 표현 학습을 동시에 최적화한다.

실험 결과

연구 질문

  • RQ1연속적이고 저수준적인 비디오 신호를 고려할 때, BERT 스타일의 프리트레인은 수동 언어 인식에 효과적으로 적용될 수 있는가?
  • RQ2연속적인 자세 시퀀스와 이산적인 BERT 토큰 목표 간의 의미 갭을 효과적인 자기지도 학습을 위해 어떻게 메울 수 있는가?
  • RQ3마스킹된 단위 모델링 과제에서 손과 신체 부위를 모두 마스킹하는 것과 한 부위만 마스킹하는 것의 성능에 미치는 영향은 어떠한가?
  • RQ4자세 단위에 대한 의미 있는 의사라벨 생성에 있어 커플링 토크나이제이션은 표준 벡터 양자화 또는 군집화와 비교해 어떻게 성능을 냈는가?
  • RQ5대규모로 촬영된, 정제되지 않은 수동 언어 데이터를 기반으로 프리트레인을 수행할 경우, 다운스트림 고립형 SLR 정확도는 어느 정도 향상되는가?

주요 결과

  • BEST는 평가된 네 가지 벤치마크인 MSASL100, MSASL200, MSASL1000, WLASL2000에서 모두 새로운 최신 기술 성능을 달성한다.
  • WLASL2000 데이터셋에서 BEST는 프리트레인 없이 기준 모델 대비 19.12%의 절대적인 인스턴스별 Top-1 정확도 향상을 기록한다.
  • 제안된 커플링 토크나이제이션 방법은 K-Means 및 VQ를 능가하여, 각각 MSASL100과 MSASL200에서 80.98% 및 81.24%의 정확도를 달성한다.
  • MUM 과제에서 손과 신체 부위를 모두 마스킹하는 것이 가장 높은 성능을 보였으며, MSASL100에서 기준 모델 대비 7.54% 향상되었다.
  • 프리트레인 데이터의 규모가 커질수록 성능이 단조롭게 향상되며, 이는 방법의 확장성과 데이터 효율성을 입증한다.
  • 커플링 토크나이제이션을 사용한 MUM 사전 과제는 각각 MSASL1000과 WLASL2000에서 58.82% 및 54.87%의 Top-1 정확도를 기록하여 모든 아블레이션 설정을 능가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.