[논문 리뷰] BosphorusSign22k Sign Language Recognition Dataset
보스포루스사인22k 대규모 터키 수어 데이터셋을 도입하고, OpenPose 및 Kinect v2 모달리티를 추가하며, 평가 프로토콜을 정의하고 IDT와 3D ResNets (MC3)를 사용한 기본선을 제공합니다.
Sign Language Recognition is a challenging research domain. It has recently seen several advancements with the increased availability of data. In this paper, we introduce the BosphorusSign22k, a publicly available large scale sign language dataset aimed at computer vision, video recognition and deep learning research communities. The primary objective of this dataset is to serve as a new benchmark in Turkish Sign Language Recognition for its vast lexicon, the high number of repetitions by native signers, high recording quality, and the unique syntactic properties of the signs it encompasses. We also provide state-of-the-art human pose estimates to encourage other tasks such as Sign Language Production. We survey other publicly available datasets and expand on how BosphorusSign22k can contribute to future research that is being made possible through the widespread availability of similar Sign Language resources. We have conducted extensive experiments and present baseline results to underpin future research on our dataset.
연구 동기 및 목표
- 터키 수어에 대한 서명자 독립적 고립된 SLR 벤치마크를 제공한다.
- 더 풍부한 모달리티(OpenPose, Kinect v2)로 BosphorusSign 데이터세트를 정리·확장하고 작동 가능한 라벨링 체계를 구축한다.
- 평가 프로토콜을 정의하고 새로운 데이터세트에서 기본선을 설정한다.
- 핸드크래프트 기능과 딥러닝 방법 모두를 사용한 기본선을 제시하여 향후 연구를 가능하게 한다.
제안 방법
- 오류 녹음을 제거하고 수동 특징이 유사한 표정을 가진 사인을 축약시켜 BosphorusSign 데이터세트를 병합하고 정리하였다.
- 모든 비디오에 대해 RGB, 깊이, OpenPose 관절(몸체, 얼굴, 손) 및 Kinect v2 골격 데이터를 제공했다.
- 하나의 서명자를 테스트로, 나머지를 학습으로 하는 학습/테스트 분할로 서명자 독립적 평가 프로토콜을 확립했다.
- Fisher Vector 인코딩이 있는 Improved Dense Trajectories(IDT)와 혼합 2D-3D 컨볼루션을 갖는 3D ResNet MC3 모델을 사용해 기본선을 벤치마크했다.
- 이 작업을 위해 Kinetics-400에서 사전 학습된 네트워크를 미세 조정하는 것과 처음부터 학습하는 것을 비교하고 다양한 블록 미세 조정 전략을 평가했다.
- IDT가 강력한 성능을 보이는 기본 결과를 보고하고 향후 개선 방향을 제시하기 위해 실패 원인을 분석했다.
실험 결과
연구 질문
- RQ1최신 수제(handcrafted) 비디오 특징(IDT)이 BosphorusSign22k에서 터키 수화 고립 인식에 대해 어떤 성능을 보이는가?
- RQ2현대 딥러닝 아키텍처(MC3 3D ResNets)가 서명자 독립적 터키 수화 글로스 인식에서 IDT와 비교해 어떤 성능을 보이는가?
- RQ3데이터 모달리티(RGB, 깊이, OpenPose 관절, Kinect 골격)가 인식 성능에 어떤 영향을 미치는가?
- RQ4미래 벤치마킹을 위한 명확한 평가 프로토콜로 서명자 독립적 기본선을 확립할 수 있는가?
- RQ5시각적으로 유사한 터키 수화 글로스를 구분하는 데 있어 주요 오류 패턴과 도전과제는 무엇인가?
주요 결과
- HOF와 MBH 특징이 포함된 IDT가 개별 운동 구성요소에서 Top-1 정확도 86.63%를 달성하고, HOG, HOF, MBH를 융합하면 88.53%에 도달한다.
- 마지막 세 블록을 미세 조정할 때 3D ResNet MC3 기본선은 Top-1 정확도 78.85%를, Top-5는 94.76%를 달성한다.
- 이 작업에서 MC3를 처음부터 학습시키는 것이 사전 학습된 Kinetics-400 모델을 미세 조정하는 것보다 더 우수하다.
- 외관(HOG)과 모션 특징의 융합은 모든 기본선에서 성능을 향상시키고, 궤적 정보 추가는 정확도를 다소 낮출 수 있다.
- 데이터셋은 Health, Finance, Common 글로스에 걸쳐 744개 수화 글로스를 제공하며, 6명의 서명자로부터 22,542개의 비디오(약 19시간)가 있다.
- 저자들은 미세한 손 모양과 더 긴 범위의 시간적 모델링이 여전히 서명자 독립적 SLR의 주요 병목 현상임을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.