Skip to main content
QUICK REVIEW

[논문 리뷰] Word separation in continuous sign language using isolated signs and post-processing

Razieh Rastgoo, Kourosh Kiani|arXiv (Cornell University)|2022. 04. 02.
Hand Gesture Recognition Systems인용 수 5
한 줄 요약

이 논문은 고립된 서브모델과 후처리를 활용하여 연속된 수어 인식에서 단어 경계를 탐지하는 이단계 프레임워크를 제안한다. 동일한 프레임 수를 가진 고립된 서브로 훈련된 모델은 CNN-SVD-LSTM 아키텍처를 사용한 후 임계값 기반 후처리 단계를 거쳐 연속적인 시퀀스에서 고립된 서브를 식별하며, RKS-PERSIANSIGN 데이터셋에서 평균 98%의 Softmax 신뢰도를 달성하고 ASLLVD에서 59%를 기록한다.

ABSTRACT

. Continuous Sign Language Recognition (CSLR) is a long challenging task in Computer Vision due to the difficulties in detecting the explicit boundaries between the words in a sign sentence. To deal with this challenge, we propose a two-stage model. In the first stage, the predictor model, which includes a combination of CNN, SVD, and LSTM, is trained with the isolated signs. In the second stage, we apply a post-processing algorithm to the Softmax outputs obtained from the first part of the model in order to separate the isolated signs in the continuous signs. While the proposed model is trained on the isolated sign classes with similar frame numbers, it is evaluated on the continuous sign videos with a different frame length per each isolated sign class. Due to the lack of a large dataset, including both the sign sequences and the corresponding isolated signs, two public datasets in Isolated Sign Language Recognition (ISLR), RKS-PERSIANSIGN and ASLLVD, are used for evaluation. Results of the continuous sign videos confirm the efficiency of the proposed model to deal with isolated sign boundaries detection.

연구 동기 및 목표

  • 연속된 수어 영상에서 고립된 서브 간 명시적인 경계를 탐지하는 과제를 해결하기 위해.
  • 대규모 연속 수어 데이터셋이 없을 경우에도 고립된 수어 인식(ISLR)에서 연속 수어 인식(CSLR)으로의 전이 학습을 가능하게 하기 위해.
  • Softmax 출력 임계값을 활용해 서브 경계 탐지 성능을 향상시키는 경량 후처리 솔루션을 개발하기 위해.
  • 고립된 영상에서 연속 수어 시퀀스를 인위적으로 구성함으로써 실제 ISLR 데이터셋(RKS-PERSIANSIGN 및 ASLLVD)에서 모델 성능을 평가하기 위해.
  • 특정 신뢰도 임계값을 초과하지 않는 경우 아무런 서브 클래스도 탐지하지 못하도록 'Blank' 레이블을 할당하여 잘못된 인식을 줄이기 위해.

제안 방법

  • 각 클래스의 프레임 수가 일정한 고립된 수어 영상에 대해 CNN-SVD-LSTM 하이브리드 모델을 훈련시켰다.
  • 연속된 수어 시퀀스의 각 시간 프레임에 대해 클래스 확률을 산출하기 위해 Softmax 레이어를 적용했다.
  • 신뢰도 임계값 0.51을 설정하여 유효한 서브 탐지 여부를 판단하는 후처리 알고리즘을 구현했다.
  • 임계값을 사용해 낮은 신뢰도 예측을 억제하고, 이를 잘못된 서브 클래스 대신 'Blank'로 레이블링했다.
  • 다양한 길이의 서로 다른 클래스에서의 고립된 영상 영상을 연결하여 연속된 수어 영상을 구성했다.
  • RKS-PERSIANSIGN에서 100개의 연속된 수어 영상과 ASLLVD에서 7개의 영상에서 모델을 평가하였으며, 성능 지표로 평균 Softmax 출력을 사용했다.

실험 결과

연구 질문

  • RQ1고립된 서브로 훈련된 모델이 연속된 수어 시퀀스에서 서브 경계를 탐지하는 데 일반화 가능한가?
  • RQ2신뢰도 임계값을 활용한 후처리가 연속된 수어 인식 중 잘못된 서브 탐지 수를 줄이는 데 얼마나 효과적인가?
  • RQ3대규모 연속 수어 데이터셋이 없을 경우 ISLR에서 CSLR로의 전이 학습이 성능 향상에 기여하는가?
  • RQ4각 서브 클래스의 학습 샘플 수가 다른 데이터셋에서 모델 성능은 어떻게 달라지는가?
  • RQ5서브 간 시각적 유사도(예: 'Excuse' vs. 'Congratulation')가 연속된 수어 시퀀스에서 인식 신뢰도에 얼마나 영향을 미치는가?

주요 결과

  • 제안된 방법은 RKS-PERSIANSIGN 데이터셋에서 평균 0.98의 Softmax 출력 신뢰도를 달성하여 서브 탐지의 높은 신뢰성을 보였다.
  • ASLLVD 데이터셋에서는 평균 Softmax 신뢰도가 0.59로, 클래스당 학습 샘플 수가 적어 낮은 신뢰도를 반영했다.
  • 후처리 단계 덕분에 잘못된 서브 탐지가 효과적으로 억제되었으며, 모든 잘못된 예측의 Softmax 출력이 0.51 이하에 머물렀다.
  • 서브 클래스의 프레임 수가 다양함에도 불구하고 모델은 연속 시퀀스에서 고립된 서브를 성공적으로 식별했다.
  • 시각적으로 유사한 서브(예: 'Fight'와 'Competition')는 여전히 도전 과제로 남아 있어 더 다양한 학습 샘플이 필요하다는 점을 시사했다.
  • 명시적인 연속 수어 애너테이션 없이도 고립된 수어 데이터만으로도 실제 환경에서의 적용 가능성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.