[논문 리뷰] Keypoint based Sign Language Translation without Glosses
이 논문은 스켈레톤 키포인트 벡터에 대해 맞춤형 정규화 기법과 동적 영상 길이 적응을 위한 확률적 프레임 선택 전략(SASS)을 도입함으로써, 어휘(annotation)에 의존하지 않고도 키포인트 기반 수어 번역(SLT)을 수행하는 방법을 제안한다. 이 방법은 어휘가 없는 고해상도 및 저해상도 SLT 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하며, 다양한 데이터셋 간의 강건성과 일반화 능력을 입증한다.
Sign Language Translation (SLT) is a task that has not been studied relatively much compared to the study of Sign Language Recognition (SLR). However, the SLR is a study that recognizes the unique grammar of sign language, which is different from the spoken language and has a problem that non-disabled people cannot easily interpret. So, we're going to solve the problem of translating directly spoken language in sign language video. To this end, we propose a new keypoint normalization method for performing translation based on the skeleton point of the signer and robustly normalizing these points in sign language translation. It contributed to performance improvement by a customized normalization method depending on the body parts. In addition, we propose a stochastic frame selection method that enables frame augmentation and sampling at the same time. Finally, it is translated into the spoken language through an Attention-based translation model. Our method can be applied to various datasets in a way that can be applied to datasets without glosses. In addition, quantitative experimental evaluation proved the excellence of our method.
연구 동기 및 목표
- 중간 단계로 사용되는 어휘(annotation)에 의존하지 않고 직접 수어에서 텍스트로의 번역을 해결하기 위해.
- 다양한 수어자 자세와 카메라 각도에서 특징의 강건성을 향상시키기 위해 신체 부위 인식 정규화 방법을 개발하여 키포인트 기반 SLT의 성능을 향상시키기 위해.
- SLT에서 변동하는 영상 길이 문제를 해결하기 위해, 입력 시퀀스 길이를 영상 길이에 따라 동적으로 조정할 수 있는 확률적 프레임 선택 방법을 도입하기 위해.
- 특히 어휘 주석이 없는 데이터셋에도 적용 가능한 일반화 가능한 비디오 처리 파이프라인을 구축하기 위해.
- 실제 수어 데이터셋을 대상으로 체계적인 아블레이션 및 정성적 평가를 통해 제안된 방법의 유효성을 입증하기 위해.
제안 방법
- 신체 부위(예: 손, 얼굴, 흉부)에 따라 다른 정규화 전략을 적용하는 맞춤형 키포인트 정규화 방법을 제안하여, 다양한 수어자 자세와 카메라 시점에서의 특징 일관성을 향상시킨다.
- 확률적 샘플링을 활용해 핵심 프레임을 우선순위로 지정하면서도 영상 길이에 따라 입력 시퀀스 길이를 동적으로 조정할 수 있는 Stochastic Augmentation and Skip Sampling(SASS) 프레임 선택 방법을 도입한다.
- 정규화된 키포인트 시퀀스를 입력으로 사용하는 Bahdanau 어텐션 기반 GRU 기반 인코더-디코더 아키텍처를 사용하여 시퀀스 간 수어 번역을 수행한다.
- 키포인트 간 거리 기반 프레임 수준 정규화를 적용하여 공간적 변동성을 줄이고, 다양한 해상도와 수어자 위치에서의 모델 일반화 능력을 향상시킨다.
- 정규화 및 프레임 선택 이후 고정 길이의 키포인트 표현을 사용하여 표준 신경 기계 번역(NMT) 모델과의 호환성을 확보한다.
- 어휘 주석이 없는 데이터셋에도 적용 가능한 엔드 투 엔드 훈련 가능한 파이프라인을 설계하여 실생활 상황에서의 실용성 향상에 기여한다.
실험 결과
연구 질문
- RQ1어휘 주석에 의존하지 않고도 키포인트 기반 SLT 시스템이 높은 성능을 달성할 수 있는가?
- RQ2신체 부위별로 특화된 정규화 방법은 수어 영상 처리에서 키포인트 표현의 강건성을 어떻게 향상시키는가?
- RQ3확률적 프레임 선택 전략은 길이가 다른 영상 간 정보 유지와 계산 효율성의 균형을 효과적으로 달성할 수 있는가?
- RQ4제안된 방법은 고정 길이 입력이 필요 없이 다양한 해상도와 영상 길이를 가진 데이터셋 간에 일반화 가능한가?
- RQ5맞춤형 정규화와 SASS의 조합은 표준 정규화 및 고정 샘플링 대비 번역 품질에서 어떻게 우월한가?
주요 결과
- 제안된 맞춤형 정규화 방법은 표준 정규화 대비 번역 성능을 크게 향상시키며, 특히 자세와 시점 변화에 대한 내성 강건성을 향상시킨다.
- SASS 방법은 고정 샘플링과 단독으로 사용된 확률적 증강보다 모두 우수하며, 모든 데이터셋에서 최고의 종합 번역 성능을 달성한다.
- RWTH-PHOENIX-Weather-2014 T 데이터셋에서, 짧고 중간 길이의 문장 번역은 정확하게 생성하지만, 더 긴 문장은 끝부분에서 다소 성능 저하가 발생한다.
- KETI 데이터셋에서는 긴 문장 번역이 매우 정확하게 수행되며, 대부분의 경우 실제 번역과 거의 완벽하게 일치한다.
- 아블레이션 연구 결과, 맞춤형 정규화와 SASS 모두 성능 향상에 독립적이고 상호 보완적인 기여를 하며, 전체 방법이 모든 베이스라인보다 뛰어난 성능을 보인다.
- 제안된 방법은 고해상도(KETI)와 저해상도(PHOENIX) 벤치마크에서 모두 뛰어난 일반화 능력을 보이며, 데이터셋 특화 튜닝 없이도 우수한 성능을 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.