[논문 리뷰] Sign Language Translation with Hierarchical Spatio-TemporalGraph Neural Network
이 논문은 수준 간 상호작용을 고려한 계층적 시공간 그래프 신경망(HST-GNN)을 제안하여 수어 번역(SLT)을 수행한다. 수어는 세밀한 수준(관절)과 고수준(신체 부위)의 그래프로 모델링되어 국소적이고 전반적인 시공간적 의존성을 모두 포착한다. 제안된 방법은 Phoenix-2014-T 및 CSL 기준에서 최신 기술 성능을 달성하였으며, 테스트 세트에서 WER 19.5와 BLEU-1 46.1을 기록하였다.
Sign language translation (SLT), which generates text in a spoken language from visual content in a sign language, is important to assist the hard-of-hearing community for their communications. Inspired by neural machine translation (NMT), most existing SLT studies adopted a general sequence to sequence learning strategy. However, SLT is significantly different from general NMT tasks since sign languages convey messages through multiple visual-manual aspects. Therefore, in this paper, these unique characteristics of sign languages are formulated as hierarchical spatio-temporal graph representations, including high-level and fine-level graphs of which a vertex characterizes a specified body part and an edge represents their interactions. Particularly, high-level graphs represent the patterns in the regions such as hands and face, and fine-level graphs consider the joints of hands and landmarks of facial regions. To learn these graph patterns, a novel deep learning architecture, namely hierarchical spatio-temporal graph neural network (HST-GNN), is proposed. Graph convolutions and graph self-attentions with neighborhood context are proposed to characterize both the local and the global graph properties. Experimental results on benchmark datasets demonstrated the effectiveness of the proposed method.
연구 동기 및 목표
- 청각장애인 또는 听력장애 수어 사용자와 말하는 언어 사용자 간의 소통 격차를 해소하기 위해 정확한 수어 번역(SLT)을 가능하게 하기 위해.
- 기존의 순서 기반 번역 모델이 다수의 신체 부위 간 복잡한 시공간 상호작용을 모델링하지 못하는 한계를 극복하기 위해.
- 세밀한 관절 수준과 고수준 영역 수준의 상호작용을 표현할 수 있도록 수어를 계층적 시공간 그래프로 공식화하기 위해.
- 그래프 컨볼루션과 그래프 자기주도 어텐션을 이웃 주변 정보와 통합하여 강력한 표현 학습을 위한 새로운 딥 러닝 아키텍처(HST-GNN)를 개발하기 위해.
- 포괄적인 추론 및 정성적 분석을 통해 제안된 방법의 효과성을 벤치마크 SLT 데이터셋에서 입증하기 위해.
제안 방법
- 손, 몸통 등 신체 부위의 관절 좌표를 사용하여 세밀한 수준의 시공간 그래프를 구축하고, 얼굴, 손 등 핵심 영역의 외관, 운동 또는 자세 특징을 사용하여 고수준 그래프를 구성한다.
- 이웃 주변 정보와 함께 그래프 컨볼루션 및 그래프 자기주도 어텐션 기반 메커니즘을 통합하여 국소적이고 전반적인 그래프 특성을 동시에 모델링한다.
- 에코더는 계층적 그래프를 그래프 컨볼루션과 자기주도 어텐션을 통해 처리하고, 디코더는 학습된 임bedding에서 말하는 언어 텍스트를 생성하는 인코더-디코더 프레임워크를 설계한다.
- 노드 간(신체 부위 간)의 구조적 관계를 유지하기 위해 인접 행렬 기반의 연결 메커니즘을 사용한다.
- 단기적 의존성을 포착하면서 장기적 역사 데이터에서 유도되는 노이즈를 최소화하기 위해 최적 크기 3의 시간 윈도우를 적용한다.
- 학습 중 정렬 감독을 향상시키기 위해 CTC 손실을 적용하여 어휘 예측 정확도를 향상시킨다.

실험 결과
연구 질문
- RQ1그래프 기반 표현을 통해 수어의 다중 모odal, 시공간적 특성을 효과적으로 모델링할 수 있는가?
- RQ2고립적으로 모델링하는 것과 비교해 복합적인 공간 및 시간 그래프 구조를 통합할 경우 SLT 성능에 어떤 영향을 미치는가?
- RQ3세밀한 수준과 고수준의 계층적 그래프 모델링 방식이 평면적 또는 단일 수준의 그래프 접근 방식보다 수어 표현에 어떻게 향상되는가?
- RQ4이웃 주변 정보와 함께 그래프 컨볼루션 및 그래프 자기주도 어텐션은 SLT에서 특징 학습을 얼마나 향상시키는가?
- RQ5의미 있는 수어의 역학을 포착하기 위해 최적의 시간 윈도우 크기는 무엇인가? 노이즈를 유발하지 않으면서도 효과적인가?
주요 결과
- 제안된 HST-GNN는 Phoenix-2014-T 데이터셋에서 최신 기술 성능을 달성하였으며, 테스트 세트에서 WER 19.5와 BLEU-1 46.1을 기록하였다.
- CSL 데이터셋에서는 WER 27.6과 BLEU-1 49.1을 기록하여 다양한 수어 데이터셋에 대한 강력한 일반화 능력을 입증하였다.
- 추론 분석 결과, 공간적 및 시간적 그래프 모델링을 병합하면 개별 구성 요소보다 성능 향상이著명했으며, 전체 HST-GNN가 모든 추론 변형보다 뛰어난 성능을 보였다.
- 계층적 모델링 구성 요소는 특히 희귀하거나 복잡한 어휘를 탐지하는 데 성능 향상을 이끌어내었으며, 정성적 분석을 통해 이를 확인할 수 있었다.
- 최적의 시간 윈도우 크기는 3로 확인되었으며, 이보다 큰 윈도우는 노이즈 증가와 모델 복잡성 증가로 성능 저하를 유발하였다.
- 정성적 결과 분석에서 전체 HST-GNN 모델은 테스트 예시에서 모든 어휘를 정확히 탐지한 반면, 베이스라인 및 부분 모델은 어휘 누락 또는 삽입 문제를 겪었다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.