[논문 리뷰] PiSLTRc: Position-informed Sign Language Transformer with Content-aware Convolution
이 논문은 콘텐츠 인식형 및 위치 정보를 반영한 컨볼루션을 통해 신원 표현을 향상시키고, 상대적 위치 인코딩을 자기주의 어텐션 메커니즘에 통합하는 sign language Transformer 모델인 PiSLTRc를 제안한다. 동적으로 의미적으로 유사한 인접 프레임을 선택하고, 위치 인식형 컨볼루션을 통해 이를 집계함으로써, 그리고 분리된 상대적 위치 인코딩을 사용함으로써, PiSLTRc는 +1.6 BLEU 향상으로 sign language 번역 벤치마크에서 최신 기술 수준의 성능을 달성한다.
Since the superiority of Transformer in learning long-term dependency, the sign language Transformer model achieves remarkable progress in Sign Language Recognition (SLR) and Translation (SLT). However, there are several issues with the Transformer that prevent it from better sign language understanding. The first issue is that the self-attention mechanism learns sign video representation in a frame-wise manner, neglecting the temporal semantic structure of sign gestures. Secondly, the attention mechanism with absolute position encoding is direction and distance unaware, thus limiting its ability. To address these issues, we propose a new model architecture, namely PiSLTRc, with two distinctive characteristics: (i) content-aware and position-aware convolution layers. Specifically, we explicitly select relevant features using a novel content-aware neighborhood gathering method. Then we aggregate these features with position-informed temporal convolution layers, thus generating robust neighborhood-enhanced sign representation. (ii) injecting the relative position information to the attention mechanism in the encoder, decoder, and even encoder-decoder cross attention. Compared with the vanilla Transformer model, our model performs consistently better on three large-scale sign language benchmarks: PHOENIX-2014, PHOENIX-2014-T and CSL. Furthermore, extensive experiments demonstrate that the proposed method achieves state-of-the-art performance on translation quality with $+1.6$ BLEU improvements.
연구 동기 및 목표
- 프레임 단위의 어텐션으로 인해 신호 제스처의 시간적 의미적 구조를 포착하지 못하는 일반적인 Transformer의 한계를 해결하기 위해.
- sign language 모델링에서 절대적 위치 인코딩의 방향 및 거리 무관성 문제를 해결하기 위해.
- 콘텐츠 인식형 주변 프레임 수집 및 위치 인식형 컨볼루션을 통합함으로써 sign language 인식 및 번역을 향상시키기 위해.
- 자기주의 어텐션, 디코더 및 크로스 어텐션 메커니즘에 상대적 위치 정보를 통합하여 더 나은 시퀀스 모델링을 위해.
- 강력한 인식 품질을 유지하면서 sign language 번역에서 최신 기술 수준의 성능을 달성하기 위해.
제안 방법
- 의미적 유사도에 기반해 동적으로 인접 프레임을 선택하여 국소 제스처 표현을 향상시키는 콘텐츠 인식형 주변 프레임 수집 방법을 제안한다.
- 상대적 위치 인코딩을 사용하여 위치적 맥락을 유지하면서 선택된 특징을 집계하는 위치 인식형 시간 컨볼루션 레이어를 도입한다.
- 자기주의 어텐션 메커니즘의 인코더, 디코더 및 크로스 어텐션에 방향성과 거리 인식 능력을 통합하기 위해 분리된 상대적 위치 인코딩(DRPE)을 활용한다.
- 공유된 특징 학습을 통해 sign language 인식과 번역을 동시에 수행하는 통합 프레임워크인 PiSLTRc를 설계한다.
- 특징 추출을 위해 CNN-LSTM-HMM 백본을 사용하고, 이후 제안된 CPTcn 모듈과 DRPE 향상된 Transformer 블록을 적용한다.
- 인식(gloss)과 번역(text) 목표를 결합한 다중 태스크 손실을 사용하여 모델을 엔드 투 엔드로 훈련시킨다.

실험 결과
연구 질문
- RQ1시간적 의미적 일관성을 활용하여 콘텐츠 인식형 주변 프레임 수집이 제스처 표현을 향상시킬 수 있는가?
- RQ2위치 인식형 컨볼루션을 통합함으로써 제스처 표현의 강건성이 향상되는가?
- RQ3자기주의 어텐션에 상대적 위치 인코딩을 통합하면 절대적 위치 인코딩을 초월해 sign language 모델링을 향상시킬 수 있는가?
- RQ4sign language 인식과 번역의 공동 학습이 별도 학습보다 더 나은 성능을 내는가?
- RQ5제안된 방법이 대규모 sign language 벤치마크에서 최신 기술 수준의 성능을 달성할 수 있는가?
주요 결과
- PHOENIX-2014-T 데이터셋에서 PiSLTRc는 일반적인 SLTR 모델 대비 +1.6 BLEU 향상으로 더 뛰어난 번역 품질을 입증한다.
- PHOENIX-2014 sign2gloss 작업에서 PiSLTRc-R는 개발 세트에서 일반 SLTR-R 대비 12% 향상되었고, 테스트 세트에서는 7% 향상되었다.
- CSL 데이터셋에서 PiSLTRc-R는 테스트 세트에서 SLTR-R 대비 24% 향상되어 다양한 sign language에 대한 강력한 일반화 능력을 보였다.
- sign2text 작업에서 PiSLTRc-T는 일반 SLTR-T 모델 대비 BLEU-4 점수에서 각각 3.8%와 5.6% 향상되어 제안된 구성 요소의 효과를 확인했다.
- 제거 실험을 통해 콘텐츠 인식형 주변 프레임 수집과 상대적 위치 인코딩 모두 성능 향상에 기여한다는 것이 확인되었다.
- 모델은 모든 세 가지 평가된 벤치마크인 PHOENIX-2014, PHOENIX-2014-T 및 CSL에서 인식 및 번역 작업 모두 최신 기술 수준의 성능를 달성했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.