Skip to main content
QUICK REVIEW

[논문 리뷰] Skeletal Graph Self-Attention: Embedding a Skeleton Inductive Bias into Sign Language Production

Ben Saunders, Necati Cihan Camgöz|arXiv (Cornell University)|2021. 12. 06.
Hand Gesture Recognition Systems인용 수 11
한 줄 요약

이 논문은 뼈대 유도 편향을 신호어 생산에 통합하기 위해 신호어를 뼈대 구조를 가진 시공간 그래프로 모델링함으로써, 뼈대를 노드로, 공간적/시간적 연결을 간선으로 간주하는 새로운 그래프 기반 어텐션 메커니즘인 뼈대 그래프 자기어텐션(SGSA)을 제안한다. 희소 인접 행렬을 직접 자기어텐션 메커니즘에 통합함으로써 네트워크 전반에서 구조 정보를 유지하며, PHOENIX14 T 데이터셋에서 15.15 BLEU-4 (dev) 및 14.33 BLEU-4 (test)의 최고 성능을 달성하여 이전 방법 대비 각각 8%와 7% 향상된 결과를 보였다.

ABSTRACT

Recent approaches to Sign Language Production (SLP) have adopted spoken language Neural Machine Translation (NMT) architectures, applied without sign-specific modifications. In addition, these works represent sign language as a sequence of skeleton pose vectors, projected to an abstract representation with no inherent skeletal structure. In this paper, we represent sign language sequences as a skeletal graph structure, with joints as nodes and both spatial and temporal connections as edges. To operate on this graphical structure, we propose Skeletal Graph Self-Attention (SGSA), a novel graphical attention layer that embeds a skeleton inductive bias into the SLP model. Retaining the skeletal feature representation throughout, we directly apply a spatio-temporal adjacency matrix into the self-attention formulation. This provides structure and context to each skeletal joint that is not possible when using a non-graphical abstract representation, enabling fluid and expressive sign language production. We evaluate our Skeletal Graph Self-Attention architecture on the challenging RWTH-PHOENIX-Weather-2014T(PHOENIX14T) dataset, achieving state-of-the-art back translation performance with an 8% and 7% improvement over competing methods for the dev and test sets.

연구 동기 및 목표

  • 기존의 신호어 생산(SLP) 모델들이 뼈대 자세를 추상적인 시퀀스로 간주하여 구조적 유도 편향이 부족한 문제를 해결하기 위해.
  • 인간 운동의 본질적인 공간적 및 시간적 구조를 유지함으로써 표현력 있고 유연한 신호어 생성을 향상시키기 위해.
  • 트랜스포머 기반 아키텍처 내에서 뼈대의 위상 구조를 명시적으로 모델링하는 새로운 어텐션 메커니즘을 개발하기 위해.
  • 자기어텐션에 그래픽 구조를 통합함으로써 SLP 벤치마크 성능 향상이 가능함을 입증하기 위해.

제안 방법

  • 관절을 노드로, 사지 연결을 간선으로 간주하여 시공간 뼈대 그래프로 신호어 시퀀스를 표현하기 위해.
  • 희소 시공간 인접 행렬을 적용하여 어텐션 계산를 제약하는 수정된 멀티헤드 자기어텐션 레이어인 뼈대 그래프 자기어텐션(SGSA)을 제안하기 위해.
  • 인접 행렬을 자기어텐션의 값 계산에 직접 통합하여 공간적 및 국소적인 시간 정보 전파를 보장하기 위해.
  • 추상적 표현으로의 투영을 피하고 네트워크 전반에서 원본 뼈대 특징 표현을 유지하기 위해.
  • 프레임 수준의 의존성을 모델링하기 위해 글로벌 시간 인접 행렬을 사용하면서도, 시간 어텐션을 바로 이전 프레임으로 제한하기 위해.
  • 백트랜슬레이션과 어휘 감독을 사용하여 텍스트에서 표현적인 신호 운동을 엔드 투 엔드로 학습할 수 있도록 모델을 훈련하기 위해.

실험 결과

연구 질문

  • RQ1명시적인 공간적 및 시간적 간선을 가진 뼈대 그래프로 신호어를 모델링하면 신호어 생산 품질이 향상되는가?
  • RQ2그래픽 어텐션 메커니즘을 통해 뼈대 유도 편향을 통합하면 더 표현력 있고 자연스러운 신호어 생성이 가능한가?
  • RQ3시간 인접 거리의 선택이 SLP 작업 성능에 어떤 영향을 미치는가?
  • RQ4그래프 인식 자기어텐션 메커니즘이 신호어 생산에서 표준 트랜스포머 레이어를 능가할 수 있는가?

주요 결과

  • 제안된 SGSA 모델은 PHOENIX14 T 데이터셋의 dev 세트에서 15.15 BLEU-4, test 세트에서 14.33 BLEU-4를 기록하여 새로운 최고 성능을 달성하였다.
  • 5개의 SGSA 레이어를 사용할 경우 최고의 성능을 보이며, 14.72 BLEU-4 점수를 기록하여 깊이 있는 그래프 모델링이 표현을 향상시킴을 시사한다.
  • 시간 인접 거리가 1(국소적 컨텍스트만)일 경우 성능이 가장 높았으며, 이는 모델이 마르코프 유도 편향의 이점을 얻고 있음을 시사한다.
  • SGSA 레이어를 표준 자기어텐션 레이어로 교체하면 성능이 14.25 BLEU-4로 크게 하락하여 그래프 유도 편향의 필요성을 입증한다.
  • 제거 실험 결과, 네트워크 전반에서 뼈대 그래프 구조를 유지하는 것이 성능에 매우 중요하다는 것이 확인되었다.
  • 프로그레시브 트랜스포머, 적대적 훈련, 혼합 밀도 네트워크, 혼합 운동 원소를 포함한 네 가지 강력한 베이스라인 모델보다 dev 및 test 세트에서 각각 8%와 7% 향상된 성능을 기록하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.