[논문 리뷰] An Open-Source Gloss-Based Baseline for Spoken to Signed Language Translation
이 논문은 독일어, 프랑스어, 이탈리아어 텍스트를 스위스 독일어, 프랑스어, 이탈리아어 수어로 변환하는 개방형이고 재현 가능한 파이프라인을 제시한다. 이는 텍스트-글로스-포즈-비디오 프레임워크를 기반으로 하며, 어간 추출기, 규칙 기반 재정렬/삭제 모듈, 신경 기계 번역 시스템을 통한 텍스트-글로스 번역, 어휘에서 유도된 뼈대 포즈를 활용한 글로스-포즈 변환, 공동체 기반 개선을 위한 공유된 코드와 데이터를 통합하여, 향후 연구를 위한 기초 기반을 구축한다.
Sign language translation systems are complex and require many components. As a result, it is very hard to compare methods across publications. We present an open-source implementation of a text-to-gloss-to-pose-to-video pipeline approach, demonstrating conversion from German to Swiss German Sign Language, French to French Sign Language of Switzerland, and Italian to Italian Sign Language of Switzerland. We propose three different components for the text-to-gloss translation: a lemmatizer, a rule-based word reordering and dropping component, and a neural machine translation system. Gloss-to-pose conversion occurs using data from a lexicon for three different signed languages, with skeletal poses extracted from videos. To generate a sentence, the text-to-gloss system is first run, and the pose representations of the resulting signs are stitched together.
연구 동기 및 목표
- 말하기 언어에서 수어로의 번역에 있어 표준화되고 재현 가능한 기반 시스템의 부재로 인해 비교 평가 및 분야 내 혁신이 저해되는 문제를 해결하기 위해.
- 신규 연구자들이 접근하기 쉬운 환경을 조성하기 위해 개방형 도구와 모듈식 파이프라인 아키텍처를 제공하기 위해.
- 특히 자원이 제한된 환경에서 수어 번역 시스템의 접근성과 확장성을 향상시키기 위해.
- 공동체가 유지 관리하는 공통 기반 프레임워크를 통해 새로운 방법의 체계적 평가 및 벤치마킹을 가능하게 하기 위해.
- 후처리 및 확장 기반으로 더 정확하고 유창한 수어 생성을 지원하기 위해 기초가 되는 기반을 제공하기 위해.
제안 방법
- 시스템은 세 단계 파이프라인을 활용한다: 텍스트-글로스 번역, 글로스-포즈 변환, 포즈-비디오 애니메이션.
- 텍스트-글로스 번역을 위해 세 가지 별도의 구성 요소를 구현한다: 어간 추출기, 규칙 기반 단어 재정렬 및 제거 모듈, MeineDGS 코퍼스를 사용한 신경 기계 번역(NMT) 시스템.
- 글로스-포즈 변환은 추출된 뼈대 포즈가 포함된 수어 영상 어휘를 활용하며, 자르기, 연결, 부드럽게 처리하는 전처리 단계를 포함한다.
- 개별 서브문장 포즈를 글로스 순서에 따라 연결하여 시간적 및 공간적 정렬을 유지하는 포즈 시퀀스를 생성한다.
- 포즈-비디오 생성 단계에서는 최신 기술의 포즈-비디오 모델을 사용해 뼈대 포즈 시퀀스에서 최종 비디오를 합성한다.
- 전체 시스템은 GitHub에 개방형으로 배포되어 공동체 기여, 재현 가능성, 확장성이 보장된다.
실험 결과
연구 질문
- RQ1비교 연구 및 공동체 개발을 지원하기 위해 말하기 언어에서 수어로의 번역에 대해 재현 가능하고 개방형 기반 시스템을 어떻게 확립할 수 있는가?
- RQ2어간 추출, 규칙 기반 재정렬/제거, 신경 기계 번역이라는 각각의 텍스트-글로스 번역 구성 요소의 상대적 강점과 한계는 무엇인가? 이는 정확한 글로스 시퀀스 생성에 어떤 영향을 미치는가?
- RQ3어휘 기반 글로스-포즈 변환 방식이 뼈대 포즈 데이터를 사용해 얼마나 자연스럽고 부드러운 수어 애니메이션을 생성할 수 있는가?
- RQ4모르는 글로스, 변형(예: 복수형), 고유명사 등의 요소를 체계적이고 언어학적으로 타당한 방식으로 효과적으로 다룰 수 있는 방법은 무엇인가?
- RQ5후처리 또는 확산 기반 정밀 조정을 통해 포즈 시퀀스의 자연스러움과 유창성을 향상시키기 위해 어떤 개선 조치를 취할 수 있는가?
주요 결과
- 제안된 파이프라인은 독일어, 프랑스어, 이탈리아어 입력 텍스트에 대해 스위스의 세 수어 언어를 모두 성공적으로 비디오로 생성하여, 스위스의 세 수어 언어에 대해 실현 가능성을 입증한다.
- NMT 기반 텍스트-글로스 구성 요소는 의미 해석이 분명한 글로스 ID를 생성하여, 규칙 기반 또는 어간 추출 기반 접근 방식보다 더 높은 의미 정확도를 확보한다.
- 어휘에서 유도된 뼈대 포즈를 활용한 글로스-포즈 변환은 전처리 단계를 통해 포즈 품질과 연속성을 향상시켜 신뢰할 수 있는 데이터 기반 애니메이션을 가능하게 한다.
- SignWriting이나 HamNoSys와 같은 글쓰기 체계를 활용한 흐릿한 매칭을 통해 미리 정의되지 않은 글로스를 처리할 수 있으며, Ham2Pose와 같은 모델을 통해 비디오 생성이 가능하다.
- GitHub에 공개된 개방형 배포를 통해 공동체 협업, 재현 가능성, 확장성이 보장되며, 향후 실제 및 합성 포즈 시퀀스를 기반으로 훈련된 확산 모델을 활용한 후처리 기능 개발 계획이 수립되어 있다.
- 이 프레임워크는 향후 연구를 위한 기초를 제공하며, 글로스 의미 해석 분리, 형태적 변형 처리(예: 복수형), 품사 변환 등의 분야에서의 발전이 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.