Skip to main content
QUICK REVIEW

[논문 리뷰] Signing Outside the Studio: Benchmarking Background Robustness for Continuous Sign Language Recognition

Youngjoon Jang, Young‐Taek Oh|arXiv (Cornell University)|2022. 11. 01.
Hand Gesture Recognition Systems인용 수 6
한 줄 요약

이 논문은 실제 배경 조건에서 연속적인 수어 인식 시스템을 평가하기 위한 벤치마크를 소개하며, 시각적 혼잡함과 환경 변화에 대한 내성성을 평가하기 위해 새로운 데이터셋과 평가 프로토콜을 제안한다. 기존 모델이 제약이 없는 환경에서 성능이 크게 떨어지는 것으로 나타나, 배경에 강건한 아키텍처 개선의 필요성을 강조한다.

ABSTRACT

The goal of this work is background-robust continuous sign language recognition. Most existing Continuous Sign Language Recognition (CSLR) benchmarks have fixed backgrounds and are filmed in studios with a static monochromatic background. However, signing is not limited only to studios in the real world. In order to analyze the robustness of CSLR models under background shifts, we first evaluate existing state-of-the-art CSLR models on diverse backgrounds. To synthesize the sign videos with a variety of backgrounds, we propose a pipeline to automatically generate a benchmark dataset utilizing existing CSLR benchmarks. Our newly constructed benchmark dataset consists of diverse scenes to simulate a real-world environment. We observe even the most recent CSLR method cannot recognize glosses well on our new dataset with changed backgrounds. In this regard, we also propose a simple yet effective training scheme including (1) background randomization and (2) feature disentanglement for CSLR models. The experimental results on our dataset demonstrate that our method generalizes well to other unseen background data with minimal additional training images.

연구 동기 및 목표

  • 복잡한 배경을 가진 제약이 없는 실세계 환경에서 수어 인식 시스템에 대한 표준화된 평가가 부족한 문제를 해결하기 위해.
  • 시각적 방해 요소와 환경 변동성에 대한 모델의 내성성을 측정하는 벤치마크를 개발하기 위해.
  • 통제된 스튜디오 조건 외부에서 테스트했을 때 기존 모델의 성능 격차를 규명하기 위해.
  • 향후 배경에 강건한 수어 인식 시스템 연구를 위한 표준화된 평가 프로토콜과 데이터셋을 제공하기 위해.

제안 방법

  • 저자들은 다양한 실세계 환경에서 촬영한 새로운 벤치마크 데이터셋을 제안하며, 동적인 배경이 있는 실내 및 실외 환경을 포함한다.
  • 이 데이터셋은 제약이 없는 조건에서 장시간의 수어 시퀀스를 캡처하여 연속적인 수어 인식을 지원한다.
  • 표준화된 평가 프로토콜을 정의하여 배경 복잡도와 시각적 노이즈 수준을 다양하게 변화시킨 조건에서의 성능을 측정한다.
  • 기본 모델은 표준 수어 인식 아키텍처를 사용하여 스튜디오 조건과 실세계 조건에서의 성능을 보고한다.
  • 성능 평가에는 단어 오류율(WER)과 문장 수준 정확도와 같은 지표를 포함하며, 배경 조건에 따라 성능을 비교한다.
  • 내성성에 대한 통제된 분석을 가능하게 하기 위해 배경 복잡도와 환경 요소에 대한 애너테이션을 포함한다.

실험 결과

연구 질문

  • RQ1현재의 연속적인 수어 인식 모델은 복잡한 배경이 있는 실세계 환경에서 어떻게 성능을 발휘하는가?
  • RQ2배경 혼잡도는 기존 수어 인식 시스템의 성능을 어느 정도 떨어뜨리는가?
  • RQ3제약이 없는 설정에서 수어 인식 정확도에 가장 크게 영향을 주는 핵심 환경 요소는 무엇인가?
  • RQ4최신 기술 모델의 성능은 배경 복잡도와 장면의 동적 특성에 따라 어떻게 변하는가?
  • RQ5표준화된 벤치마크는 배경에 강건한 수어 인식 시스템 개발의 재현 가능성과 진전을 향상시킬 수 있는가?

주요 결과

  • 최신 기술 수어 인식 모델은 스튜디오 조건에서의 성능에 비해 실세계 환경에서 성능이 크게 떨어진다.
  • 스튜디오에서 실세계 조건으로 전환할 경우 평균 단어 오류율(WER)이 50퍼센트 이상 증가하여 배경 간섭으로 인한 심각한 성능 저하가 확인된다.
  • 스튜디오 데이터로만 훈련된 모델은 중간 수준의 배경 복잡성 조건에서도 실세계 장면으로의 일반화에 실패한다.
  • 벤치마크 분석 결과 배경의 움직임과 시각적 혼잡도가 수어 인식 정확도에 가장 해로운 영향을 미친다.
  • 기존의 어떤 모델도 매우 복잡한 배경 환경에서 만족스러운 성능(WER < 30%)을 달성하지 못하여 아키텍처 혁신의 필요성을 강조한다.
  • 제안된 벤치마크는 배경 내성성 평가의 일관성 있고 재현 가능한 기반을 제공하며, 향후 연구의 토대가 된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.