Skip to main content
QUICK REVIEW

[논문 리뷰] AdaBrowse: Adaptive Video Browser for Efficient Continuous Sign Language Recognition

Lianyu Hu, Liqing Gao|arXiv (Cornell University)|2023. 08. 16.
Hand Gesture Recognition SystemsComputer Science인용 수 3
한 줄 요약

AdaBrowse는 계산 비용을 줄이기 위해 정보가 풍부한 비디오 서브시퀀스와 입력 해상도를 동적으로 선택하는 적응형 비디오 브라우징 프레임워크를 제안한다. 경량 정책 네트워크와 Gumbel-Softmax 샘플링을 통해 시간적 및 공간적 특징 중복을 활용함으로써, 기존 방법 대비 1.44배 높은 처리량과 2.12배 적은 FLOPs를 기록하면서 최신 기술 수준의 정확도를 달성한다.

ABSTRACT

Raw videos have been proven to own considerable feature redundancy where in many cases only a portion of frames can already meet the requirements for accurate recognition. In this paper, we are interested in whether such redundancy can be effectively leveraged to facilitate efficient inference in continuous sign language recognition (CSLR). We propose a novel adaptive model (AdaBrowse) to dynamically select a most informative subsequence from input video sequences by modelling this problem as a sequential decision task. In specific, we first utilize a lightweight network to quickly scan input videos to extract coarse features. Then these features are fed into a policy network to intelligently select a subsequence to process. The corresponding subsequence is finally inferred by a normal CSLR model for sentence prediction. As only a portion of frames are processed in this procedure, the total computations can be considerably saved. Besides temporal redundancy, we are also interested in whether the inherent spatial redundancy can be seamlessly integrated together to achieve further efficiency, i.e., dynamically selecting a lowest input resolution for each sample, whose model is referred to as AdaBrowse+. Extensive experimental results on four large-scale CSLR datasets, i.e., PHOENIX14, PHOENIX14-T, CSL-Daily and CSL, demonstrate the effectiveness of AdaBrowse and AdaBrowse+ by achieving comparable accuracy with state-of-the-art methods with 1.44$ imes$ throughput and 2.12$ imes$ fewer FLOPs. Comparisons with other commonly-used 2D CNNs and adaptive efficient methods verify the effectiveness of AdaBrowse. Code is available at \url{https://github.com/hulianyuyy/AdaBrowse}.

연구 동기 및 목표

  • 실시간 응용 프로그램에서 연속 수어 언어 인식(CSLR) 모델의 높은 계산 비용을 해결하기 위해.
  • 원시 수어 비디오 내 임베디드된 시간적 및 공간적 특징 중복을 활용하여 불필요한 계산을 줄이기 위해.
  • 각 비디오당 가장 정보가 풍부한 프레임과 해상도만을 지능적으로 선택하는 동적 추론 메커니즘을 개발하기 위해.
  • CSLR에서 정확도와 계산 효율성 간의 유리한 트레이드오프를 달성하기 위해.
  • 스트리밍 비디오 입력을 갖는 실세계 온라인 환경에서 CSLR 시스템의 실용적 구현을 가능하게 하기 위해.

제안 방법

  • 경량 글로벌 CNN이 입력 비디오에서 군집 특징을 추출하여 후속 결정을 안내한다.
  • Gumbel-Softmax로 훈련된 순환 정책 네트워크가 군집 특징을 기반으로 계산을 최소화하면서도 정확도를 유지할 수 있도록 프레임 서브시퀀스를 선택한다.
  • 이산적 프레임 선택의 미분 가능한 근사화를 통해 샘플링 과정을 역전파 가능하게 하여 정책 네트워크를 종합적으로 최적화한다.
  • 더 나은 효율성을 위해 AdaBrowse+로 확장하여, 동시에 프레임 서브시퀀스 선택과 입력 해상도 적응을 최적화한다.
  • 글로벌 및 로컬 네트워크의 특징을 정렬하기 위해 대비 정렬 손실($\mathcal{L}_{\text{Align}}$)을 도입하여 표현 품질을 향상시킨다.
  • 온라인 환경에 프레임워크를 구현하여 스트리밍 비디오 프레임을 처리하고 테스트 시점에 추론을 동적으로 적응시킨다.

실험 결과

연구 질문

  • RQ1수어 비디오의 시간적 중복성을 효과적으로 활용하여 정확도를 훼손하지 않고 추론 계산을 줄일 수 있는가?
  • RQ2비디오 복잡도 기반의 적응형 입력 해상도 선택이 CSLR에서 계산 효율성을 추가로 향상시킬 수 있는가?
  • RQ3효율적 추론을 위해 정보가 풍부한 비디오 서브시퀀스를 선택할 수 있는 미분 가능한 순차적 의사결정 메커니즘을 어떻게 설계할 수 있는가?
  • RQ4프레임 선택과 해상도 적응의 공동 최적화가 CSLR의 정확도-계산 트레이드오프에 얼마나 기여하는가?
  • RQ5제안된 적응형 추론 프레임워크는 실시간 스트리밍 온라인 환경에서 어떻게 성능을 발휘하는가?

주요 결과

  • AdaBrowse는 PHOENIX14, PHOENIX14-T, CSL-Daily, CSL을 포함한 네 개의 대규모 CSLR 데이터셋에서 최신 기술 수준의 정확도를 달성한다.
  • AdaBrowse는 최신 기술 수준의 방법 대비 FLOPs를 2.12배 줄이고 처리량을 1.44배 높이며 경쟁력 있는 WER를 유지한다.
  • CSL 데이터셋에서 AdaBrowse는 단지 254 GFLOPs의 비디오당 계산으로 0.8%의 WER를 기록하여 이전 방법들에 비해 정확도-계산 트레이드오프에서 뚜렷한 승리를 거두었다.
  • AdaBrowse+는 추가로 효율성을 향상시켜 비디오당 FLOPs를 171 GFLOPs로 줄였고, CSL 데이터셋에서 WER 0.7%를 달성했다.
  • 온라인 스트리밍 환경에서 AdaBrowse는 전체 컨볼루션 기반 기준 대비 처리량을 1.41배 높이고 FLOPs를 2.06배 줄였으며, 약간 더 높은 정확도를 기록했다.
  • 제거 실험을 통해 적응형 정책가 무작위 및 가우시안 샘플링보다 우월하며, 글로벌 특징 재사용이 정확도를 0.4–0.5% 향상시킨다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.