Skip to main content
QUICK REVIEW

[논문 리뷰] Beyond One Glance: Gated Recurrent Architecture for Hand Segmentation

Wei Wang, Kaicheng Yu|arXiv (Cornell University)|2018. 11. 27.
Hand Gesture Recognition Systems참고 문헌 26인용 수 4
한 줄 요약

이 논문은 U-Net 기반의 다중 인코더-디코더 레이어를 거쳐 손의 세그멘테이션 마스크와 네트워크의 내부 상태를 반복적으로 업데이트하는 게이팅된 순환 아키텍처를 제안한다. 이는 여러 손 세그멘테이션 벤치마크에서 최신 기술(SOTA)의 일회성 및 단순한 순환 방법을 능가하며, 도로 세그멘테이션으로의 일반화 능력도 효과적으로 보여주며, 더 적은 파라미터로도 뛰어난 정확도를 달성한다.

ABSTRACT

As mixed reality is gaining increased momentum, the development of effective and efficient solutions to egocentric hand segmentation is becoming critical. Traditional segmentation techniques typically follow a one-shot approach, where the image is passed forward only once through a model that produces a segmentation mask. This strategy, however, does not reflect the perception of humans, who continuously refine their representation of the world. In this paper, we therefore introduce a novel gated recurrent architecture. It goes beyond both iteratively passing the predicted segmentation mask through the network and adding a standard recurrent unit to it. Instead, it incorporates multiple encoder-decoder layers of the segmentation network, so as to keep track of its internal state in the refinement process. As evidenced by our results on standard hand segmentation benchmarks and on our own dataset, our approach outperforms these other, simpler recurrent segmentation techniques, as well as the state-of-the-art hand segmentation one. Furthermore, we demonstrate the generality of our approach by applying it to road segmentation, where it also outperforms other baseline methods.

연구 동기 및 목표

  • 에고센트릭 손 분석에서 일회성 세그멘테이션의 한계를 보완하기 위해 인간의 인지 방식을 모방하여 반복적인 정밀 조정을 통해 성능을 향상시키는 것.
  • 다중 정밀 조정 단계 동안 네트워크의 내부 상태를 유지하고 업데이트하여 세그멘테이션 정확도를 향상시키는 것.
  • 손 세그멘테이션을 넘어서도 적용 가능한 일반적인 순환 아키텍처를 개발하여 다른 의미 세그멘테이션 작업으로의 일반화 능력을 입증하는 것.
  • 미래 연구를 지원하기 위해 대규모 공개 손 세그멘테이션 데이터셋(12.5K장의 이미지)을 구축하는 것.

제안 방법

  • U-Net의 다중 인코더-디코더 레이어를 통해 작동하는 새로운 게이팅된 순환 유닛(GRU)을 제안하여, 단일 은닉 레이어를 초월해 내부 상태 업데이트를 가능하게 한다.
  • 두 가지 변형을 도입: Ours-DRU(Dense Recurrent Unit)와 Ours-SRU(Simple Recurrent Unit), 모두 각 정밀 조정 단계에서 세그멘테이션 마스크를 입력으로 사용한다.
  • 고수준 특징을 네트워크의 내부 레이어를 통해 전파하는 순환 메커니즘을 적용하여 더 깊은 맥락적 정밀 조정을 가능하게 한다.
  • 이미지와 이전 마스크를 반복적으로 처리하면서 각 단계에서 내부 상태를 업데이트하는 다단계 정밀 조정 프로세스를 구현한다.
  • 매사추세츠 도로 데이터셋을 사용해 도로 세그멘테이션에 동일한 아키텍처를 적용하여 일반화 능력을 검증한다.
  • ImageNet으로의 사전 훈련 없이 끝내기에서 훈련을 수행하여 대규모 사전 훈련된 백본을 사용하는 방법들과의 비교를 가능하게 한다.

실험 결과

연구 질문

  • RQ1세그멘테이션 마스크와 네트워크의 내부 상태를 모두 반복적으로 정밀 조정하는 순환 아키텍처가 일회성 방법을 뛰어넘는 손 세그멘테이션 성능 향상에 기여하는가?
  • RQ2표준 RNN이나 마스크 전용 순환 구조와 비교해, 다중 인코더-디코더 레이어를 걸쳐 순환을 구현하는 방식은 정밀 조정 성능에 어떤 영향을 미치는가?
  • RQ3제안된 아키텍처가 손 세그멘테이션 외의 의미 세그멘테이션 작업으로도 일반화 가능한가?
  • RQ4기존의 최신 기술(SOTA) 모델보다 파라미터 수를 줄여도 최신 기술 성능을 달성할 수 있는가?

주요 결과

  • Ego-Youtube-Hands(EYTH) 데이터셋에서 제안된 Ours-DRU(4) 모델은 평균 교차율(mIOU) 0.8355를 기록하여 이전의 SOTA인 RefineNet을 능가한다.
  • HandOverFace(HOF) 데이터셋에서 모델은 작은 학습 데이터셋(198장)에도 불구하고 두 번째로 높은 성능을 기록하며 mIOU 0.784를 달성한다.
  • 매사추세츠 도로 데이터셋에서의 도로 세그멘테이션 작업에서 Ours-DRU(4)는 mIOU 0.560과 P/R 스코어 0.757을 기록하여, 더 큰 VGG19 기반 U-Net과 토폴로지 인식 손실을 사용한 방법을 포함한 베이스라인들을 능가한다.
  • 유사한 SOTA 모델 대비 뿌리 파라미터 수의 약 8배만 사용함으로써 뛰어난 파라미터 효율성을 보이며 뛰어난 성능을 달성한다.
  • 시각적 비교 결과, 미세한 손가락 분리나 가림 영역 등 도전적인 경우에서 모델이 실제 마스크보다 더 정확한 예측을 생성하는 것으로 나타났다.
  • 제거 실험 결과, 입력에서 세그멘테이션 마스크를 제거하면 EYTH에서 mIOU가 0.8355에서 0.8256으로 감소하지만, 여전히 Rec-Middle(0.814)를 능가하므로 마스크 피드백의 중요성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.