Skip to main content
QUICK REVIEW

[논문 리뷰] Fine Hand Segmentation using Convolutional Neural Networks

Tadej Vodopivec, Vincent Lepetit|arXiv (Cornell University)|2016. 08. 26.
Video Surveillance and Tracking Methods참고 문헌 15인용 수 11
한 줄 요약

이 논문은 풀링 및 업샘플링을 피하기 위해 다중 해상도 특징을 완전히 연결된 계층을 통해 세그멘테이션 마스크로 직접 매핑하는 두 단계의 컨volution 신경망을 사용하는 실시간 고정확도 手 분할 방법을 제안한다. 이 방법은 1장당 39ms에 99.3%의 정확도를 달성하며, 표준 U-Net 기반 아키텍처와 색상 기반 방법을 능가하며, 반복적 개선을 통해 가장자리 정밀도를 향상시키고 잡음 신호를 감소시킨다.

ABSTRACT

We propose a method for extracting very accurate masks of hands in egocentric views. Our method is based on a novel Deep Learning architecture: In contrast with current Deep Learning methods, we do not use upscaling layers applied to a low-dimensional representation of the input image. Instead, we extract features with convolutional layers and map them directly to a segmentation mask with a fully connected layer. We show that this approach, when applied in a multi-scale fashion, is both accurate and efficient enough for real-time. We demonstrate it on a new dataset made of images captured in various environments, from the outdoors to offices.

연구 동기 및 목표

  • 에고센트리 증강 현실 응용 분야에서 정확하고 실시간으로 手를 분할하는 문제를 해결하기 위해.
  • 복잡한 조명 조건, 가림, 유사한 피부 톤 배경에서 실패하기 쉬운 풀링, 업샘플링 또는 색상 기반 단서에 의존하는 기존 방법의 한계를 극복하기 위해.
  • 특징 맵의 업스케일링을 피하고 두 단계의 네트워크를 통해 맥락 인식 개선을 통해 정확도와 가장자리 선명도를 향상시키기 위해.
  • 새로 수집한 데이터셋을 사용하여 실내 및 실외 환경을 포함한 다양한 환경에서 뛰어난 성능을 입증하기 위해.

제안 방법

  • 입력 이미지를 원본, 1/2, 1/4 해상도에서 병렬로 처리하는 세 개의 컨volution 체인을 사용하여 풀링 레이어 없이 다중 해상도 특징을 추출한다.
  • 모든 해상도의 특징을 연결하여 완전히 연결된 레이어에 입력하여 픽셀 단위의 세그멘테이션 마스크를 생성함으로써, U-Net 기반 아키텍처에서 흔히 발생하는 과도한 부드러움을 방지한다.
  • 네트워크는 두 단계로 나뉘며, 첫 번째 단계는 1/16 해상도 이미지에서 거친 세그멘테이션을 수행하고, 두 번째 단계는 원본 이미지와 거친 예측 결과를 모두 사용하여 결과를 보정한다.
  • 두 번째 단계는 작은 효율적인 네트워크를 사용하여 잘못된 양성 결과를 수정하고 가장자리 정렬을 향상시키며, 고수준 맥락과 저수준 세부 정보를 모두 활용한다.
  • 정확도와 추론 속도를 최적화하기 위해 메타파rameter를 광범위한 학습(98개 및 95개 네트워크)을 통해 조정하였으며, 초기 레이어에서 더 큰 필터와 더 많은 특징 맵을 사용할수록 더 좋은 성능을 기록하였다.
  • 자동 맥락(Auto-Context)에 영감을 받았지만, 초기 세그멘테이션을 다운샘플된 이미지에서 수행하고 두 번째 단계에서 원본 이미지를 입력으로 사용하여 세부 정보 복구를 수행한다는 점에서 다릅니다.

실험 결과

연구 질문

  • RQ1풀링 및 업샘플링 레이어를 피하는 딥 러닝 아키텍처가 표준 U-Net 기반 네트워크보다 더 높은 세그멘테이션 정확도를 달성할 수 있는가?
  • RQ2풀링 없이 다중 해상도에서 입력을 처리하면 손의 경계 정확도가 향상되고 잡음 신호가 감소하는가?
  • RQ3거친 맥락과 세부 정보 처리를 조합한 두 단계 네트워크가 고정확도와 실시간 성능을 동시에 달성할 수 있는가?
  • RQ4두 번째 단계에서 원본 이미지를 포함할 경우, 거친 예측 결과만 사용하는 경우와 비교해 정확도와 가장자리 품질에 어떤 영향을 미치는가?
  • RQ5복잡한 실제 환경에서 전통적인 색상 기반 분할 방법에 비해 제안된 방법이 얼마나 뛰어난가?

주요 결과

  • 제안된 방법은 1장당 39ms에 99.3%의 세그멘테이션 정확도를 달성하였으며, 표준 U-Net 기반 네트워크는 185ms에 94.0%의 정확도에 머물렀다.
  • 두 단계 아키텍처는 첫 번째 단계 전용 모델(98.3% 정확도이지만 가장자리가 더 흐릿함)에 비해 잘못된 양성 결과를 줄이고 가장자리의 매끄러움을 향상시켰다.
  • 두 번째 단계에서 원본 이미지를 제거하고 거친 예측 결과만 사용할 경우 정확도는 98.6%로 떨어지고 약간의 속도 향상(36.7ms)을 보였으며, 이는 원본 이미지가 정확도에 결정적인 역할을 한다는 것을 시사한다.
  • 이 방법은 실외 및 사무실 환경을 포함한 다양한 환경에서 뛰어난 강인성을 보였으며, 정성적 비교에서 일반적으로 1픽셀 이내의 오차로 매우 낮은 오류를 기록하였다.
  • 동일한 데이터셋에서 색상 기반 분할 방법은 오직 81%의 정확도를 기록하여, 다중 해상도 특징 학습을 통한 딥 러닝 접근법의 우수성을 확인하였다.
  • 더 큰 필터 크기와 초기 레이어에서 더 많은 특징 맵을 사용할 경우 최고의 성능를 기록하였으며, 이는 초기 레이어가 넓은 공간 맥락을 포착하는 데 유리하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.