Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Common and Specific Features for RGB-D Semantic Segmentation with Deconvolutional Networks

Jinghua Wang, Zhenhua Wang|arXiv (Cornell University)|2016. 08. 03.
Advanced Neural Network Applications참고 문헌 30인용 수 12
한 줄 요약

이 논문은 RGB 및 깊이 입력에서 공통적이고 모ality별 특징을 명시적으로 학습하는 새로운 특징 변환 모듈을 갖춘 탈컨volution 네트워크를 제안한다. 특징 분포를 정렬하기 위해 최대 평균 차이(MK-MMD)를 활용하고 공통 특징을 교차 모달리티 간에 빌려쓰게 하여, NYU Depth V1 및 V2에서 최신 기준 성능을 달성하며, 이전 방법보다 평균 정확도에서 최대 7.4% 향상된다.

ABSTRACT

In this paper, we tackle the problem of RGB-D semantic segmentation of indoor images. We take advantage of deconvolutional networks which can predict pixel-wise class labels, and develop a new structure for deconvolution of multiple modalities. We propose a novel feature transformation network to bridge the convolutional networks and deconvolutional networks. In the feature transformation network, we correlate the two modalities by discovering common features between them, as well as characterize each modality by discovering modality specific features. With the common features, we not only closely correlate the two modalities, but also allow them to borrow features from each other to enhance the representation of shared information. With specific features, we capture the visual patterns that are only visible in one modality. The proposed network achieves competitive segmentation accuracy on NYU depth dataset V1 and V2.

연구 동기 및 목표

  • 공통 및 모달리티별 특징을 모델링하여 RGB-D 세그멘테이션 정확도를 향상시키기 위해.
  • 이전 방법들이 결정 수준에서만 특징을 융합하거나 浅층 연결을 사용하는 한계를 해결하기 위해.
  • 공통 특징을 통해 교차 모달리티 간 특징 빌리기 기능을 가능하게 하여 정확도 및 표현력 향상.
  • 분포 수준의 유사도를 기반으로 공통 및 특수 특징을 분리하는 특징 변환 네트워크 개발.
  • 기존 최신 기준 방법들과 비교해 표준 RGB-D 벤치마크에서 뛰어난 성능을 입증하기 위해.

제안 방법

  • RGB 및 깊이 모달리티 각각에 대해 별도의 컨볼루션 및 탈컨볼루션 네트워크를 갖춘 이중 브랜치 네트워크 아키텍처.
  • 상위 레이어의 컨볼루션 특징을 공통 특징(모두가 공유)과 모달리티별 특징(각각 고유)으로 분해하는 특징 변환 네트워크.
  • 특징 분포 간 유사도를 측정하고 최적화하기 위해 최대 커널 평균 차이(MK-MMD)를 사용하여 유클리드 거리의 대체로 더 뛰어난 정확도 확보.
  • 각 모달리티의 탈컨볼루션 네트워크가 자신만의 특징뿐만 아니라 다른 모달리티의 공통 특징까지 입력받아 교차 모달리티 특징 보완 기능 수행.
  • 선형 조합을 통한 결정 스코어 융합으로, 대칭적 특징 빌리기 기능을 통해 정확도 향상.
  • 표준 역전파를 사용한 엔드 투 엔드 훈련 및 모든 구성 요소의 공동 최적화.

실험 결과

연구 질문

  • RQ1공통 및 모달리티별 특징을 명시적으로 모델링하면 RGB-D 세그멘테이션 성능 향상이 가능한가?
  • RQ2결정 수준이 아닌 특징 수준에서 특징 상관관계를 학습하면 세그멘테이션 정확도가 향상되는가?
  • RQ3공통 특징을 교차 모달리티 간에 빌려쓰는 방식이 저자료 환경에서의 정확도 및 표현력 향상에 기여하는가?
  • RQ4MK-MMD는 다중 모달 세그멘테이션에서 공통 특징 분포를 학습하는 데 있어 유클리드 거리보다 더 효과적인가?
  • RQ5제안된 방법은 표준 RGB-D 벤치마크에서 기존 최신 기준 방법들과 비교해 어떻게 성능을 냈는가?

주요 결과

  • 13개 클래스 분류 작업에서 제안된 방법은 NYU Depth V2 데이터셋에서 평균 클래스 정확도 52.7%를 달성하여 이전 SOTA 방법(Wang et al., 2018)보다 10.5%포인트 향상.
  • 40개 클래스 분류 작업에서는 평균 정확도 47.3%를 기록하여 이전 최고 성능 기록(U-DN)을 5.6%포인트 초월.
  • NYU Depth V2에서 기준 모델(B-DN, 두 개의 독립적 탈컨볼루션 네트워크)보다 5.1%포인트 향상되어 특징 수준 융합의 유용성을 입증.
  • NYU Depth V1에서 MK-MMD를 사용한 특징 정렬은 유클리드 거리 기반 기준(Baseline E-DN) 대비 7.4%포인트 향상되어 분포 차이를 다루는 데서의 우수성 입증.
  • 스코어 융합의 선형 조합 파라미터에 대해 더 뛰어난 안정성을 보였으며, 이는 공통 특징 빌리기 기능 덕분에 두 모달리티의 탈컨볼루션 출력이 유사해졌기 때문이다.
  • 제거 실험 결과, 모달리티별 특징이 매우 중요함을 확인하였으며, 이를 억제하면 특히 무늬가 풍부하거나 깊이 정보가 모호한 영역에서 성능 저하가 심각하게 발생함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.