Skip to main content
QUICK REVIEW

[논문 리뷰] Anisotropic Convolutional Networks for 3D Semantic Scene Completion

Jie Li, Kai Han|arXiv (Cornell University)|2020. 04. 05.
Advanced Vision and Imaging참고 문헌 24인용 수 14
한 줄 요약

이 논문은 3D 세분화 장면 완성에 대해 비등방성 컨볼루션 네트워크(AIC-Net)를 제안하며, 3D 컨볼루션을 학습 가능한 커널 크기 조합을 가진 세 개의 1D 컨볼루션으로 분해함으로써 비어 있는 볼록체 별 수용 영역을 적응적으로 학습하는 새로운 비등방성 컨볼루션 모듈을 도입한다. 이 방법은 표준 3D 컨볼루션에 비해 정확도와 파라미터 효율성이 향상되어 NYU-Depth-v2 및 NYUCAD 벤치마크에서 최신 기술 성능(SOTA)을 달성한다.

ABSTRACT

As a voxel-wise labeling task, semantic scene completion (SSC) tries to simultaneously infer the occupancy and semantic labels for a scene from a single depth and/or RGB image. The key challenge for SSC is how to effectively take advantage of the 3D context to model various objects or stuffs with severe variations in shapes, layouts and visibility. To handle such variations, we propose a novel module called anisotropic convolution, which properties with flexibility and power impossible for the competing methods such as standard 3D convolution and some of its variations. In contrast to the standard 3D convolution that is limited to a fixed 3D receptive field, our module is capable of modeling the dimensional anisotropy voxel-wisely. The basic idea is to enable anisotropic 3D receptive field by decomposing a 3D convolution into three consecutive 1D convolutions, and the kernel size for each such 1D convolution is adaptively determined on the fly. By stacking multiple such anisotropic convolution modules, the voxel-wise modeling capability can be further enhanced while maintaining a controllable amount of model parameters. Extensive experiments on two SSC benchmarks, NYU-Depth-v2 and NYUCAD, show the superior performance of the proposed method. Our code is available at https://waterljwant.github.io/SSC/

연구 동기 및 목표

  • 객체 형상, 레이아웃, 가시성의 심한 변동성이 있는 3D 장면의 맥락을 모델링하는 데 도전하는 것.
  • 다양한 공간적 구조를 포착하는 데 한계가 있는 고정된 수용 영역을 가진 3D 컨볼루션의 문제를 해결하는 것.
  • 표준 3D 컨볼루션의 파라미터 효율적이고 유연한 대체 방법을 개발하는 것.
  • 기존 3D CNN 아키텍처에 쉽게 통합할 수 있도록 플러그 앤 플레이 방식으로 통합하는 것.
  • 계산 비용을 줄이며도 더 뛰어난 성능을 내는 3D 세분화 장면 완성 벤치마크를 달성하는 것.

제안 방법

  • 3D 컨볼루션을 x, y, z 축을 따라 연속적으로 적용하는 세 개의 1D 컨볼루션으로 분해하는 비등방성 컨볼루션(AIC) 모듈을 제안한다.
  • 각 1D 컨볼루션은 후보 커널 크기 집합(예: {3,5,7})을 사용하며, 볼록체 별로 학습 가능한 융합 가중치를 통해 적응적이고 비등방성 수용 영역을 형성한다.
  • 커널 크기 선택은 볼록체 별로 수행되어 국소적 장면 기하학 및 의미에 기반한 동적 맥락 모델링을 가능하게 한다.
  • 파라미터 효율성을 유지하기 위해 채널 차원을 감소시킨 브로드밴드 구조를 사용한다.
  • AIC-Net 아키텍처는 다수의 AIC 모듈을 스택하고 2D 특징 추출과 3D 특징 투영을 통합하여 엔드 투 엔드 학습을 가능하게 한다.
  • 특징 무결성을 유지하고 깊은 감독을 가능하게 하기 위해 포인트와이즈 컨볼루션과 스킵 연결을 사용한다.

실험 결과

연구 질문

  • RQ1높은 객체 변동성이 있는 환경에서 적응적이고 볼록체 별 수용 영역이 3D 세분화 장면 완성에 성능 향상에 기여하는가?
  • RQ2비등방성 컨볼루션은 복잡한 3D 장면 구조를 모델링하는 데 표준 3D 컨볼루션보다 나은가?
  • RQ3비등방성 컨볼루션은 성능을 유지하거나 향상시키면서도 모델 파라미터와 연산량을 얼마나 줄일 수 있는가?
  • RQ4AIC 모듈은 기존 네트워크의 표준 3D 컨볼루션 모듈로 효과적으로 대체될 수 있는가?
  • RQ5제안된 방법은 다양한 3D 장면 완성 벤치마크에 대해 일반화 가능한가?

주요 결과

  • AIC-Net은 NYU-Depth-v2 및 NYUCAD 벤치마크에서 모두 최신 기술 성능(SOTA)을 달성하며, SSCNet 및 DDRNet과 같은 기존 방법들을 능가한다.
  • NYU-Depth-v2에서 평균 교차율(mIoU)은 64.7%를 기록하여 이전 SOTA보다 유의미하게 높다.
  • NYUCAD에서는 mIoU가 62.1%에 도달하여 다양한 레이아웃을 가진 데이터셋 간의 강력한 일반화 능력을 보여준다.
  • 표준 3D 컨볼루션에 비해 AIC 모듈은 파라미터 수와 FLOPs를 줄였지만 정확도를 유지하거나 향상시켰다.
  • 정성적 결과에서는 AIC-Net이 더 덜 혼잡하고 정확도가 높은 3D 세분화 예측을 생성하며, 더 나은 형태와 카테고리 일관성을 보였다.
  • 절단 분석 결과는 적응적 커널 크기 선택과 1D 분해가 복잡한 3D 구조를 모델링하는 데 성공의 핵심 요소임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.