Skip to main content
QUICK REVIEW

[논문 리뷰] Surface Normal Estimation of Tilted Images via Spatial Rectifier

Tien Do, Khiem Vuong|arXiv (Cornell University)|2020. 07. 17.
Advanced Vision and Imaging참고 문헌 41인용 수 4
한 줄 요약

이 논문은 기울어진 RGB 이미지를 표면 법선 추정 성능가운데 중력 방향으로 정렬된 훈련 데이터와 동일한 성능을 낼 수 있도록 하는 공간 정규화 네트워크를 제안한다. 합성 기울어진 이미지를 사용하여 정규화 네트워크와 법선 추정기의 공동 훈련을 통해, 일반화 성능을 향상시키기 위해 잘라낸 각도 손실을 도입함으로써, 기존 모델 대비 70% 감소한 FLOPS를 기록하면서도 ScanNet, NYUv2 및 기울기와 기울기 각도가 큰 새로운 Tilt-RGBD 데이터셋에서 최신 기술 수준의 정확도를 달성한다.

ABSTRACT

In this paper, we present a spatial rectifier to estimate surface normals of tilted images. Tilted images are of particular interest as more visual data are captured by arbitrarily oriented sensors such as body-/robot-mounted cameras. Existing approaches exhibit bounded performance on predicting surface normals because they were trained using gravity-aligned images. Our two main hypotheses are: (1) visual scene layout is indicative of the gravity direction; and (2) not all surfaces are equally represented by a learned estimator due to the structured distribution of the training data, thus, there exists a transformation for each tilted image that is more responsive to the learned estimator than others. We design a spatial rectifier that is learned to transform the surface normal distribution of a tilted image to the rectified one that matches the gravity-aligned training data distribution. Along with the spatial rectifier, we propose a novel truncated angular loss that offers a stronger gradient at smaller angular errors and robustness to outliers. The resulting estimator outperforms the state-of-the-art methods including data augmentation baselines not only on ScanNet and NYUv2 but also on a new dataset called Tilt-RGBD that includes considerable roll and pitch camera motion.

연구 동기 및 목표

  • 중력 방향으로 정렬된 훈련 데이터와의 도메인 차이로 인해 기울어진 이미지에서 테스트할 경우 표면 법선 추정 성능이 저하되는 문제를 해결하기 위해.
  • 기울어진 이미지의 표면 법선 분포를 우도 훈련 데이터의 분포와 일치시키는 전역 기하 변환(공간 정규화)을 학습하기 위해.
  • 평가 지표와 더 잘 맞는 손실 함수를 설계하여 수렴 성능와 강건성을 향상시키고, 작은 각도 오차에서의 성능 향상을 높이기 위해 잘라낸 각도 손실을 제안하기 위해.
  • 확장된 수신장과 함께 더 큰 모델을 구현할 수 있도록 덮개 컨볼루션을 활용한 새로운 네트워크 아키텍처를 통해 계산 비용을 줄이면서도 높은 정확도를 유지하기 위해.

제안 방법

  • 공간 정규화는 추정된 중력 방향과 기울어진 이미지의 주요 방향에 의해 매개변수화되며, 입력 이미지의 표면 법선 분포를 훈련 데이터의 분포와 일치시키는 호모지어피 유사 변환을 학습한다.
  • 정규화는 합성 데이터 생성을 통해 엔드 투 엔드로 훈련된다: 중력 방향과 주요 방향에 의해 유도된 일련의 호모지어피가 ScanNet 데이터셋에서 기울어진 이미지를 시뮬레이션하는 데 사용된다.
  • 잘라낸 각도 손실(TAL)이 도입되며, 이는 7.5° 이하의 작은 각도 오차에서 강력한 기울기를 제공하고 이상치에 대해 강건하여, L2 손실과 각도 평가 지표 간의 불일치를 해결한다.
  • 네트워크 아키텍처는 디레이티드 컨볼루션을 디코딩 레이어에 통합하여 FLOPS를 증가시키지 않고 수신장을 늘림으로써, 더 큰 모델(예: ResNeXt-101)을 더 낮은 계산 비용으로 가능하게 한다.
  • 방법은 ScanNet, NYUv2 및 기울기와 기울기 각도가 큰 새로운 Tilt-RGBD 데이터셋에서 평가되며, 다양한 카메라 방향에 대해 강건함을 입증한다.
  • 전체 파이프라인은 공동으로 훈련된다: 공간 정규화와 법선 추정기가 합성 기울어진 이미지를 사용하여 함께 최적화되며, 도메인 불변 특징 학습이 가능해진다.

실험 결과

연구 질문

  • RQ1학습된 공간 변환은 기울어진 테스트 이미지와 중력 방향으로 정렬된 훈련 데이터 간의 도메인 갭을 효과적으로 줄일 수 있는가?
  • RQ2작은 각도 오차를 강조하는 잘라낸 각도 손실은 모델의 일반화 성능과 표준 평가 지표에서의 성능 향상에 기여하는가?
  • RQ3디코딩 경로에 있는 디레이티드 컨볼루션은 FLOPS나 메모리 소비를 증가시키지 않으면서도 수신장을 늘리고 모델 표현력을 향상시킬 수 있는가?
  • RQ4높은 카메라 기울기(예: Tilt-RGBD)를 포함한 데이터셋에서 제안된 방법은 최신 기술 수준의 접근법, 특히 데이터 증강 기반 베이스라인과 비교해 어떻게 성능을 냅니다?
  • RQ5공간 정규화는 기울기 각도에 대한 명시적 지도 없이도 다양한 카메라 방향, 특히 큰 롤 및 피치 각도에서 일반화 가능한가?

주요 결과

  • 제안된 방법은 ScanNet과 NYUv2에서 최신 기술 수준의 성능을 달성하였으며, 평균 각도 오차는 각각 15.0°와 16.2°로, FrameNet과 VPLNet을 능가한다.
  • 큰 롤과 피치 각도를 가진 새로운 Tilt-RGBD 데이터셋에서, ScanNet에서는 11.25° 및 22.5° 임계값에서 각각 80.0%와 85.2%의 정확도를 기록하였고, NYUv2에서는 22.5° 임계값에서 77.1%의 정확도를 달성하여 기울기 영향에 강건함을 입증한다.
  • 잘라낸 각도 손실(TAL)은 좁은 임계값(예: 5° 및 7.5°)에서 성능 향상을 이끌어내었으며, NYUv2에서 각각 7.5° 이내 오차를 가진 픽셀 비율이 50.2%와 34.2%에 이르렀고, L2 및 각도 손실보다 뛰어난 성능을 보였다.
  • ResNeXt-101 백본을 사용한 DFPN+TAL+SR 모델은 DORN 대비 FLOPS를 70% 감소시켰으며, GTX 1660에서 30 FPS의 추론 속도를 기록하면서도 높은 정확도를 유지했다.
  • 공간 정규화 네트워크는 표면 법선 분포가 덜 표현된 영역(예: 그림 1의 d, e, f)을 더 잘 표현된 영역(d', e', f')로 변환함으로써, 기울어진 이미지에서의 추정 오차를 줄였고, 예측 품질을 크게 향상시켰다.
  • 모든 지표에서 데이터 증강 기반 베이스라인 및 최신 기술 수준의 모델을 능가하였으며, ScanNet과 NYUv2에서 각각 30° 임계값에서 69.3%와 83.9%의 정확도를 기록했고, FLOPS와 메모리 사용량도 낮게 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.