[논문 리뷰] AugUndo: Scaling Up Augmentations for Monocular Depth Completion and Estimation
이 논문은 비지도 학습 단일 카메라 깊이 보완에 대해 광학적 및 기하학적 데이터 증강을 광범위하게 가능하게 하는 새로운 프레임워크인 AugUndo를 제안한다. 이는 출력 공간에서 기하학적 변환을 '취소'함으로써 이루어지며, 재구성 손실을 계산하기 전에 예측된 깊이 맵을 원래 좌표 프레임으로 다시 변형시킨다. 이로 인해 증강으로 인한 아티팩트가 제거되고 감독 신호의 품질이 유지되어, 기존 방법에 적용했을 때 실내(VOID) 및 실외(KITTI) 벤치마크에서 평균 11.75%의 성능 향상이 이루어진다.
Unsupervised depth completion and estimation methods are trained by minimizing reconstruction error. Block artifacts from resampling, intensity saturation, and occlusions are amongst the many undesirable by-products of common data augmentation schemes that affect image reconstruction quality, and thus the training signal. Hence, typical augmentations on images viewed as essential to training pipelines in other vision tasks have seen limited use beyond small image intensity changes and flipping. The sparse depth modality in depth completion have seen even less use as intensity transformations alter the scale of the 3D scene, and geometric transformations may decimate the sparse points during resampling. We propose a method that unlocks a wide range of previously-infeasible geometric augmentations for unsupervised depth completion and estimation. This is achieved by reversing, or ``undo''-ing, geometric transformations to the coordinates of the output depth, warping the depth map back to the original reference frame. This enables computing the reconstruction losses using the original images and sparse depth maps, eliminating the pitfalls of naive loss computation on the augmented inputs and allowing us to scale up augmentations to boost performance. We demonstrate our method on indoor (VOID) and outdoor (KITTI) datasets, where we consistently improve upon recent methods across both datasets as well as generalization to four other datasets. Code available at: https://github.com/alexklwong/augundo.
연구 동기 및 목표
- 광학적 및 기하학적 변환으로 인한 재구성 아티팩트로 인해 비지도 학습 깊이 보완에서 데이터 증강이 제한되는 문제를 해결하기 위해.
- 표준 증강에서 유도되는 리샘플링, 강도 포화, 가림 현상으로 인해 감독 신호가 열화되는 문제를 극복하기 위해.
- 모델 예측을 원본 입력 좌표와 정렬하기 위해 역변환을 통해 이전에 실현 불가능했던 다양한 기하학적 증강을 가능하게 하기 위해.
- 학습 중 다양한 혼란 요소 변형을 노출시킴으로써 모델의 일반화 능력과 강건성을 향상시키기 위해.
- 구조적 변경 없이도 기존 깊이 보완 모델을 향상시킬 수 있는 즉시 사용 가능한 솔루션을 제공하기 위해.
제안 방법
- 학습 중에 입력 이미지와 희소 깊이 맵에 광학적 및 기하학적 증강(예: 밝기, 대비, 회전, 뒤집기, 크기 조정 등)을 적용한다.
- 증강된 입력에서 발생하는 아티팩트를 방지하기 위해 원본의 증강되지 않은 이미지와 희소 깊이 맵을 사용하여 재구성 손실을 계산한다.
- 증강된 입력에서 예측된 깊이 맵을 적용된 기하학적 변환의 역변환을 사용하여 원래 좌표 프레임으로 다시 변형시킨다.
- 이러한 변형은 모델의 출력이 진짜 감독 타깃과 정렬되도록 보장하여, 증강에도 불구하고 정확한 손실 계산이 가능하게 한다.
- 그룹 기반 변환(예: 회전, 이동)과 비군 변환(예: 가림)을 모두 지원하며, 11종의 증강 유형 조합에 대한 분석을 수행한다.
- 기존의 비지도 학습 깊이 보완 모델과 호환되며, 학습 비용을 거의 증가시키지 않는다.
실험 결과
연구 질문
- RQ1기하학적 데이터 증강이 기존에 깊이 보완에서 감독 품질을 떨어뜨리지만, 모델 출력을 역변환을 통해 보정하면 안전하게 적용할 수 있는가?
- RQ2광학적 및 기하학적 증강을 얼마나 확장할 수 있을지, 비지도 학습 깊이 보완 성능 향상에 기여하는가?
- RQ3제안된 '취소' 메커니즘이 모델의 새로운 환경에 대한 일반화 능력을 유지하거나 향상시키는가?
- RQ4다양한 데이터셋에서 다양한 증강 조합이 모델 성능에 미치는 영향은 어떠한가?
- RQ5이 방법은 기존 깊이 보완 모델에 대해 최소한의 아키텍처나 학습 오버헤드로 적용 가능한가?
주요 결과
- AugUndo는 VOID 데이터셋에서 평가된 모든 모델(Monodepth2, HR-Depth, Lite-Mono)의 성능을 향상시켰으며, 실내 및 실외 벤치마크에서 평균 11.75%의 성능 향상이 이루어졌다.
- VOID에서 가장 도전적인 지표인 δ<1.25는 Monodepth2의 경우 0.717에서 0.724로, HR-Depth는 0.714에서 0.718로, Lite-Mono는 0.669에서 0.674로 향상되었다.
- VOID에서 Abs Rel 지표의 경우, Monodepth2는 0.183에서 0.178로, HR-Depth는 0.185에서 0.181로, Lite-Mono는 0.209에서 0.200으로 개선되었다.
- NYUv2와 ScanNet에 대한 제로샷 일반화 결과에서도 일관된 향상이 관찰되었으며, Monodepth2의 RMSE는 NYUv2에서 0.556에서 0.537로, ScanNet에서는 0.368에서 0.351로 감소했다.
- KITTI에서 AugUndo는 Monodepth2의 δ<1.25를 0.869에서 0.879로, HR-Depth는 0.879에서 0.883로, Lite-Mono는 0.862에서 0.863으로 향상시켰다.
- 이 방법은 PackNet을 초월한 HR-Depth의 향상과 HR-Depth를 초월한 Lite-Mono의 향상과 유사한 성능 향상을 달성했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.