Skip to main content
QUICK REVIEW

[논문 리뷰] FADNet: A Fast and Accurate Network for Disparity Estimation

Qiang Wang, Shaohuai Shi|arXiv (Cornell University)|2020. 03. 24.
Advanced Vision and Imaging참고 문헌 25인용 수 12
한 줄 요약

FADNet는 2D 상관층, 잔차 블록, 다중 척도 감독을 결합하여 3D 컨볼루션 기반 모델(예: PSMNet)보다 20배 빠르고 GPU 메모리 사용량을 10배 줄이며 최신 기술 수준의 정확도를 달성하는 빠르고 정확한 스테레오 디스파리티 추정을 위한 딥 러닝 프레임워크입니다. 성능을 희생시키지 않고 자원 제약이 있는 장치에서 실시간 배포가 가능합니다.

ABSTRACT

Deep neural networks (DNNs) have achieved great success in the area of computer vision. The disparity estimation problem tends to be addressed by DNNs which achieve much better prediction accuracy in stereo matching than traditional hand-crafted feature based methods. On one hand, however, the designed DNNs require significant memory and computation resources to accurately predict the disparity, especially for those 3D convolution based networks, which makes it difficult for deployment in real-time applications. On the other hand, existing computation-efficient networks lack expression capability in large-scale datasets so that they cannot make an accurate prediction in many scenarios. To this end, we propose an efficient and accurate deep network for disparity estimation named FADNet with three main features: 1) It exploits efficient 2D based correlation layers with stacked blocks to preserve fast computation; 2) It combines the residual structures to make the deeper model easier to learn; 3) It contains multi-scale predictions so as to exploit a multi-scale weight scheduling training technique to improve the accuracy. We conduct experiments to demonstrate the effectiveness of FADNet on two popular datasets, Scene Flow and KITTI 2015. Experimental results show that FADNet achieves state-of-the-art prediction accuracy, and runs at a significant order of magnitude faster speed than existing 3D models. The codes of FADNet are available at https://github.com/HKBU-HPML/FADNet.

연구 동기 및 목표

  • 딥 스테레오 매칭 네트워크에서 정확도와 추론 효율성 사이의 상충 관계를 해결하기 위해.
  • 어려운 시나리오(예: 무문자 또는 반복적인 영역)에서도 높은 정확도를 유지하면서 실시간 배포가 가능한 모델을 개발하기 위해.
  • 3D 컨볼루션 기반 네트워크(예: PSMNet, GANet)의 높은 메모리 및 계산 요구량을 희생 없이 극복하기 위해.
  • GPU 메모리 사용량과 추론 시간을 최소화하여 엣지 장치에서의 실용적 배포를 가능하게 하기 위해.

제안 방법

  • FADNet은 2D 기반 상관층을 다중으로 스택하여 빠른 계산을 유지하면서도 시야 간 특징 관계를 포착한다.
  • 학습 안정성 향상과 더 깊은 네트워크 아키텍처를 가능하게 하기 위해 잔차 블록을 통합한다.
  • 다중 척도 예측과 다중 척도 가중치 스케줄링 학습 기법을 사용하여 특징 표현과 수렴을 향상시킨다.
  • 3D 컨볼루션 대신 포인트와이즈 상관 연산을 활용하여 FLOPs와 메모리 소비를 크게 감소시킨다.
  • 3D 연산을 피하면서도 높은 정확도를 유지하기 위해 2D 컨볼루션 기반 인코더-디코더 아키텍처를 설계한다.
  • 일괄적인 다중 척도 감독을 통해 학습을 최적화하여 일반화 능력을 향상시키고 세부 사항에서의 오차를 감소시킨다.

실험 결과

연구 질문

  • RQ12D 기반 네트워크가 3D 기반 모델보다 뚜렷하게 빠른 추론 속도와 메모리 효율성을 확보하면서도 최신 기술 수준의 디스파리티 추정 정확도를 달성할 수 있는가?
  • RQ2가중치 스케줄링을 통한 다중 척도 감독은 2D 기반 디스파리티 추정 네트워크의 정확도 향상에 얼마나 효과적인가?
  • RQ3잔차 학습과 효율적인 상관층이 계산 비용 증가 없이 더 깊고 정확한 모델을 동시에 가능하게 할 수 있는가?
  • RQ42D 기반 네트워크가 PSMNet 및 GANet과 같은 3D 컨볼루션 기반 모델의 성능을 얼마나 잘 따라잡거나 초월할 수 있는가?
  • RQ5오직 2D 컨볼루션과 효율적인 설계만을 사용하여 저메모리 엣지 장치에 고정확도 디스파리티 추정 모델을 배포하는 것이 가능한가?

주요 결과

  • FADNet은 Scene Flow 데이터셋에서 최신 기술 수준의 정확도를 달성했으며, 종합 오차(EPE)는 0.464로 PSMNet(0.452)와 GANet(0.442)와 유사한 성능을 보였지만, NVIDIA Tesla V100 GPU에서 GANet보다 46배, PSMNet보다 8배 더 빠른 속도를 기록했다.
  • KITTI 2015 데이터셋에서 FADNet은 D1-all 이상치 비율 2.82%를 기록했으며, 메모리 효율성이 높아 DispNetC(4.34%)보다 2배 이상 정확도가 높았다.
  • FADNet은 Tesla V100 GPU에서 스테레오 쌍당 18.7ms 내에 실행되며, GPU 메모리 사용량은 1.62 GB 뿐이었고, 이는 PSMNet(13.99 GB)의 10분의 1이며 Titan X(Pascal) GPU에서도 FADNet은 3.87 GB를 사용했다.
  • 3D 기반 모델인 PSMNet와 GANet가 메모리 제약으로 실패하는 12GB 메모리가 있는 데스크톱 GPU(예: Titan X)에서도 FADNet을 배포할 수 있다.
  • 시각적 비교 결과 FADNet은 DispNetC보다 더 나은 세밀한 무늬와 세부 사항을 유지했으며, PSMNet와 거의 유사한 정확도를 보였고, 오차지도 역시 크게 낮았다.
  • FADNet의 추론 속도는 PSMNet보다 20배, GANet보다 46배 더 빠르며, 로봇 공학 및 자율 주행 분야의 실시간 응용에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.