Skip to main content
QUICK REVIEW

[논문 리뷰] FADNet++: Real-Time and Accurate Disparity Estimation with Configurable Networks

Qiang Wang, Shaohuai Shi|arXiv (Cornell University)|2021. 10. 06.
Advanced Vision and Imaging참고 문헌 48인용 수 4
한 줄 요약

FADNet++는 다양한 하드웨어에서 100ms 이내의 추론 속도를 유지하면서 최신 기술 수준의 정확도를 달성하기 위해 효율적인 2D 컨볼루션과 포인트와일드 상관관계 레이어, 잔차 학습을 조합한 구성 가능한 실시간 딥 뉴럴 네트워크이다. 이는 모바일 및 서버 GPU에 배포하기 위해 정확도와 속도를 조절할 수 있는 모델 변종(FADNet-T에서 FADNet++)을 생성할 수 있도록 한다.

ABSTRACT

Deep neural networks (DNNs) have achieved great success in the area of computer vision. The disparity estimation problem tends to be addressed by DNNs which achieve much better prediction accuracy than traditional hand-crafted feature-based methods. However, the existing DNNs hardly serve both efficient computation and rich expression capability, which makes them difficult for deployment in real-time and high-quality applications, especially on mobile devices. To this end, we propose an efficient, accurate, and configurable deep network for disparity estimation named FADNet++. Leveraging several liberal network design and training techniques, FADNet++ can boost its accuracy with a fast model inference speed for real-time applications. Besides, it enables users to easily configure different sizes of models for balancing accuracy and inference efficiency. We conduct extensive experiments to demonstrate the effectiveness of FADNet++ on both synthetic and realistic datasets among six GPU devices varying from server to mobile platforms. Experimental results show that FADNet++ and its variants achieve state-of-the-art prediction accuracy, and run at a significant order of magnitude faster speed than existing 3D models. With the constraint of running at above 15 frames per second (FPS) on a mobile GPU, FADNet++ achieves a new state-of-the-art result for the SceneFlow dataset.

연구 동기 및 목표

  • 실시간 응용 프로그램을 위한 딥 러닝 기반 스테레오 매칭에서 추론 속도와 정확도 사이의 상충 관계를 해결한다.
  • 모바일 배포에 적합하지 않은 너무 느리고 메모리 소비가 큰 기존 3D 컨볼루션 기반 모델(CVM-Conv3D)의 한계를 극복한다.
  • 다양한 하드웨어 플랫폼에서 모델 크기, 정확도, 추론 속도를 균형 잡을 수 있는 유연하고 구성 가능한 네트워크 아키텍처를 설계한다.
  • 합성(Synthetic, SceneFlow) 및 실제 세계 데이터셋에서 모두 최신 기술 수준의 성능을 달성하면서 저지연 및 낮은 메모리 사용을 유지한다.
  • 메모리 집약적인 3D 컨볼루션을 피하고 구성 가능한 채널 스케일링을 활용한 최적화된 2D 기반 설계를 통해 모바일 장치에서의 효율적 배포를 가능하게 한다.

제안 방법

  • 3D 컨볼루션을 포인트와일드 상관관계 레이어로 대체하여 계산 비용을 감소시킨 새로운 2D 컨볼루션 기반 네트워크 아키텍처(FADNet++)를 제안한다.
  • 잔차 블록과 다중 척도 잔차 학습을 통합하여 추론 지연 시간을 늘리지 않으면서도 특징 표현과 모델 정확도를 향상시킨다.
  • 다양한 파라미터 수와 추론 속도를 갖는 모델 변종(FADNet-T, FADNet-S, FADNet-M, FADNet++)을 생성하기 위해 구성 가능한 채널 스케일링 비율을 도입한다.
  • 모든 변종을 통합적이고 확장 가능한 훈련 전략을 사용해 훈련함으로써 모든 구성에서 정확도를 향상시킨다.
  • 효율적인 2D 연산과 최적화된 레이어 구현(cuDNN 등)을 활용하여 서버 및 모바일 GPU에서 빠른 추론을 보장한다.
  • 3D 컨볼루션의 계산 부담 없이 포인트와일드 상관관계를 통한 비용 볼륨 유사 표현을 사용해 이미지 간 특징 관계를 포착한다.

실험 결과

연구 질문

  • RQ12D 컨볼루션 기반 네트워크는 서버 및 모바일 GPU에서 실시간 추론 속도를 유지하면서도 최신 기술 수준의 디스파리티 추정 정확도를 달성할 수 있는가?
  • RQ2제안된 구성 가능한 채널 스케일링 전략은 다양한 하드웨어 플랫폼에서 모델 정확도와 추론 속도를 균형 잡는 데 얼마나 효과적인가?
  • RQ3메모리 제약이 있는 모바일 장치에서 FADNet++ 프레임워크는 기존 3D 컨볼루션 기반 모델(CVM-Conv3D)보다 정확도와 속도 면에서 뛰어나게 성능을 낼 수 있는가?
  • RQ4포인트와일드 상관관계 레이어의 사용이 3D 컨볼루션 대비 계산 비용을 얼마나 줄이며, 특징 학습 능력을 유지하는가?
  • RQ5Jetson AGX와 같은 모바일 GPU에서 FADNet++가 100ms 이내의 추론 시간(즉, 15FPS 이상)을 확보하면서도 기존 실시간 방법에 비해 낮은 종단 간 오차(EPE)를 유지할 수 있는가?

주요 결과

  • SceneFlow 데이터셋에서 FADNet++는 RTX 2070에서 0.053초의 런타임으로 EPE 0.76을 기록하며, 속도 면에서 3D 기반 모델을 능가하면서도 경쟁 가능한 정확도를 유지를 한다.
  • 모바일 GPU(Jetson AGX)에서 FADNet++는 15FPS로 실행되며 EPE 0.258을 기록하여 AnyNet보다 거의 3배 더 높은 정확도를 확보하면서도 유사한 추론 속도를 유지한다.
  • FADNet-S는 TX2와 AGX GPU에서 각각 StereoNet 대비 4배와 5.9배 더 빠르게 작동하며, EPE 1.19 vs. 1.2로 유사한 정확도를 달성하여 뛰어난 효율성을 입증한다.
  • V100에서 FADNet++는 GPU 메모리 사용량이 2.3GB 뿐이어서 GANet와 같은 3D 모델(7.5GB)보다 훨씬 적게 소비하여, 3D 모델이 메모리 제약으로 인해 실패하는 모바일 플랫폼에서도 배포가 가능하다.
  • 구성 가능한 프레임워크 덕분에 사용자는 다양한 GPU에서 추론 속도 0.013초에서 0.053초 사이, EPE 0.76에서 1.83 사이를 달성하는 모델 변종(FADNet-T에서 FADNet++)을 선택할 수 있다.
  • Jetson AGX 모바일 GPU에서 FADNet-T는 15FPS로 0.043의 EPE를 기록하여 15FPS 제약 조건 하에서 실시간 디스파리티 추정 분야에서 새로운 최신 기술 수준을 수립한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.