Skip to main content
QUICK REVIEW

[논문 리뷰] Depth Estimation with Simplified Transformer

John Yang, Le An|arXiv (Cornell University)|2022. 04. 28.
CCD and CMOS Imaging Sensors인용 수 11
한 줄 요약

이 논문은 자기지도 학습 기반 단안 영상 깊이 추정을 위한 경량이며 하드웨어 친화적인 비전 트랜스포머인 간소화된 트랜스포머를 이용한 깊이 추정(DEST)을 제안한다. 깊이 및 자세 네트워크 간의 공동 주의 메커니즘과 전략적 아키텍처 단순화를 통해, 기존 최고 성능(SOTA) 대비 모델 크기를 85% 감소시키고 추론 지연을 최대 86%까지 줄였으며, KITTI에서 뛰어난 정확도를 달성하고, 세분화 분류 작업으로의 일반화 능력도 뛰어나 성능과 속도 향상을 동시에 확보한다.

ABSTRACT

Transformer and its variants have shown state-of-the-art results in many vision tasks recently, ranging from image classification to dense prediction. Despite of their success, limited work has been reported on improving the model efficiency for deployment in latency-critical applications, such as autonomous driving and robotic navigation. In this paper, we aim at improving upon the existing transformers in vision, and propose a method for self-supervised monocular Depth Estimation with Simplified Transformer (DEST), which is efficient and particularly suitable for deployment on GPU-based platforms. Through strategic design choices, our model leads to significant reduction in model size, complexity, as well as inference latency, while achieving superior accuracy as compared to state-of-the-art. We also show that our design generalize well to other dense prediction task without bells and whistles.

연구 동기 및 목표

  • 실시간 응용 프로그램을 위한 기존 비전 트랜스포머의 높은 계산 비용과 지연 문제를 해결하기 위해.
  • GPU 플랫폼에서 효율적이고 하드웨어 우수성을 고려한 간소화된 트랜스포머 아키텍처를 설계하기 위해.
  • 대규모 지도된 깊이 데이터를 사용하지 않고도 자기지도 학습 기반 깊이 추정의 정확도를 향상시키기 위해.
  • 제안된 아키텍처가 세분화 예측 작업(예: 세분화 분류)으로의 일반화 능력을 확보하기 위해.
  • 최소한의 파라미터 수와 추론 지연으로 최고 수준의 성능을 달성하기 위해.

제안 방법

  • 계산 복잡도를 줄이기 위해 기본 연산(자기 주의, 피드포워드 네트워크)만을 사용하는 간소화된 트랜스포머 인코더를 사용한다.
  • 깊이 네트워크의 특징을 활용해 자세 네트워크의 주의를 계산하는 공동 주의 메커니즘을 도입하여 특징 학습을 향상시킨다.
  • 광학 재구성 손실을 기반으로 단일 영상 시퀀스에서 깊이-넷과 자세-넷을 함께 훈련하는 듀얼 스트림 훈련 설정을 채택한다.
  • 깊이 및 너비가 점차 증가하는 모델 변형(B0부터 B5까지)을 설계하며, 특정 블록 구성((2,2,2,2) 등)과 특징 맵 채널을 사용한다.
  • 추론 시에는 오직 깊이-넷만 사용하고 훈련 후 자세-넷은 폐기하여 효율적인 구현을 가능하게 한다.
  • ImageNet 또는 CityScapes 전이 학습 여부에 따라 아키텍처를 평가하고, 추론 속도 향상을 위해 TensorRT를 최적화한다.

실험 결과

연구 질문

  • RQ1간소화된 트랜스포머 아키텍처가 모델 크기와 추론 지연을 크게 줄이면서도 최고 성능의 깊이 추정 정확도를 달성할 수 있는가?
  • RQ2깊이 및 자세 네트워크 간의 공동 주의 메커니즘이 특징 표현과 예측 정확도를 어떻게 향상시키는가?
  • RQ3제안된 아키텍처가 세분화 분류와 같은 다른 밀도 예측 작업으로 얼마나 잘 일반화되는가?
  • RQ4하드웨어 인식 설계 선택이 정확도를 훼손하지 않으면서도 GPU 플랫폼에서 지연을 얼마나 효과적으로 줄이는가?
  • RQ5다양한 깊이 추정 벤치마크에서 모델 효율성(파라미터 수, MACs)과 성능 간의 상호 교환 관계는 어떠한가?

주요 결과

  • DEST-B3는 PackNet-SfM 대비 모델 파라미터 수를 85% 감소시키고, GMACs는 90% 감소시키면서도 대부분의 KITTI 지표에서 슈퍼리어한 성능을 보였다.
  • 가장 작은 모델인 DEST-B0는 크기가 극히 작음에도 불구하고 경쟁 가능한 깊이 추정 정확도를 달성하여 강력한 일반화 능력을 입증했다.
  • TensorRT를 사용한 FP16 정밀도에서 V100 GPU 기준 추론 지연이 8.87ms로 떨어졌으며, 이는 PyTorch 기반 PackNet-SfM의 64.76ms 대비 86% 감소한 것이다.
  • DEST-B3는 18.08M 파라미터와 142.78 GMACs로 CityScapes 세분화 분류에서 72.58% mIoU를 기록했으며, SegFormer-B3보다 정확도는 뛰어나고 지연은 59% 감소시켰다.
  • 공동 주의 메커니즘이 깊이 추정 정확도를 크게 향상시키며, 이는 이 구성 요소가 없는 기준 모델인 SegFormer-B3보다 성능이 뛰어난 것으로 확인되었다.
  • 모델은 세분화 분류 작업으로 효과적으로 일반화되었으며, SegFormer-B3보다 훨씬 적은 파라미터 수와 낮은 지연으로 더 높은 mIoU를 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.