[논문 리뷰] Fast End-to-End Trainable Guided Filter
이 논문은 밀도 높은 픽셀 단위 이미지 예측 작업에서 효율적인 동시 업샘플링을 위한 풀 컨volution 네트워크(FCNs)를 향상시키는 학습 가능한 엔드 투 엔드 훈련이 가능한 가이드 필터링 레이어를 제안한다. 가이드 필터를 기울기 가능 파라미터와 학습 가능한 가이드맵을 갖는 미분 가능한 모듈로 재구성함으로써, 이 방법은 이미지 리터치, 화창함 제거, 깊이 추정, 세그멘테이션 등에서 최신 기술 수준의 성능을 달성하면서도 이전 방법들보다 10–100배 빠른 속도로 실행된다.
Dense pixel-wise image prediction has been advanced by harnessing the capabilities of Fully Convolutional Networks (FCNs). One central issue of FCNs is the limited capacity to handle joint upsampling. To address the problem, we present a novel building block for FCNs, namely guided filtering layer, which is designed for efficiently generating a high-resolution output given the corresponding low-resolution one and a high-resolution guidance map. Such a layer contains learnable parameters, which can be integrated with FCNs and jointly optimized through end-to-end training. To further take advantage of end-to-end training, we plug in a trainable transformation function for generating the task-specific guidance map. Based on the proposed layer, we present a general framework for pixel-wise image prediction, named deep guided filtering network (DGF). The proposed network is evaluated on five image processing tasks. Experiments on MIT-Adobe FiveK Dataset demonstrate that DGF runs 10-100 times faster and achieves the state-of-the-art performance. We also show that DGF helps to improve the performance of multiple computer vision tasks.
연구 동기 및 목표
- 고해상도의 밀도 높은 예측 작업에서 표준 FCN의 제한된 동시 업샘플링 능력을 해결하기 위해.
- 엔드 투 엔드 훈련에 적합한 완전히 기울기 가능한 학습 가능한 가이드 필터링 레이어를 개발하기 위해.
- 다양한 비전 작업에서 향상된 성능을 위해 태스크에 맞는 가이드맵 생성을 위한 훈련 가능한 변환 함수를 가능하게 하기 위해.
- 예측 품질을 유지하거나 향상시키면서도 계산 비용과 메모리 사용량을 크게 줄이기 위해.
- 다양한 이미지 처리 및 컴퓨터 비전 작업 전반에 걸쳐 일반화 능력과 우수성을 입증하기 위해.
제안 방법
- 학습 가능한 커널을 갖는 확장 및 포인트와이즈 컨볼루션을 사용해 원래의 가이드 필터를 계산 그래프로 재구성함으로써 역전파가 가능하도록 한다.
- 저해상도 특징에서 태스크에 맞는 가이드맵을 생성하기 위한 훈련 가능한 변환 함수를 도입한다.
- 가이드 필터링 레이어를 FCNs에 기울기 가능한 빌딩 블록으로 통합하여 메인 네트워크와 함께 공동 최적화할 수 있도록 한다.
- 粗-세밀한 파이프라인을 적용: 입력을 다운샘플링하고 저해상도에서 처리한 후, 학습된 파rameters를 갖는 가이드 필터를 사용해 업샘플링한다.
- 모든 파라미터를 엔드 투 엔드로 최적화하기 위해 고해상도에서의 진짜값 감독을 사용하는 표준 훈련 절차를 적용한다.
- 선택적 탐지에서 성능 향상을 위해 두 번째 가이드 필터링 레이어를 적용한다.
![Figure 2: Computation Graph of Guided Filtering Layer. Guided filtering layer takes low-resolution image $I_{l}$ , high-resolution image $I_{h}$ and low-resolution output $O_{l}$ as inputs, generating the high-resolution output $O_{h}$ . Compared to guided filter [ 25 ] , the proposed layer is refor](https://ar5iv.labs.arxiv.org/html/1803.05619/assets/x1.png)
실험 결과
연구 질문
- RQ1가이드 필터가 딥 네트워크 내 엔드 투 엔드 훈련에 호환되는 완전히 기울기 가능한 학습 가능한 레이어로 재구성될 수 있는가?
- RQ2학습 가능한 가이드맵 생성 함수를 도입함으로써 다양한 픽셀 단위 예측 작업에서 성능 향상이 이루어지는가?
- RQ3제안된 가이드 필터링 레이어가 정확도를 유지하거나 향상시키면서도 계산 비용과 메모리 사용량을 줄일 수 있는가?
- RQ4기존의 후처리 방법인 DenseCRF와 비교했을 때 속도와 성능 측면에서 어떻게 성과를 내는가?
- RQ5이 프레임워크는 다양한 이미지 처리 및 컴퓨터 비전 작업 전반에 걸쳐 얼마나 잘 일반화되는가?
주요 결과
- 제안된 딥 가이드 필터링 네트워크(DGF)는 이미지 리터치, 국소적이지 않은 화창함 제거, 깊이 추정 등 다섯 가지 이미지 처리 작업에서 최신 기술 수준의 성능을 달성한다.
- MIT-Adobe FiveK 데이터셋에서 DGF는 기준 방법 대비 10–100배 빠르게 실행되면서도 최신 기술 수준의 결과를 내놓는다.
- 깊이 추정 작업에서 DGF는 루트 평균 제곱 오차를 기준값 6.081에서 5.887로 감소시켜 0.194의 개선을 이룬다.
- 선택적 탐지 작업에서 Fβ는 기준값 90.61%에서 DGF로 91.75%로 상승했으며, 세그멘테이션 성능에서 DenseCRF(91.87% Fβ)를 능가하고 10배 빠른 속도를 기록한다.
- 세그멘테이션 작업에서 DGF는 평균 IOU 73.58%를 달성하여 기준값(71.79%) 대비 1.79% 향상된 성과를 보였다.
- 512² 이미지를 평균 34ms 내로 처리할 수 있었으며, DenseCRF의 432ms 대비 12.7배 빠른 속도를 기록하여 성능 향상과 함께 빠른 처리를 동시에 확보했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.