Skip to main content
QUICK REVIEW

[논문 리뷰] A New Convolutional Network-in-Network Structure and Its Applications in Skin Detection, Semantic Segmentation, and Artifact Reduction

Yoonsik Kim, Insung Hwang|arXiv (Cornell University)|2017. 01. 22.
Image Enhancement Techniques참고 문헌 45인용 수 15
한 줄 요약

이 논문은 인셉션 모듈 기반의 수정된 네트워크인 네트워크-인-네트워크 아키텍처를 제안하며, 특징 맵 해상도를 유지하기 위해 풀링 레이어를 제거하고, 수용성 영역을 유지하기 위해 더 큰 7×7 컨볼루션 필터를 추가한다. 결과적으로 경량이며 완전히 컨볼루션 기반인 이 네트워크는 피크 추출, 의미적 세그멘테이션, JPEG 아티팩트 감소에서 최신 기술 수준 또는 경쟁력 있는 성능을 달성하여, 파rameter가 많은 디컨볼루션 또는 업샘플링 레이어 없이도 이미지 간 작업에 강력한 효과를 보여준다.

ABSTRACT

The inception network has been shown to provide good performance on image classification problems, but there are not much evidences that it is also effective for the image restoration or pixel-wise labeling problems. For image restoration problems, the pooling is generally not used because the decimated features are not helpful for the reconstruction of an image as the output. Moreover, most deep learning architectures for the restoration problems do not use dense prediction that need lots of training parameters. From these observations, for enjoying the performance of inception-like structure on the image based problems we propose a new convolutional network-in-network structure. The proposed network can be considered a modification of inception structure where pool projection and pooling layer are removed for maintaining the entire feature map size, and a larger kernel filter is added instead. Proposed network greatly reduces the number of parameters on account of removed dense prediction and pooling, which is an advantage, but may also reduce the receptive field in each layer. Hence, we add a larger kernel than the original inception structure for not increasing the depth of layers. The proposed structure is applied to typical image-to-image learning problems, i.e., the problems where the size of input and output are same such as skin detection, semantic segmentation, and compression artifacts reduction. Extensive experiments show that the proposed network brings comparable or better results than the state-of-the-art convolutional neural networks for these problems.

연구 동기 및 목표

  • 세그멘테이션 및 복원과 같은 이미지 간 작업에서 표준 인셉션 네트워크의 한계를 해결하기 위해, 풀링이 공간 해상도를 떨어뜨리는 문제를 해결한다.
  • 정밀한 픽셀 단위 예측을 위해 전체 특징 맵 크기를 유지하고, 디컨볼루션 또는 업샘플링 레이어가 필요 없도록 한다.
  • 밀도 있는 예측 및 풀링 레이어를 제거하여 모델 파라미터를 줄이고, 더 큰 커널을 통해 수용성 영역을 유지한다.
  • 세 가지 핵심 이미지 간 학습 문제에 대해 제안된 아키텍처를 평가한다: 피크 추출, 의미적 세그멘테이션, 압축 아티팩트 감소.

제안 방법

  • 제안된 아키텍처는 원래 인셉션 모듈의 풀링 및 풀링 프로젝션 레이어를 공간 해상도 유지와 수용성 영역 확장 목적의 단일 7×7 컨볼루션 레이어로 대체한다.
  • 네트워크는 완전히 컨볼루션 및 ReLU 레이어로 구성되어 있어, 엔드 투 엔드 픽셀 단위 예측을 지원하기 위해 완전 연결 및 풀링 레이어를 제거한다.
  • 병렬로 1×1, 3×3, 7×7 컨볼루션을 사용한 수정된 인셉션 모듈을 사용하며, 이후 ReLU 활성화 함수를 적용하여 다중 척도 특징을 추출하고, 다운샘플링 없이 특징을 추출한다.
  • 표준 백프로파게이션을 사용하여 훈련하며, 손실 함수를 작업에 맞게 조정한다: 피크 추출에는 이진 교차 엔트로피, 의미적 세그멘테이션에는 소프트맥스, 아티팩트 감소에는 L2 손실을 사용한다.
  • 깊이와 필터 수가 동일한 모델을 세 가지 작업에 적용하며, 손실 함수와 출력 차원만 다를 뿐이므로 공정한 비교가 가능하다.
  • 기준 데이터셋을 사용해 아키텍처를 평가한다: 피크 추출은 ECU 및 Pratheepan, 의미적 세그멘테이션은 CamVid, 아티팩트 감소는 JPEG 압축 이미지에 대해 평가한다.

실험 결과

연구 질문

  • RQ1풀링 레이어가 없는 인셉션 유사 아키텍처가 의미적 세그멘테이션 및 이미지 복원과 같은 이미지 간 작업에서 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ2풀링 및 디컨볼루션 레이어를 제거하고 더 큰 커널을 추가함으로써 수용성 영역과 픽셀 단위 예측 작업의 성능이 유지되거나 향상되는가?
  • RQ3제안된 네트워크는 피크 추출, 의미적 세그멘테이션, JPEG 아티팩트 감소에서 최신 기술 수준의 방법과 비교해 어떻게 성능을 내는가?
  • RQ4파rameter가 적은 경량의 완전히 컨볼루션 기반 네트워크가 이미지 간 학습에서 더 깊거나 더 복잡한 아키텍처를 능가할 수 있는가?

주요 결과

  • CamVid 의미적 세그멘테이션 데이터셋에서 제안된 네트워크는 85.5% 전역 정확도, 65.1% 클래스 평균 정확도, 51.7% 평균 IoU를 기록하며, FCN 및 SegNet을 능가했다.
  • ECU 데이터셋에서 제안된 방법은 피크 추출에서 F1 스코어 93.8%를 기록하여 베이지안, DSPF, FPSD 기반선을 초월했다.
  • Pratheepan 데이터셋에서 제안된 방법은 F1 스코어 94.1%를 기록하여 다양한 피부 색상 분포에 대해 강건함을 입증했다.
  • JPEG 아티팩트 감소 작업에서는 LIVE1 데이터셋에서 Q=10일 때 PSNR 29.34 dB, SSIM 0.820을 기록했고, Q=20일 때는 PSNR 31.60 dB, SSIM 0.894를 기록하여 SA-DCT, AR-CNN, RAR-CNN를 모두 능가했다.
  • 주관적 평가 결과, 제안된 방법은 특히 고압축 상황에서 더 선명한 윤곽선과 더 적은 리버브 아티팩트를 생성함을 확인했다.
  • 아블레이션 스터디 결과, 풀링 제거 및 7×7 필터 추가가 성능 향상에 크게 기여했으며, 공간 해상도 및 수용성 영역 보존을 위한 설계 선택의 타당성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.