Skip to main content
QUICK REVIEW

[논문 리뷰] Pixel Difference Networks for Efficient Edge Detection

Zhuo Su, Wenzhe Liu|arXiv (Cornell University)|2021. 08. 16.
Advanced Neural Network Applications참고 문헌 64인용 수 14
한 줄 요약

이 논문은 새로운 픽셀 차이 합성곱(PDC)을 통해 전통적인 에지 연산자(Sobel, Canny 등)를 합성곱 층에 통합한 경량이며 효율적인 엣지 검출 아키텍처인 PiDiNet를 제안한다. PiDiNet는 ImageNet 사전학습 없이 완전히 새로 학습함으로써 BSDS500에서 인간 수준의 성능(0.807 ODS F-측정값)을 달성하며, 파rameter 수는 710K개, 추론 속도는 100 FPS에 불과하다. 이는 이전의 방법들보다 효율성과 정확도 면에서 뛰어나다.

ABSTRACT

Recently, deep Convolutional Neural Networks (CNNs) can achieve human-level performance in edge detection with the rich and abstract edge representation capacities. However, the high performance of CNN based edge detection is achieved with a large pretrained CNN backbone, which is memory and energy consuming. In addition, it is surprising that the previous wisdom from the traditional edge detectors, such as Canny, Sobel, and LBP are rarely investigated in the rapid-developing deep learning era. To address these issues, we propose a simple, lightweight yet effective architecture named Pixel Difference Network (PiDiNet) for efficient edge detection. Extensive experiments on BSDS500, NYUD, and Multicue are provided to demonstrate its effectiveness, and its high training and inference efficiency. Surprisingly, when training from scratch with only the BSDS500 and VOC datasets, PiDiNet can surpass the recorded result of human perception (0.807 vs. 0.803 in ODS F-measure) on the BSDS500 dataset with 100 FPS and less than 1M parameters. A faster version of PiDiNet with less than 0.1M parameters can still achieve comparable performance among state of the arts with 200 FPS. Results on the NYUD and Multicue datasets show similar observations. The codes are available at https://github.com/zhuoinoulu/pidinet.

연구 동기 및 목표

  • 최신 엣지 검출 모델에서 큰 CNN 백본으로 인한 높은 계산 비용과 메모리 소비 문제를 해결한다.
  • 고전적인 엣지 검출 연산자(Sobel, Canny 등)를 딥러닝 프레임워크에 통합하여 기울기 인식 특징 학습을 향상시킨다.
  • 최소한의 모델 크기와 낮은 추론 지연으로 고성능 엣지 검출을 가능하게 하며, 대규모 사전학습의 필요성을 제거한다.
  • BSDS500 및 VOC와 같은 제한된 데이터셋만을 사용해 완전히 새로 학습한 모델이 인간 수준의 정확도를 달성할 수 있음을 입증한다.

제안 방법

  • 입력 특징 맵 내의 쌍별 픽셀 차이를 계산한 후 표준 합성곱 가중치를 적용하는 새로운 합성곱 연산인 픽셀 차이 합성곱(PDC)을 제안한다.
  • PDC는 국소 이미지 패치에서 기울기 정보를 명시적으로 인코딩하여, 무작위 커널 초기화에만 의존하지 않고도 엣지 감지를 더 잘 수행할 수 있도록 한다.
  • PDC 블록 기반의 경량 네트워크 아키텍처인 PiDiNet를 설계하여 파라미터 수를 감소시키고 추론 속도를 향상시켰다.
  • ImageNet 사전학습 없이 BSDS500 및 VOC 데이터셋만을 사용해 PiDiNet를 끝에서 끝까지 새로 학습시켰다.
  • HED 및 RCF와 유사하게 다중 척도 감시와 스킵 연결을 사용하여 세밀한 엣지 세부 정보를 유지한다.
  • 계산 비용(MACs)과 모델 크기를 최소화하면서도 경쟁 가능한 정확도를 유지하기 위해 추론 효율성에 최적화하였다.

실험 결과

연구 질문

  • RQ1고전적인 엣지 검출 연산자를 CNN에 통합함으로써 모델 복잡도 증가 없이도 엣지 검출 성능을 향상시킬 수 있는가?
  • RQ2완전히 새로 학습한 경량 CNN이 엣지 검출 벤치마크에서 인간 수준의 성능을 달성할 수 있는가?
  • RQ3제안된 PDC 레이어가 표준 합성곱에 비해 기울기 민감도와 엣지 정렬 정확도를 향상시키는가?
  • RQ4대규모 사전학습된 백본에 의존하는 최신 기술 모델들과 비교해 PiDiNet는 정확도와 효율성 면에서 어떻게 성과를 내는가?

주요 결과

  • PiDiNet는 BSDS500 데이터셋에서 ODS F-측정값 0.807을 달성하였으며, 인간 인지 기준(0.803)을 초월하였다. 파라미터 수는 710K개, 추론 속도는 100 FPS였다.
  • 0.1M 파라미터 미만의 더 작은 PiDiNet 버전은 215 FPS의 속도로 ODS F-측정값 0.787을 기록하였으며, 최신 기술 모델들과 유사한 성능을 보였다.
  • NYUD 데이터셋에서 PiDiNet는 RGB-HHA 조합으로 ODS F-측정값 0.756을 기록하였고, 62 FPS의 속도로 HED 및 BDCN보다 빠르고 정확도 면에서 뛰어났다.
  • Multicue 데이터셋에서는 ODS F-측정값이 경계 기준 0.855, 엣지 기준 0.860로 나타났으며, 17 FPS의 속도로 최신 기술 모델들과 정확도에서 맞먹거나 초월하였다.
  • PiDiNet-L은 더 큰 변종으로서 NYUD에서 88 FPS, Multicue에서 23 FPS의 높은 추론 효율성을 보였으며, 다양한 데이터셋에서 뛰어난 성능을 입증하였다.
  • 제거 분석 결과, PDC가 기울기 민감도를 향상시켜 엣지 감지 품질을 향상시킴을 확인하였으며, RCF, CED, BDCN과의 정성적 비교에서 이를 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.