Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-Image Relational Knowledge Distillation for Semantic Segmentation

Chuanguang Yang, Helong Zhou|arXiv (Cornell University)|2022. 04. 14.
Advanced Neural Network Applications인용 수 9
한 줄 요약

이 논문은 의미 분할을 위한 새로운 지식 증류 프레임워크인 크로스-이미지 상관계지 기반 지식 증류(CIRKD)를 제안한다. 이는 교사 네트워크에서 다수의 이미지를 통해 학생 네트워크로 전역적인 픽셀-픽셀 및 픽셀-영역 관계를 전달한다. 메모리 백에 픽셀 큐와 영역 큐를 활용하여 장거리 종속성을 모델링함으로써 CIRKD는 기존 최고 수준의 방법을 초월하는 성능을 달성하며, Cityscapes에서 75.42% mIoU를 기록하고, DeepLabV3와 PSPNet에서 각각 Channel-Wise KD보다 0.48%, 0.79% 높은 성능을 보였다.

ABSTRACT

Current Knowledge Distillation (KD) methods for semantic segmentation often guide the student to mimic the teacher's structured information generated from individual data samples. However, they ignore the global semantic relations among pixels across various images that are valuable for KD. This paper proposes a novel Cross-Image Relational KD (CIRKD), which focuses on transferring structured pixel-to-pixel and pixel-to-region relations among the whole images. The motivation is that a good teacher network could construct a well-structured feature space in terms of global pixel dependencies. CIRKD makes the student mimic better structured semantic relations from the teacher, thus improving the segmentation performance. Experimental results over Cityscapes, CamVid and Pascal VOC datasets demonstrate the effectiveness of our proposed approach against state-of-the-art distillation methods. The code is available at https://github.com/winycg/CIRKD.

연구 동기 및 목표

  • 기존 의미 분할을 위한 지식 증류 방법이 내부 이미지 관계에만 집중하고 교차 이미지 세분화 종속성을 忽시하는 한계를 해결하기 위해.
  • 다양한 훈련 이미지를 통해 구조화되고 전역적인 픽셀 수준의 관계와 픽셀-영역 관계를 전달하여 학생 네트워크 성능을 향상시키기 위해.
  • 고정된 교사 네트워크를 사용한 메모리 백을 통해 장거리 픽셀 종속성을 모델링하여 더 강력하고 일반화된 지식 전달을 가능하게 하기 위해.
  • 밀도 있는 예측 작업에서 국소적 또는 채널 기반 특징을 초월하는 전역적 상관계지 지식이 증류 효과를 크게 향상시킨다는 것을 입증하기 위해.

제안 방법

  • CIRKD는 사전 훈련된 교사 네트워크의 고정된 특징 임베딩을 저장하기 위해 메모리 백 내에 픽셀 큐와 영역 큐를 구성한다. 이를 통해 현재 미니배치를 초월한 수많은 이미지의 임베딩에 접근할 수 있다.
  • KL 발산을 사용하여 현재 배치의 앵커와 픽셀 큐에서 샘플된 대조 임베딩 간의 유사도 분포를 정렬함으로써 픽셀-픽셀 증류를 수행한다.
  • 개별 픽셀과 클래스 기반 프로토타입(영역 임베딩) 간의 상대적 유사도를 전달하기 위해 픽셀-영역 증류를 도입함으로써 클래스 수준의 의미 이해를 향상시킨다.
  • 영역 임베딩은 특징 맵 내 동일한 의미 클래스에 속한 모든 픽셀 임베딩의 평균 풀링을 통해 계산된다.
  • 증류 중 유사도 분포를 부드럽게 하기 위해 온도 스케일링 전략을 적용하였으며, τ = 0.1이 최적의 성능을 내는 것으로 확인되었다.
  • 최종 손실는 작업 손실, 표준 KD 손실, 그리고 두 가지 새로운 상관계지 증류 손실인 $L_{memory\_p2p}$와 $L_{memory\_p2r}$를 포함하며, 이는 학생에서 교사로의 KL 발산을 통해 훈련된다.

실험 결과

연구 질문

  • RQ1전역적인 크로스-이미지 픽셀 관계를 전달함으로써 내부 이미지 관계를 초월해 의미 분할에서 지식 증류 성능을 향상시킬 수 있는가?
  • RQ2고정된 임베딩의 메모리 백을 통해 장거리 종속성을 모델링하면 학생 네트워크의 일반화 능력과 성능에 어떤 영향을 미치는가?
  • RQ3밀도 있는 예측 작업에서 픽셀-픽셀 대비 픽셀-영역 상관계지 지식의 상대적 기여도는 어떠한가?
  • RQ4큐 크기, 온도, 대조 샘플 수와 같은 하이퍼파라미터가 증류 성능에 어떤 영향을 미치는가?

주요 결과

  • CIRKD는 Cityscapes 검증 세트에서 75.42% mIoU를 기록하여, 학생과 교사 간의 성능 격차를 4.95%에서 2.65%로 줄였다.
  • DeepLabV3에서 Channel-Wise KD(CWD)보다 0.48% mIoU 높고, PSPNet에서는 0.79% 높은 성능을 기록하여 기존 최고 수준의 증류 방법을 뛰어넘는 것으로 확인되었다.
  • 메모리 기반 픽셀-픽셀 증류($L_{memory\_p2p}$)는 표준 KD 대비 0.85% mIoU 향상을 보였으며, 더 큰 임베딩 풀에서의 광범위한 맥락이 유리함을 입증했다.
  • 제거 분석 결과, 픽셀-픽셀 증류가 픽셀-영역 증류보다 더 정보가 풍부하며, 큐 크기와 대조 샘플 수가 증가할수록 성능 향상이 이루어지지만 포화점에 도달함을 확인했다.
  • 최적의 성능는 τ = 0.1, $K_p = 4096$ 대조 픽셀 임베딩, $K_r = 1024$ 대조 영역 임베딩에서 달성되었으며, 이는 고차원 유사도 분포가 richer 종속성을 포착함을 시사한다.
  • CIRKD는 DeepLabV3-MobileNetV2와 PSPNet-Res18를 포함한 다양한 학생 아키텍처에서 효과적으로 스케일업되며, 강력한 일반화 능력과 적응 가능성의 우수함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.