Skip to main content
QUICK REVIEW

[논문 리뷰] Knowledge Adaptation for Efficient Semantic Segmentation

Tong He, Chunhua Shen|arXiv (Cornell University)|2019. 03. 12.
Advanced Neural Network Applications참고 문헌 27인용 수 20
한 줄 요약

이 논문은 특징 번역과 유사도 정련을 통해 대규모 교사 네트워크로부터 지식을 전달하는 지식 정련 프레임워크를 제안하여 효율적인 세분화를 위한 컴 pact한 학생 네트워크를 향상시킨다. 사전 훈련된 오토에코더를 사용해 고수준 특징을 적응시키고, 유사도 모듈을 통해 장거리 공간적 의존성을 유지함으로써, 전체 정밀도 기반 기준 대비 8%의 FLOPS만을 사용하면서 Cityscapes에서 mIOU를 2.5점 향상시켜 72.7에 도달한다.

ABSTRACT

Both accuracy and efficiency are of significant importance to the task of semantic segmentation. Existing deep FCNs suffer from heavy computations due to a series of high-resolution feature maps for preserving the detailed knowledge in dense estimation. Although reducing the feature map resolution (i.e., applying a large overall stride) via subsampling operations (e.g., pooling and convolution striding) can instantly increase the efficiency, it dramatically decreases the estimation accuracy. To tackle this dilemma, we propose a knowledge distillation method tailored for semantic segmentation to improve the performance of the compact FCNs with large overall stride. To handle the inconsistency between the features of the student and teacher network, we optimize the feature similarity in a transferred latent domain formulated by utilizing a pre-trained autoencoder. Moreover, an affinity distillation module is proposed to capture the long-range dependency by calculating the non-local interactions across the whole image. To validate the effectiveness of our proposed method, extensive experiments have been conducted on three popular benchmarks: Pascal VOC, Cityscapes and Pascal Context. Built upon a highly competitive baseline, our proposed method can improve the performance of a student network by 2.5\% (mIOU boosts from 70.2 to 72.7 on the cityscapes test set) and can train a better compact model with only 8\% float operations (FLOPS) of a model that achieves comparable performances.

연구 동기 및 목표

  • 고해상도 특징 맵이 정확도를 향상시키지만 계산 비용을 증가시키는 세분화의 정확도-효율성 트레이드오프를 해결하기 위해.
  • 큰 출력 스트라이드를 가진 컴 pact한 학생 네트워크가 더 큰 모델의 성능을 따라하거나 초월할 수 있도록 하기 위해.
  • 밀도 예측 작업을 위한 지식 정련에서 학생 및 교사 네트워크 간의 특징 분포 불일치 문제를 해결하기 위해.
  • 모델 복잡도를 증가시키지 않으면서도 정제된 지식 내에서 장거리 공간적 의존성을 유지하기 위해.
  • 특징 수준과 관계 지식 전달을 모두 활용하는 세분화에 특화된 지식 정련 방법을 개발하기 위해.

제안 방법

  • 사전 훈련된 오토에코더 기반의 지식 번역기는 교사 네트워크의 고차원적, 고해상도 특징을 전달하기 쉬운 압축된 잠재 공간으로 매핑한다.
  • 지식 어댑터는 학생의 최종 특징 맵을 교사의 특징과 동일한 잠재 공간으로 투영하여 분포를 정렬하고 도메인 이동을 줄인다.
  • 유사도 정련 모듈은 전체 이미지에 걸쳐 비국소 상호작용을 계산하여 교사 및 학생 특징의 장거리 의존성을 포착한다.
  • 학생은 하드 레이블과 함께 교육된 특징에서의 지식 정련, 그리고 비국소 주의 맵에서의 유사도 정련을 포함하는 다중 과제 손실을 사용해 훈련된다.
  • 모델에 추가 파rameter나 추론 FLOPs를 추가하지 않아 실시간 배포에 효율적이다.
  • 프로토콜이 일관된 Pascal VOC, Cityscapes, Pascal Context 벤치마크에서 표준 최적화를 사용해 엔드 투 엔드로 프레임워크를 훈련한다.

실험 결과

연구 질문

  • RQ1큰 출력 스트라이드를 가진 경량 세분화 모델의 성능을 지식 정련이 효과적으로 향상시킬 수 있는가?
  • RQ2세분화 작업에서 지식 전달 중 학생 및 교사 네트워크 간의 특징 분포 불일치 문제를 어떻게 완화할 수 있는가?
  • RQ3모델 복잡도를 증가시키지 않으면서도 정제된 지식 내에서 장거리 공간적 의존성을 어느 정도 유지할 수 있는가?
  • RQ4지식 적응을 통해 컴 pact한 학생 네트워크가 훨씬 낮은 FLOPS로 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ5제안된 방법이 표준 지식 정련 및 기타 경량 모델보다 정확도-효율성 트레이드오프에서 뛰어난 성능을 보이는가?

주요 결과

  • Cityscapes 테스트 세트에서 제안된 방법은 학생 모델의 mIOU를 70.2%에서 72.7%로 2.5점 향상시켰으며, 비교 가능한 전체 정밀도 기반 모델 대비 FLOPS의 8%만을 사용했다.
  • Pascal VOC 검증 세트에서 방법은 MobileNetV2 기준선을 1.0 mIOU 포인트 향상시켜 75.8 mIOU를 달성했다.
  • Pascal Context 데이터셋에서 방법은 기준선 성능을 1.3 mIOU 포인트 향상시켜 다양한 데이터셋에 대한 일반화 능력을 입증했다.
  • 절단 실험은 지식 적응 및 유사도 정련 모듈이 모두 필수적임을 확인하였으며, 특히 후자는 장거리 컨텍스트 모델링을 크게 향상시켰다.
  • 추가 파rameter나 FLOPs 없이도 다른 경량 모델보다 정확도에서 뛰어난 성능을 보이며, 효율성과 효과성의 증명이다.
  • 시각화 결과는 제안된 방법이 학생 기준선 및 표준 정련보다 더 정확하고 세부 정보를 잘 유지하는 세분화 맵을 생성함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.