Skip to main content
QUICK REVIEW

[논문 리뷰] Instance-Conditional Knowledge Distillation for Object Detection

Zijian Kang, Peizhen Zhang|arXiv (Cornell University)|2021. 10. 25.
Advanced Image and Video Retrieval Techniques인용 수 6
한 줄 요약

이 논문은 객체 검출에서 각 객체 인스턴스를 고려한 지식 증류(Instance-Conditional Knowledge Distillation, ICD)라는 새로운 프레임워크를 제안한다. 이 프레임워크는 인스턴스 인식 주의를 사용해 교사 모델에서 학생 모델로 지식을 선택적으로 전달함으로써 정렬 및 분류 성능을 향상시킨다. 각 객체 인스턴스를 쿼리로 간주하고 주의 메커니즘을 통해 관련 특징을 가중치를 부여함으로써, ICD는 COCO에서 3.3 mAP 향상을 달성하였으며, ResNet-50 기반 학생 모델이 ResNet-101 기반 교사 모델을 초월하였다.

ABSTRACT

Knowledge distillation has shown great success in classification, however, it is still challenging for detection. In a typical image for detection, representations from different locations may have different contributions to detection targets, making the distillation hard to balance. In this paper, we propose a conditional distillation framework to distill the desired knowledge, namely knowledge that is beneficial in terms of both classification and localization for every instance. The framework introduces a learnable conditional decoding module, which retrieves information given each target instance as query. Specifically, we encode the condition information as query and use the teacher's representations as key. The attention between query and key is used to measure the contribution of different features, guided by a localization-recognition-sensitive auxiliary task. Extensive experiments demonstrate the efficacy of our method: we observe impressive improvements under various settings. Notably, we boost RetinaNet with ResNet-50 backbone from 37.4 to 40.7 mAP (+3.3) under 1x schedule, that even surpasses the teacher (40.4 mAP) with ResNet-101 backbone under 3x schedule. Code has been released on https://github.com/megvii-research/ICD.

연구 동기 및 목표

  • 지식 증류에서 공간적 위치에 따라 기여도가 다름에 따라 발생하는 불균형성과 모호성을 해결하기 위해, 다양한 공간 위치의 특징이 검출 성능에 미치는 영향이 다르게 기여하는 문제를 다루는 것.
  • 특정 객체 인스턴스에 가장 관련성이 높은 지식을 명시적으로 식별하고 전달함으로써 증류 품질을 향상시키고, 모든 특징에 대해 균일한 증류를 적용하는 것이 아니라, 인스턴스 기반으로 전달하는 것.
  • 학습 가능한 쿼리 기반 메커니즘을 개발하여 교사 네트워크의 중간 표현에서 인스턴스에 맞는 지식을 동적으로 검색하는 것.
  • 정위치 및 인식에 민감한 보조 과제를 통해 지식 검색 과정을 최적화함으로써 디코더가 유용한 특징을 정확히 위치 파악할 수 있도록 하는 것.
  • 자원 제약 조건 하에서도 작은 학생 검출기 모델이 더 큰 교사 모델을 초월하는 정확도를 달성할 수 있도록 하는 것.

제안 방법

  • 각 검출된 객체 인스턴스를 쿼리로 통합하는 조건부 디코딩 모듈을 도입하여, 교사의 특징 맵을 키와 값으로 사용한다.
  • 인스턴스 인식 크로스 주의를 사용하여 쿼리(객체 인스턴스)와 교사의 특징 간의 주의 가중치를 계산함으로써, 관련 특징을 선택적으로 검색할 수 있도록 한다.
  • 주의 메커니즘이 선택한 가중치가 부여된 특징에 대해서만 지식 증류를 수행함으로써, 각 객체에 가장 관련성이 높은 영역에 집중한다.
  • 디코더를 안내하기 위해 보조 과제를 설계함: 각 인스턴스에 대해 분류 및 바운딩 박스 회귀 예측을 수행하여 주의 메커니즘을 검출 목표와 일치시킨다.
  • 디코더는 학생 검출기와 함께 엔드 투 엔드로 학습되며, 검출 및 보조 지식 검색 감시를 결합한 다중 과제 손실을 사용한다.
  • 이 방법은 다양한 검출기와 호환되며, 학생 또는 교사 네트워크의 아키텍처를 변경할 필요가 없다.

실험 결과

연구 질문

  • RQ1지식 증류에서 모든 특징에 대해 균일하게 적용하는 대신, 객체 검출에서 더 선택적이고 인스턴스 기반으로 지식 증류를 수행할 수 있는 방법은 무엇인가?
  • RQ2객체 인스턴스를 쿼리로 사용하는 학습 가능한 주의 메커니즘이 증류된 지식의 품질과 관련성 향상에 기여할 수 있는가?
  • RQ3검출 목표와 지식 검색을 일치시키는 보조 과제를 도입하면, 히우리스틱 또는 규칙 기반 특징 선택보다 성능 향상이 이루어지는가?
  • RQ4작은 학생 네트워크가 인스턴스 조건부 증류를 통해 더 큰 교사 네트워크를 초월할 수 있는가?
  • RQ5표준 검출 파이프라인에 이러한 조건부 디코딩 모듈을 통합할 경우의 계산 및 메모리 비용은 얼마인가?

주요 결과

  • ICD는 ResNet-50 백본을 사용하는 RetinaNet을 사용해 MS-COCO에서 1× 스케줄 조건에서 mAP를 37.4에서 40.7로 3.3 mAP 향상시켰다.
  • 3× 스케줄 조건에서 ResNet-50 기반 학생 모델은 ResNet-101 기반 교사 모델보다 높은 성능을 보이며, mAP 40.7을 달성한 반면 교사 모델은 40.4 mAP를 기록하였다.
  • 제안된 인스턴스 조건부 주의 메커니즘은 베이스라인 대비 0.9 mAP 향상과 최고의 대안 주의 방법 대비 0.4 mAP 향상을 기록하였다.
  • 제거 분석 결과, 8개의 주의 헤드가 최적의 성능을 보였으며, 계단식 디코더는 최소한의 성능 향상을 보여 단일 스테이지로도 디코더의 능력이 충분하다는 것을 시사한다.
  • 디코더의 학습 비용은 극히 낮았으며, 8개의 A100 GPU에서 약 1.3시간이 소요되어 실세계 적용에 실용적이다.
  • 시각화 결과, 서로 다른 주의 헤드가 서로 다른 구성 요소(예: 두드러진 부분, 경계)에 주목하는 것을 확인하였으며, 이는 모델이 의미적으로 관련된 영역에 집중할 수 있음을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.