[논문 리뷰] Disentangled Non-Local Neural Networks
이 논문은 표준 비국소 블록의 어텐션 계산을 별도의 화이트닝된 쌍별 및 일원항으로 분리하여 특징 학습을 향상시키는 분리된 비국소(DNL) 블록을 제안한다. 전용 소프트맥스 및 임bedding 행렬을 사용해 이 두 항을 별도로 훈련시킴으로써 DNL은 세분화, 객체 검출, 동작 인식 등 다양한 작업에서 뚜렷한 성능 향상을 이룬다. PASCAL-Context에서 최대 3.4%의 mIoU 향상과 COCO에서 0.7%의 mAP 향상을 기록한다.
The non-local block is a popular module for strengthening the context modeling ability of a regular convolutional neural network. This paper first studies the non-local block in depth, where we find that its attention computation can be split into two terms, a whitened pairwise term accounting for the relationship between two pixels and a unary term representing the saliency of every pixel. We also observe that the two terms trained alone tend to model different visual clues, e.g. the whitened pairwise term learns within-region relationships while the unary term learns salient boundaries. However, the two terms are tightly coupled in the non-local block, which hinders the learning of each. Based on these findings, we present the disentangled non-local block, where the two terms are decoupled to facilitate learning for both terms. We demonstrate the effectiveness of the decoupled design on various tasks, such as semantic segmentation on Cityscapes, ADE20K and PASCAL Context, object detection on COCO, and action recognition on Kinetics.
연구 동기 및 목표
- 비국소 블록의 내부 메커니즘을 조사하고, 그 어텐션 계산에서의 한계를 규명한다.
- 쌍방향 및 일원 어텐션 항이 함께 최적화될 때 표준 비국소 블록이 성능이 떨어지는 이유를 이해한다.
- 두 어텐션 항을 분리하여 독립적인 최적화를 가능하게 함으로써 시각적 표현 학습을 향상시킨다.
- 세분화, 검출, 동작 인식과 같은 다양한 비전 작업에서 분리 설계의 효과를 검증한다.
제안 방법
- 비국소 블록의 어텐션 계산을 두 개의 별도 항으로 분해한다: 상호 픽셀 관계를 위한 화이트닝된 쌍별 항과 픽셀의 중요도를 위한 일원항.
- 쌍별 및 일원항에 대해 별도의 소프트맥스 함수와 독립적인 임베딩 행렬을 적용하여 훈련 중 이들의 결합을 제거한다.
- 분리된 구성 요소를 별도로 훈련시어 각각의 시각적 학습 행동을 분석한다.
- 기존 모델에 아키텍처 변경 없이 표준 비국소 블록을 DNL 블록으로 교체하여 직접 비교를 가능하게 한다.
- 제거 실험을 통해 분리가 특징 학습과 모델 성능 향상에 기여하는지 검증한다.
- 객체 검출 및 동작 인식을 위해 최신 모델인 Mask R-CNN과 Slow-only 네트워크에 DNL 블록을 적용한다.
실험 결과
연구 질문
- RQ1비국소 블록의 쌍별 및 일원 구성 요소가 별도로 고려될 경우, 시각적 표현 학습에 어떻게 기여하는가?
- RQ2표준 비국소 블록에서 쌍별 및 일원 항이 함께 최적화될 때 특징 학습이 저해되는 이유는 무엇인가?
- RQ3이 두 항을 분리하면 영역 내 관계와 두드러진 경계를 더 잘 학습할 수 있는가?
- RQ4분리 설계는 세분화, 객체 검출, 동작 인식과 같은 다양한 비전 작업에서 성능 향상에 기여하는가?
주요 결과
- 화이트닝된 쌍별 항만으로도 영역 내 관계를 명확히 학습하는 반면, 일원 항만으로는 두드러진 경계를 학습함을 확인하여 서로 다른 시각적 단서임을 입증한다.
- 표준 비국소 블록에서 결합된 상태에서는 양 항 모두 명확한 시각적 패턴을 학습하지 못하며, 일원항 전용 버전보다 성능이 열 劣하다.
- Cityscapes에서 ResNet-101 백본을 사용할 경우, 표준 비국소 블록을 DNL 블록으로 교체함으로써 mIoU가 2.0% 향상된다.
- ADE20K에서 DNL 블록은 표준 비국소 블록 대비 1.3%의 mIoU 향상을 기록하며, 최소한의 수정으로 새로운 SOTA를 달성한다.
- PASCAL-Context에서 DNL 블록은 ResNet-101을 사용할 경우 표준 비국소 블록 대비 mIoU가 3.4% 향상된다.
- COCO에서 DNL 블록은 표준 비국소 블록 대비 박스 mAP가 0.7% 높고, 마스크 mAP도 0.6% 높으며, 각각 0.7%와 0.6%의 향상률을 기록한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.