Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Object Detection under Occlusion with Context-Aware CompositionalNets

Angtian Wang, Yihong Sun|arXiv (Cornell University)|2020. 05. 24.
Advanced Neural Network Applications참고 문헌 40인용 수 6
한 줄 요약

이 논문은 강한 가림을 겪는 상황에서 정확한 바운딩 박스 추정을 위해 객체와 맥락 표현을 분리하고, 부분 기반 투표 기반 메커니즘을 도입함으로써 강력한 객체 검출을 향상시키기 위해 맥락 인식형 조합 네트워크(CompositionalNets)를 제안한다. 이 방법은 Faster R-CNN 대비 PASCAL3D+에서 강한 가림을 겪는 차량에 대해 41% 향상되었고, MS-COCO에서는 35% 향상되었다.

ABSTRACT

Detecting partially occluded objects is a difficult task. Our experimental results show that deep learning approaches, such as Faster R-CNN, are not robust at object detection under occlusion. Compositional convolutional neural networks (CompositionalNets) have been shown to be robust at classifying occluded objects by explicitly representing the object as a composition of parts. In this work, we propose to overcome two limitations of CompositionalNets which will enable them to detect partially occluded objects: 1) CompositionalNets, as well as other DCNN architectures, do not explicitly separate the representation of the context from the object itself. Under strong object occlusion, the influence of the context is amplified which can have severe negative effects for detection at test time. In order to overcome this, we propose to segment the context during training via bounding box annotations. We then use the segmentation to learn a context-aware CompositionalNet that disentangles the representation of the context and the object. 2) We extend the part-based voting scheme in CompositionalNets to vote for the corners of the object's bounding box, which enables the model to reliably estimate bounding boxes for partially occluded objects. Our extensive experiments show that our proposed model can detect objects robustly, increasing the detection performance of strongly occluded vehicles from PASCAL3D+ and MS-COCO by 41% and 35% respectively in absolute performance relative to Faster R-CNN.

연구 동기 및 목표

  • 깊이 학습 모델인 Faster R-CNN이 맥락 간섭과 정확하지 않은 제안 생성으로 인해 부분적으로 가려진 객체를 탐지하는 데에 떨어지는 강건성 문제를 해결하기 위해.
  • 학습 중에 맥락과 객체 표현을 명시적으로 분리함으로써 객체 검출에서 조합 네트워크(CompositionalNets)의 한계를 극복하기 위해.
  • 객체 모서리를 예측하는 데에 부분 기반 투표 기반 메커니즘을 확장하여, 가려진 객체에 대한 바운딩 박스 추정을 향상시키기 위해.
  • 학습된 분리 기반 맥락 제어를 통해 맥락 영향을 조절함으로써 강한 가림 상황에서도 탐지 정확도를 향상시킬 수 있음을 입증하기 위해.

제안 방법

  • 학습 중에 바운딩 박스 애너테이션을 사용하여 이미지 표현을 맥락 및 객체 구성 요소로 분리하는 맥락 인식형 조합 네트워크 아키텍처를 도입한다.
  • 학습 가능한 가중치 파라미터 ω를 통해 맥락 영향을 억제하면서 객체 부분에 주의를 기울이는 방식으로, 종합적인 분리 표현을 엔드 투 엔드로 학습한다.
  • 조합 네트워크의 부분 기반 투표 기반 메커니즘을 확장하여 객체 바운딩 박스의 두 개의 반대 모서리에 대해서도 투표할 수 있도록 하여, 가림 상황에서도 정밀한 국소화를 가능하게 한다.
  • 가려지지 않은 부분의 투표 결과를 사용하여 전체 바운딩 박스를 추정함으로써, 부분적으로만 노출된 객체의 경우에도 강건성을 향상시킨다.
  • 맥락 및 객체 특징 간의 분리를 장려하기 위해 맥락과 객체 특징 간의 분리 효과를 높이는 혼합 모델 손실 함수를 사용하여 학습한다.
  • ω에 대한 추론 분석을 통해 최적의 맥락 가중치를 도출하며, 맥락 비활성화(ω=0)가 강한 가림 상황에서 성능 향상에 기여함을 보여주었다.

실험 결과

연구 질문

  • RQ1강한 가림 상황에서 맥락 간섭이 딥 러닝 모델의 객체 검출 성능에 어떻게 악영향을 미치는가?
  • RQ2조합 네트워크(CompositionalNets)가 맥락 분리 부족 및 바운딩 박스 추정 능력 부족 문제를 해결함으로써 객체 검출에 확장 가능한가?
  • RQ3객체 모서리를 예측하는 부분 기반 투표 기반 메커니즘이 표준 RPN에 비해 부분 가림 상황에서 국소화 강건성에 어떻게 기여하는가?
  • RQ4조합 네트워크에서 객체 표현과 맥락 표현 간의 최적 균형은 무엇인가?
  • RQ5맥락 인식 표현 학습이 PASCAL3D+와 MS-COCO와 같은 벤치마크 데이터셋에서 가림 상황에서 탐지 정확도 향상에 얼마나 기여하는가?

주요 결과

  • 제안된 맥락 인식형 조합 네트워크는 Faster R-CNN 대비 PASCAL3D+에서 강한 가림을 겪는 차량에 대해 평균 정밀도(mAP)를 41% 향상시켰다.
  • MS-COCO 데이터셋에서 이 방법은 강한 가림을 겪는 차량에 대해 Faster R-CNN 대비 mAP에서 35%의 절대적 향상을 달성했다.
  • 맥락 비활성화(ω=0)가 학습된 맥락 사전(ω=0.5)보다 성능이 뛰어나, 가림이 심할 경우 맥락 정보가 해로울 수 있음을 시사한다.
  • 강력한 바운딩 박스 투표 기반 메커니즘이 가려진 객체에 대한 정확한 제안을 생성하는 데서 RPN을 크게 능가하며, 특히 높은 수준의 가림 상황에서 두드러진 성능 향상을 보였다.
  • Faster R-CNN의 VGG-16 분류기 대신 조합 네트워크를 사용함으로써 고가림 상황에서 성능 향상이 이루어졌으며, 이는 가려진 객체 분류에 대해 부분 기반 모델이 우월함을 확인시켰다.
  • 모델은 극한의 가림 상황(전경 및 배경 수준 3)에서도 높은 정밀도를 유지하였으며, 질적 결과에서 초록색 박스(CA-CompositionalNet via BB Voting)가 실제값과 밀도 높게 일치함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.