Skip to main content
QUICK REVIEW

[논문 리뷰] Deformable Capsules for Object Detection

Rodney Lalonde, Naji Khosravan|arXiv (Cornell University)|2021. 04. 11.
Advanced Neural Network Applications인용 수 4
한 줄 요약

이 논문은 MS COCO에서 효율적이고 확장 가능한 단계별 검출을 가능하게 하는 새로운 SplitCaps 아키텍처와 SE-Routing 알고리즘을 결합한 첫 번째 객체 검출을 위한 캡슐 네트워크인 DeformCaps를 소개한다. 이는 CNN 기반 검출기와 동등한 최신 기술 성능을 달성하면서도 오류 경고를 줄이고 이상한 객체 자세에 대한 일반화 능력을 향상시킨다.

ABSTRACT

Capsule networks promise significant benefits over convolutional networks by storing stronger internal representations, and routing information based on the agreement between intermediate representations' projections. Despite this, their success has been limited to small-scale classification datasets due to their computationally expensive nature. Though memory efficient, convolutional capsules impose geometric constraints that fundamentally limit the ability of capsules to model the pose/deformation of objects. Further, they do not address the bigger memory concern of class-capsules scaling up to bigger tasks such as detection or large-scale classification. In this study, we introduce a new family of capsule networks, deformable capsules ( extit{DeformCaps}), to address a very important problem in computer vision: object detection. We propose two new algorithms associated with our extit{DeformCaps}: a novel capsule structure ( extit{SplitCaps}), and a novel dynamic routing algorithm ( extit{SE-Routing}), which balance computational efficiency with the need for modeling a large number of objects and classes, which have never been achieved with capsule networks before. We demonstrate that the proposed methods efficiently scale up to create the first-ever capsule network for object detection in the literature. Our proposed architecture is a one-stage detection framework and it obtains results on MS COCO which are on par with state-of-the-art one-stage CNN-based methods, while producing fewer false positive detection, generalizing to unusual poses/viewpoints of objects.

연구 동기 및 목표

  • 컴퓨터 시각 분야에서 중요한 격차인 대규모 객체 검출 분야에서 캡슐 네트워크의 부재를 해결하기 위해.
  • MS COCO와 같은 데이터셋에 확장될 수 있도록 전통적인 캡슐 네트워크의 계산 및 표현적 한계를 극복하기 위해.
  • 라우팅 과정에서 엄격한 공간적 제약을 제거하여 캡슐이 복잡한 객체 자세와 변형을 모델링할 수 있도록 하기 위해.
  • 많은 수의 객체 클래스와 인스턴스를 처리할 수 있는 메모리 효율적인 캡슐 아키텍처를 설계하기 위해.
  • 캡슐 네트워크가 단계별 검출 벤치마크에서 CNN과 동등한 성능을 달성할 수 있음을 입증하기 위해.

제안 방법

  • 캡슐을 사용하여 동시 위치 추정 및 분류를 수행하는 단계별 객체 검출 프레임워크인 DeformCaps를 도입한다.
  • 클래스에 관계없이 인스턴스화 파라미터를 클래스별 존재 및 정체성과 분리하는 새로운 캡슐 구조인 SplitCaps를 제안하여 차원을 감소시키고 확장성을 향상시킨다.
  • 반복 루프 없이 자식 캡슐 투영 간의 일치를 최대화하는 Squeeze-and-Excitation를 영감으로 얻은 동적 라우팅 알고리즘인 SE-Routing을 설계한다.
  • 부모 캡슐에서 변형 가능한 샘플링을 사용하여 자식 캡슐에 적응적으로 주목함으로써 고정된 국소 수용 필드를 제거하고 기하학적 민감도를 향상시킨다.
  • 마스크 예측을 위한 재구성 헤드를 포함한 캡슐 기반 헤드를 사용하여 잠재적인 단일 스탑 인스턴스 세그멘테이션을 가능하게 한다.
  • 포즈, 변형, 색조, 텍스처를 캡슐 벡터 표현에 통합하여 부분-전체 관계 모델링 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1캡슐 네트워크는 MS COCO와 같은 대규모 객체 검출 작업에 확장될 수 있는가?
  • RQ2캡슐 기반 아키텍처는 오류 경고를 줄이고 정확도에서 CNN 기반 단계별 검출기와 경쟁하거나 승리할 수 있는가?
  • RQ3변형 가능한 라우팅 메커니즘은 이상한 객체 자세와 시점에 대한 일반화 능력을 향상시킬 수 있는가?
  • RQ4전역 라우팅의 계산 폭발을 피하면서도 표현 능력을 유지할 수 있는가?
  • RQ5SplitCaps와 같은 새로운 캡슐 구조는 이전에 대규모 훈련을 방해했던 차원의 폭발을 제거할 수 있는가?

주요 결과

  • DeformCaps는 MS COCO에서 최신 기술 기반 단계별 CNN 기반 검출기와 동등한 객체 검출 성능을 달성한다.
  • 기본 모델인 CenterNet과 비교해 상당히 적은 오류 경고 검출을 생성한다.
  • 정성적 결과는 이상한 객체 자세와 시점에 대한 일반화 능력 향상이 뚜렷하게 나타나 캡슐의 자세 내성에 이론적 우위가 있음을 뒷받침한다.
  • SplitCaps는 캡슐 표현의 차원을 성공적으로 감소시켜 캡슐 네트워크에서 처음으로 대규모 데이터셋 훈련을 가능하게 했다.
  • SE-Routing은 반복 루프 없이도 효율적인 동적 라우팅을 가능하게 하여 계산 효율성을 향상시키면서도 라우팅 일치를 유지한다.
  • 제안된 프레임워크는 문헌상 처음으로 캡슐 기반 객체 검출 시스템으로, 시각 분야에서 확장 가능한 캡슐 응용을 위한 기초 단계를 마련한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.