[논문 리뷰] R(Det)^2: Randomized Decision Routing for Object Detection
이 논문은 소프트 결정 트리를 결합한 새로운 엔드 투 엔드 객체 검출 프레임워크인 R(Det)²을 제안한다. 이 프레임워크는 라우팅 결정과 예측 값 간의 분리된 구조를 통해 다수의 트리 노드에서 분산된 특징 학습을 가능하게 하며, 기존 검출기와 함께 사용할 경우 MS-COCO에서 1.4–3.6%의 AP 향상을 달성한다.
In the paradigm of object detection, the decision head is an important part, which affects detection performance significantly. Yet how to design a high-performance decision head remains to be an open issue. In this paper, we propose a novel approach to combine decision trees and deep neural networks in an end-to-end learning manner for object detection. First, we disentangle the decision choices and prediction values by plugging soft decision trees into neural networks. To facilitate effective learning, we propose randomized decision routing with node selective and associative losses, which can boost the feature representative learning and network decision simultaneously. Second, we develop the decision head for object detection with narrow branches to generate the routing probabilities and masks, for the purpose of obtaining divergent decisions from different nodes. We name this approach as the randomized decision routing for object detection, abbreviated as R(Det)$^2$. Experiments on MS-COCO dataset demonstrate that R(Det)$^2$ is effective to improve the detection performance. Equipped with existing detectors, it achieves $1.4\sim 3.6$\% AP improvement.
연구 동기 및 목표
- 딥 객체 검출기에서 단일 노드 기반 라우팅 결정 헤드의 한계를 해결하기 위해, 특징 탐색과 성능 향상을 제약하는 요소를 제거하고자 한다.
- 라우팅 결정과 예측 값을 분리함으로써 일반화 능력을 향상시킬 수 있는 학습 가능한 트리 기반 결정 메커니즘을 설계하고자 한다.
- 엔드 투 엔드 훈련을 통해 소프트 결정 트리를 활용한 다중 노드 및 분산된 결정 메커니즘을 객체 검출에 도입하고자 한다.
- 특징 표현과 결정의 다양성을 향상시킴으로써, 특히 큰 객체에 대해 검출 정확도를 향상시키고자 한다.
제안 방법
- 객체 검출기의 결정 헤드에 소프트 결정 트리를 통합하여 라우팅 결정과 예측 값을 분리한다.
- 좁은 브랜치를 통해 라우팅 확률을 생성하고, 넓은 브랜치를 통해 노드 수준의 라우팅 마스크를 생성함으로써 무작위 라우팅을 구현한다.
- 다양한 특징 탐색을 노드 간에 유도하기 위해 노드 선택 기반 손실을 도입하고, 예측을 정답 타겟과 일치시키기 위해 연관성 기반 손실을 제안한다.
- 딥 네ural 네트워크와 소프트 결정 트리 구성 요소를 동시에 최적화하기 위해 엔드 투 엔드 훈련을 구현한다.
- 최종 예측은 라우팅 확률에 기반한 노드 출력의 가중 평균으로 구성되는 트리 구조를 사용한다.
- 기존의 일단계 및 이단계 검출기(예: Faster R-CNN, Cascade R-CNN)에 최소한의 아키텍처 수정으로 적용 가능하다.
실험 결과
연구 질문
- RQ1다중 노드 라우팅을 갖는 트리 기반 결정 헤드가 기존의 단일 노드 헤드보다 객체 검출 성능을 향상시킬 수 있는가?
- RQ2소프트 결정 트리를 딥 네ural 네트워크에 효과적으로 통합하여 객체 검출에서 엔드 투 엔드 훈련을 수행할 수 있는가?
- RQ3노드 선택 기반 및 연관성 기반 손실을 갖는 무작위 라우팅이 특징 표현과 결정의 다양성을 향상시키는가?
- RQ4R(Det)²은 다양한 객체 크기와 백본 아키텍처에서 검출 정확도를 어느 정도 향상시키는가?
주요 결과
- Faster R-CNN 및 Cascade R-CNN와 같은 기존 검출기에 R(Det)²을 통합할 경우, MS-COCO에서 1.4–3.6%의 AP 향상을 달성한다.
- 12 에포크 훈련을 통해 ResNeXt-101-DCN을 사용할 경우 R(Det)²은 COCO에서 50.0% AP를 달성하며, Faster R-CNN 및 Cascade R-CNN를 초월한다.
- 동일한 백본에서 24 에포크 및 테스트 시점 증강을 적용했을 경우 R(Det)²은 54.1% AP와 72.4% AP₅₀를 기록하며, DyHead보다 AP₅₀에서 0.3% 향상되고 APₗ에서 1.0% 향상된다.
- Swin-L을 백본으로 사용할 경우, 다중 스케일 테스트와 12 에포크 훈련을 통해 R(Det)²은 57.4% AP를 기록하며 다양한 아키텍처 간 강력한 일반화 능력을 보여준다.
- 이 방법은 특히 큰 객체의 검출 정확도를 크게 향상시키며, 결정 헤드 내 특징 활용 능력 향상을 시사한다.
- 제거 실험 결과, 노드 선택 기반 및 연관성 기반 손실을 갖는 무작위 라우팅 전략이 성능 향상에 핵심적인 역할을 한다는 것이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.