[논문 리뷰] Hybrid Knowledge Routed Modules for Large-scale Object Detection
HKRM은 영역-영역 그래프를 통해 추론하는 두 가지 지식 주도 모듈(명시적 및 암시적)을 도입하여 대규모 객체 탐지를 개선하고, 속성, 관계 및 공간 지식을 활용하여 VG 및 ADE 데이터셋에서 상당한 이득을 얻습니다.
The dominant object detection approaches treat the recognition of each region separately and overlook crucial semantic correlations between objects in one scene. This paradigm leads to substantial performance drop when facing heavy long-tail problems, where very few samples are available for rare classes and plenty of confusing categories exists. We exploit diverse human commonsense knowledge for reasoning over large-scale object categories and reaching semantic coherency within one image. Particularly, we present Hybrid Knowledge Routed Modules (HKRM) that incorporates the reasoning routed by two kinds of knowledge forms: an explicit knowledge module for structured constraints that are summarized with linguistic knowledge (e.g. shared attributes, relationships) about concepts; and an implicit knowledge module that depicts some implicit constraints (e.g. common spatial layouts). By functioning over a region-to-region graph, both modules can be individualized and adapted to coordinate with visual patterns in each image, guided by specific knowledge forms. HKRM are light-weight, general-purpose and extensible by easily incorporating multiple knowledge to endow any detection networks the ability of global semantic reasoning. Experiments on large-scale object detection benchmarks show HKRM obtains around 34.5% improvement on VisualGenome (1000 categories) and 30.4% on ADE in terms of mAP. Codes and trained model can be found in https://github.com/chanyn/HKRM.
연구 동기 및 목표
- 대규모 라벨 공간과 긴 꼬리 분포에서도 상식 지식을 활용하여 견고한 객체 탐지를 달성합니다.
- 지역 제안에 대한 글로벌 의미론적 추론을 가능하게 하는 가볍고 플러그인형 모듈을 개발합니다.
- 명시적 지식(속성, 관계)과 암시적 지식(공간/레이아웃) 형태를 탐색하여 추론을 안내합니다.
- 지식 인지 그래프를 통합함으로써 가려짐, 작은 객체, 희귀 카테고리에서 탐지가 향상되는 것을 입증합니다.
제안 방법
- 명시적 모듈(언어적 유도 제약)과 암시적 모듈(공간 레이아웃과 같은 비라벨 제약)을 정의합니다.
- 지식 형태별 적응형 영역-영역 그래프를 구성하고 외부 지식 그래프 Q에 조건부로 학습된 MLP를 통해 엣지를 학습합니다.
- 명시적 모듈: e_ij = MLP_Q(alpha(f_i, f_j))로 학습하고 Q의 실제 클래스 관계로 감독; 정규화된 엣지 가중치를 사용해 특징을 전파하여 f'를 얻고 이를 탐지용으로 연결합니다.
- 암시적 모듈: 다중 영역 그래프를 학습하여 암시적 공간 제약을 포착하기 위해 MLP를 사용합니다; 공유 변환 W_g로 그래프를 결합하여 g'를 생성합니다.
- 세 모듈의 출력을 모두 결합(f'_a, f'_r, g')을 경계 상자 회귀 및 분류 계층에 입력하여 최종 결과를 얻습니다.
- HKRM을 Faster R-CNN 계열 아키텍처에 연결하고 VG(1000/3000 클래스) 및 ADE에서 평가하여 일반화 가능성을 입증합니다.
실험 결과
연구 질문
- RQ1명시적 및 암시적 지식 모듈이 영역 기반 탐지기에 통합될 때 대규모 객체 탐지의 성능을 개선할 수 있을까요?
- RQ2다른 지식 형태(속성, 관계, 공간 레이아웃)가 특히 희귀 클래스에 대해 탐지 성능에 다르게 기여합니까?
- RQ3외부 지식에 의해 가이드되는 이미지당 적응형 영역 그래프가 바탕의 영역별 예측보다 더 나은 글로벌 추론과 정확성을 이끌어낼 수 있을까요?
- RQ4HKRM이 데이터셋 간에 전이 가능하고 많은 클래스에 확장이 가능한가요?
주요 결과
- HKRM은 Faster R-CNN 기초 대비 큰 mAP 이득을 보이며: VG에서 1000개 카테고리로 약 34.5% 개선, ADE에서 30.4% 개선.
- HKRM은 VG에서 3000개 카테고리로도 26.5% 개선을 달성합니다.
- 명시적 지식(속성/관계)과 암시적 지식(공간) 각각 성능에 기여하며, 결합된 HKRM이 가장 큰 이득을 제공합니다.
- 희귀 카테고리의 경우 HKRM은 눈에 띄는 개선을 보입니다(상위 150개 클래스에서 평균 mAP 약 1.5%).
- PASCAL VOC 및 MS COCO에서 세 가지 지식 모듈 모두를 사용한 HKRM이 기준치보다 향상됩니다(예: VOC: 78.8% mAP vs 75.1% 기준; COCO: 37.8% vs 34.2% ).
- HKRM은 가벼운 편으로(약 2%의 매개변수 추가) 기존 탐지기와 쉽게 통합됩니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.