[논문 리뷰] NICEST: Noisy Label Correction and Training for Robust Scene Graph Generation
이 논문은 노이즈 있는 레이블을 수정하고 편향 없는 훈련을 가능하게 하는 모델 무관 프레임워크인 NICEST를 제안한다. NICE는 노이즈 있는 샘플을 탐지하고 소프트 레이블을 재할당하며, NIST는 동적 가중치를 적용한 다중 테이처 distillation을 통해 꼬리 술어(category)와 다양한 벤치마크(예: VG-OOD)에서의 일반화 능력을 크게 향상시킨다.
Nearly all existing scene graph generation (SGG) models have overlooked the ground-truth annotation qualities of mainstream SGG datasets, i.e., they assume: 1) all the manually annotated positive samples are equally correct; 2) all the un-annotated negative samples are absolutely background. In this paper, we argue that neither of the assumptions applies to SGG: there are numerous noisy ground-truth predicate labels that break these two assumptions and harm the training of unbiased SGG models. To this end, we propose a novel NoIsy label CorrEction and Sample Training strategy for SGG: NICEST. Specifically, it consists of two parts: NICE and NIST, which rule out these noisy label issues by generating high-quality samples and the effective training strategy, respectively. NICE first detects noisy samples and then reassigns them more high-quality soft predicate labels. NIST is a multi-teacher knowledge distillation based training strategy, which enables the model to learn unbiased fusion knowledge. And a dynamic trade-off weighting strategy in NIST is designed to penalize the bias of different teachers. Due to the model-agnostic nature of both NICE and NIST, our NICEST can be seamlessly incorporated into any SGG architecture to boost its performance on different predicate categories. In addition, to better evaluate the generalization of SGG models, we further propose a new benchmark VG-OOD, by re-organizing the prevalent VG dataset and deliberately making the predicate distributions of the training and test sets as different as possible for each subject-object category pair. This new benchmark helps disentangle the influence of subject-object category based frequency biases. Extensive ablations and results on different backbones and tasks have attested to the effectiveness and generalization ability of each component of NICEST.
연구 동기 및 목표
- 기존 SGG 모델이 모든 지도 레이블이 정확하다고 가정하고, 모든 미레이블링된 관계는 배경임을 전제로 하는 심각한 과시를 해결하기 위해.
- SGG 데이터셋에서 발생하는 세 가지 유형의 노이즈 레이블, 즉 일반화 경향, 동의어 무작위, 부정적 노이즈 관계를 식별하고 수정하기 위해.
- 낮은 빈도의 술어 카테고리에 특히 유용한 일반화 가능하고 강건한 모델을 개발하기 위해.
- 훈련 및 테스트 세트 간 분포 이탈을 최대화하여 모델 일반화 능력을 더 잘 평가할 수 있도록 하는 새로운 벤치마크인 VG-OOD를 제안하기 위해.
제안 방법
- NICE는 두 단계 탐지 방식을 통해 노이즈 있는 샘플을 감지한다: 외부 분포(ood) 탐지 기반의 부정적 노이즈 샘플 탐지(Neg-NSD)와 밀도 기반 클러스터링 기반의 긍정적 노이즈 샘플 탐지(Pos-NSD).
- NICE는 가중치가 부여된 KNN를 사용해 강건한 소프트 술어 레이블을 재할당하여 노이즈 있는 긍정적 샘플을 수정함으로써 하드 레이블을 대체해 편향을 줄인다.
- NIST는 두 가지 다른 테이처 모델을 사용한 다중 테이처 지식 정복을 수행한다: 하나는 헤드 술어에 편향된(고재현율) 모델이고, 다른 하나는 꼬리 술어에 편향되지 않은(고평균 재현율) 모델이다.
- NIST의 동적 트레이드오프 가중 전략은 카테고리 그룹(헤드, 바디, 꼬리)에 따라 손실 기여도를 적응적으로 조정함으로써 편향을 억제하고 지식 융합을 향상시킨다.
- 이 프레임워크는 모델에 관계없이 적용 가능하며, Motifs와 VCTree를 포함한 모든 SGG 아키텍처에 원활하게 통합될 수 있다.
- VG-OOD 벤치마크는 Visual Genome를 재구성하여 훈련 및 테스트 세트 간 술어 분포 이탈을 최대화함으로써 빈도 편향 효과를 분리한다.
실험 결과
연구 질문
- RQ1일반화 경향, 동의어 무작위, 부정적 노이즈 레이블은 SGG 모델 성능과 편향에 어떤 영향을 미치는가?
- RQ2통합된 프레임워크가 SGG 데이터셋에서 여러 유형의 노이즈 레이블을 효과적으로 탐지하고 수정할 수 있는가?
- RQ3동적 가중치를 적용한 다중 테이처 정복은 SGG에서 모델 일반화 능력 향상과 빈도 편향 감소에 기여하는가?
- RQ4제안된 NICEST 프레임워크는 저빈도(꼬리) 술어 카테고리에서 성능을 얼마나 향상시키는가?
- RQ5새로운 VG-OOD 벤치마크는 빈도 편향을 초월한 모델 일반화 능력을 효과적으로 분리하고 평가하는 데 얼마나 효과적인가?
주요 결과
- VCTree를 학생 모델로 사용할 때, NICEST는 VG에서 평균 재현율 45.9%와 VG-OOD에서 40.8%를 기록하여 기준 모델을 크게 능가한다.
- NIST의 그룹 가중 전략이 가장 뛰어난 성능을 보였으며, VG-OOD에서 40.8%의 평균 재현율을 달성하여 헤드와 꼬리 카테고리 학습의 균형을 잘 맞추는 데 효과적임을 입증했다.
- NICE는 이전의 NSC 방법 대비 mR@100을 33.0%에서 33.1%로, R@100을 56.9%에서 58.3%로 향상시켜 정교한 레이블 수정의 효과를 입증했다.
- NIST 정복 전략은 Motifs와 VCTree를 포함한 모든 기준 모델에서 일관되게 성능 향상을 이끌었으며, 강력한 일반화 능력과 보편성을 보였다.
- 정성적 결과에서는 NICEST가 거시적 술어(예: 'near')에 대한 과도한 의존도를 줄이고 세밀하고 정확한 관계(예: 'sitting on') 예측을 향상시킴을 보였다.
- Neg-NSD는 이전에 발견되지 않은 123개의 시각적 관계 카테고리(예: 자전거-자전거 간의 'against')를 성공적으로 탐지하여 꼬리 카테고리의 다양성과 커버리지가 향상됨을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.