[논문 리뷰] The Devil is in the Labels: Noisy Label Correction for Robust Scene Graph Generation
이 논문은 시나리오 그래프 생성(SGG)을 위한 모델에 종속되지 않는 노이즈 레이블 보정 프레임워크인 NICE를 제안한다. NICE는 분포 외 탐지, 군집 기반 양성 샘플 필터링, 가중치 KNN을 활용하여 공통적 오류, 동의어 랜덤 오류, 부정 오류의 세 가지 유형의 애너테이션 노이즈를 탐지하고 보정한다. NICE는 노이즈 레이블을 정제함으로써 다양한 백본과 벤치마크에서 SGG 성능을 크게 향상시키며, mR@K 및 R@K에서 최신 기준 성능을 달성한다.
Unbiased SGG has achieved significant progress over recent years. However, almost all existing SGG models have overlooked the ground-truth annotation qualities of prevailing SGG datasets, i.e., they always assume: 1) all the manually annotated positive samples are equally correct; 2) all the un-annotated negative samples are absolutely background. In this paper, we argue that both assumptions are inapplicable to SGG: there are numerous "noisy" groundtruth predicate labels that break these two assumptions, and these noisy samples actually harm the training of unbiased SGG models. To this end, we propose a novel model-agnostic NoIsy label CorrEction strategy for SGG: NICE. NICE can not only detect noisy samples but also reassign more high-quality predicate labels to them. After the NICE training, we can obtain a cleaner version of SGG dataset for model training. Specifically, NICE consists of three components: negative Noisy Sample Detection (Neg-NSD), positive NSD (Pos-NSD), and Noisy Sample Correction (NSC). Firstly, in Neg-NSD, we formulate this task as an out-of-distribution detection problem, and assign pseudo labels to all detected noisy negative samples. Then, in Pos-NSD, we use a clustering-based algorithm to divide all positive samples into multiple sets, and treat the samples in the noisiest set as noisy positive samples. Lastly, in NSC, we use a simple but effective weighted KNN to reassign new predicate labels to noisy positive samples. Extensive results on different backbones and tasks have attested to the effectiveness and generalization abilities of each component of NICE.
연구 동기 및 목표
- SGG 데이터셋에서 간과된 노이즈가 있는 참값 애너테이션 문제를 해결하기 위해, 모든 양성 레이블이 올바르고 모든 애너테이션되지 않은 부정 레이블이 배경임을 전제로 하는 두 가지 일반적인 가정을 위반한다.
- 공통적 오류(세부적인 술어에 비해 거시적인 술어 사용), 동의어 랜덤 오류(일관되지 않은 동의어 선택), 부정 오류(배경이 아닌 잘못된 부정 레이블)의 세 가지 유형의 애너테이션 노이즈를 식별하고 보정한다.
- 모델 재학습이나 아키텍처 변경 없이도 훈련 데이터 품질을 향상시킬 수 있는 모델에 종속되지 않는 프레임워크를 개발한다.
- 노이즈 레이블 정제가 장꼬리 분포를 가진 술어에 특히 유리한 더 강건하고 일반화 능력이 뛰어난 SGG 모델을 얻는 데 기여함을 입증한다.
제안 방법
- Neg-NSD는 노이즈가 있는 부정 샘플 탐지를 분포 외 탐지 문제로 간주하여, 탐지된 이방성 샘플에 의사 레이블을 할당한다.
- Pos-NSD는 의미적 유사도 기반 군집 알고리즘을 사용해 양성 샘플을 군집화하고, 가장 노이즈가 많은 군집을 노이즈가 있는 양성 샘플로 식별한다.
- NSC는 특징 유사도에 기반해 더 고품질의 술어 레이블을 노이즈가 있는 양성 샘플에 재할당하기 위해 가중치 KNN 알고리즘을 활용한다.
- 프레임워크는 세 단계 파이프라인으로 적용된다: 먼저 노이즈가 있는 부정 샘플을 탐지하고, 다음으로 노이즈가 있는 양성 샘플을 필터링한 후, 마지막으로 재할당을 통해 레이블을 보정한다.
- cutoff 거리 $d_c$와 wKNN의 K와 같은 하이퍼파라미터는 헤드, 바디, 테일 술어 카테고리에 맞게 조정되어 성능을 헤드, 바디, 테일 모두에서 균형 있게 유지한다.
- 이 방법은 모델에 종속되지 않으며, NICE로 데이터셋을 사전 처리한 후라면 어떤 SGG 백본에도 적용 가능하다.
실험 결과
연구 질문
- RQ1공통적 오류와 동의어 랜덤 오류와 같은 애너테이션 편향이 SGG 모델의 성능과 일반화 능력에 어떤 영향을 미치는가?
- RQ2분포 외 탐지를 통해 진짜 배경이 아닌 노이즈가 있는 부정 샘플을 효과적으로 식별할 수 있는가?
- RQ3군집 기반 필터링이 노이즈가 있는 샘플을 분리함으로써 양성 샘플의 품질을 얼마나 향상시킬 수 있는가?
- RQ4가중치 KNN을 통해 노이즈가 있는 양성 샘플에 더 정확한 술어 레이블을 재할당할 수 있으며, 이는 최종 성능에 어떤 영향을 미치는가?
- RQ5노이즈 레이블을 보정함으로써 다양한 SGG 모델과 평가 지표에서 일관된 성능 향상이 이루어지는가?
주요 결과
- NICE는 Motifs 및 기타 백본을 포함한 여러 SGG 모델에서 mR@K와 R@K를 크게 향상시켜 강력한 일반화 능력을 입증한다.
- Pos-NSD 구성 요소만으로도 더 적은 수의 청소된 양성 샘플을 사용하여 mR@K를 향상시키며, 노이즈가 있는 양성 샘플이 성능을 떨어뜨린다는 것을 증명한다.
- NSC가 가장 큰 성능 향상을 기록하여, 노이즈가 있는 양성 샘플에 대한 레이블 재할당이 단순한 필터링보다 더 효과적임을 보여준다.
- T-SNE 시각화 결과 NICE가 특징 공간 내 일관성을 감소시키며, 특히 동의어 랜덤 및 공통적 오류 쌍에서 두드러진다.
- 제거 실험 결과 wKNN에서 K=3이 지표 간 최적의 트레이드오프를 제공하며, $d_c$에 대한 (S,M,L) 하이퍼파라미터 설정이 최적의 성능을 낳는다.
- NICE는 배경이 아닌 부정 샘플을 성공적으로 탐지하고 보정하여, ' growing on '과 ' on '과 같은 누락되거나 세부적인 관계를 더 잘 탐지할 수 있도록 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.