Skip to main content
QUICK REVIEW

[논문 리뷰] Fine-Grained Scene Graph Generation with Data Transfer

Ao Zhang, Yuan Yao|arXiv (Cornell University)|2022. 03. 22.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 세분화된 시나리오 그래프 생성을 위한 플러그 앤 플레이 데이터 전이 프레임워크인 IETrans를 제안한다. 이는 내부 전이(일반적 술어를 정보성 높은 것으로 재라벨링)와 외부 전이(NA 샘플에서 누락된 애너테이션을 재라벨링)를 통해 장꼬리 분포 문제와 의미 모호성 문제를 완화한다. 이 방법은 VG-50 벤치마크에서 매크로 F1 성능을 두 배로 높이고, 새로운 1,807개 클래스 벤치마크(VG-1800)에서 SOTA 성능을 달성하여 모델의 일반화 능력과 정보성 향상을 크게 향상시킨다.

ABSTRACT

Scene graph generation (SGG) is designed to extract (subject, predicate, object) triplets in images. Recent works have made a steady progress on SGG, and provide useful tools for high-level vision and language understanding. However, due to the data distribution problems including long-tail distribution and semantic ambiguity, the predictions of current SGG models tend to collapse to several frequent but uninformative predicates (e.g., on, at), which limits practical application of these models in downstream tasks. To deal with the problems above, we propose a novel Internal and External Data Transfer (IETrans) method, which can be applied in a plug-and-play fashion and expanded to large SGG with 1,807 predicate classes. Our IETrans tries to relieve the data distribution problem by automatically creating an enhanced dataset that provides more sufficient and coherent annotations for all predicates. By training on the enhanced dataset, a Neural Motif model doubles the macro performance while maintaining competitive micro performance. The code and data are publicly available at https://github.com/waxnkw/IETrans-SGG.pytorch.

연구 동기 및 목표

  • 대부분의 술어 클래스에 매우 적은 학습 샘플이 존재하는 시나리오 그래프 생성의 장꼬리 분포 문제를 해결한다.
  • 애너테이터가 일반적 술어(예: 'on')를 정보성 높은 술어(예: 'riding')보다 선호함으로써 발생하는 의미 모호성 문제를 해결한다. 이는 모델 붕괴를 유발한다.
  • 희귀하고 정보성 높은 관계에 대해 세분화된 술어 분류에서의 모델 일반화 능력과 매크로 성능 향상을 개선한다.
  • 1,800개 이상의 술어 클래스를 포함한 대규모 SGG에 적용 가능한 확장 가능한, 모델에 종속되지 않는 데이터 증강 방법을 개발한다.
  • 모든 술어에 대해 최소 5개의 테스트 샘플이 확보된 안정적인 평가를 보장하기 위해 수작업으로 정제된 신뢰할 수 있는 벤치마크(VG-1800)를 구축한다.

제안 방법

  • 내부 전이는 혼동 행렬을 사용하여 일반적-정보성 술어 쌍을 식별하고, 인스턴스 수준에서 일반적 술어에서 정보성 높은 술어로 삼중항 애너테이션을 전이한다.
  • 외부 전이는 모델 점수 기반 순위를 활용해 NA(부정 또는 미애너테이션) 샘플에서 누락된 양성 관계를 식별하고, 이를 정보성 높은 술어로 재라벨링한다.
  • 이 방법은 아키텍처 변경 없이도 Neural Motif와 같은 다양한 기본 모델과 호환되는 플러그 앤 플레이 방식으로 작동한다.
  • 하이퍼파라미터 $k_I$는 내부 전이를 위한 일반 술어 비율을 제어하며, $k_E$는 외부로 재라벨링할 상위-$k_E$개의 NA 샘플을 제어한다.
  • 기존 애너테이션과 전이 및 재라벨링된 관계를 결합하여 새로운 데이터셋을 구성함으로써 데이터 분포와 일관성을 향상시킨다.
  • 프레임워크는 표준 VG-50 벤치마크와 1,807개의 술어 클래스를 가진 더 도전적인 신규 제안된 VG-1800 벤치마크에서 평가된다.

실험 결과

연구 질문

  • RQ1일반적 술어에서 정보성 높은 술어로의 내부 데이터 전이가 의미 모호성으로 인한 모델 붕괴를 줄일 수 있는가?
  • RQ2NA 샘플에서의 외부 데이터 전이가 자원이 부족한 꼬리 술어 클래스에서 성능 향상에 기여하는가?
  • RQ3내부 및 외부 전이를 결합할 경우 개별 모듈 대비 매크로 F1 및 정확도에서 얼마나 더 높은 성능을 내는가?
  • RQ41,807개의 술어 클래스를 포함한 대규모 SGG 환경에서 제안된 방법이 어떻게 확장되며, 성능 안정성을 유지하는가?
  • RQ5IETrans가 생성한 개선된 데이터셋은 시각적 해상도와 의미 정확성을 유지하면서도 모델의 일반화 능력을 향상시키는가?

주요 결과

  • IETrans는 VG-50 벤치마크에서 Neural Motif 모델의 mR@100 성능을 두 배로 높이며, 모델에 종속되지 않는 방법 중 SOTA 성능을 달성한다.
  • 1,807개의 술어 클래스를 가진 새로운 VG-1800 벤치마크에서 IETrans는 467개의 카테고리에서 정확한 예측을 가능하게 하여 모든 베이스라인을 압도한다.
  • 제거 실험 결과, 내부 및 외부 전이를 결합한 경우 최고의 mAcc를 기록하며, 내부 전이만 수행해도 성능 향상이 뚜렷하지만, 외부 전이가 추가로 성능 향상을 이끌어낸다.
  • 내부 전이의 최적의 $k_I$는 80%이며, 이를 초과하면 모호하거나 잘못된 관계의 과다 전이로 인해 성능이 저하된다.
  • 외부 전이에서는 모델 신뢰도 순으로 정렬한 NA 샘플의 마지막 10%를 재라벨링할 때 급격한 성능 향상이 나타나, 높은 품질의 누락 관계가 신뢰도 분포의 꼬리 부분에 자주 존재함을 시사한다.
  • 시각화 결과는 IETrans가 이미지의 해상도를 유지하면서도 더 정보성 높고 의미적으로 정확한 관계(예: 'on' 대신 'sewn onto')를 생성함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.