[논문 리뷰] Stacked Hybrid-Attention and Group Collaborative Learning for Unbiased Scene Graph Generation
이 논문은 시각-언어 모달리티 간 융합 부족과 시나리오 그래프 생성에서의 편향된 관계 예측 문제를 해결하기 위해 새로운 스택드 하이브리드 어텐션(Sha) 인코더와 그룹 공동 학습(GCL) 디코더를 제안한다. 시각-언어적 상호작용을 향상시키기 위해 자기어텐션(SA)과 교차어텐션(CA) 유닛을 다중 레이어에 걸쳐 스택하고, 학습 인스턴스 빈도 기반으로 균형 잡힌 그룹으로 나누어진 그룹-증분형 분류기 설정과 병렬 최적화 및 지식 정착을 통해, VG와 GQA에서 새로운 최고 성능을 달성하며, 비편향 평가 지표에서 기존 방법 대비 거의 두 배의 성능 향상을 이룬다.
Scene Graph Generation, which generally follows a regular encoder-decoder pipeline, aims to first encode the visual contents within the given image and then parse them into a compact summary graph. Existing SGG approaches generally not only neglect the insufficient modality fusion between vision and language, but also fail to provide informative predicates due to the biased relationship predictions, leading SGG far from practical. Towards this end, in this paper, we first present a novel Stacked Hybrid-Attention network, which facilitates the intra-modal refinement as well as the inter-modal interaction, to serve as the encoder. We then devise an innovative Group Collaborative Learning strategy to optimize the decoder. Particularly, based upon the observation that the recognition capability of one classifier is limited towards an extremely unbalanced dataset, we first deploy a group of classifiers that are expert in distinguishing different subsets of classes, and then cooperatively optimize them from two aspects to promote the unbiased SGG. Experiments conducted on VG and GQA datasets demonstrate that, we not only establish a new state-of-the-art in the unbiased metric, but also nearly double the performance compared with two baselines.
연구 동기 및 목표
- 기존 시나리오 그래프 생성(SGG) 모델에서 시각과 언어 간의 제한된 모달리티 융합이 정확한 관계 예측을 저해한다는 문제를 해결한다.
- 장꼬리 분포를 가진 술어 분포로 인해 발생하는 관계 예측 편향을 극복한다. 특히 헤드 술어는 지배하고 꼬리 술어는 부족하게 표현된다.
- 모델에 종속되지 않는 탈편향 전략을 개발하여, 특히 희귀 술어 클래스에 대해 일반화 능력을 향상시킨다.
- 엔코더 표현 향상과 디코더 의사결정 강화를 통해 후속 시각-언어 작업에 더 정보가 풍부하고 균형 잡힌 시나리오 그래프를 제공한다.
제안 방법
- 자기어텐션(SA)을 이용한 내모달리티 정제와 교차어텐션(CA)을 이용한 간모달리티 상호작용을 통합한 스택드 하이브리드 어텐션(SHA) 네트워크를 제안하며, 다중 레이어에 걸쳐 스택하여 특징 표현을 향상시킨다.
- 학습 인스턴스 빈도 기반으로 극도로 불균형한 술어 집합을 상대적으로 균형 잡힌 그룹으로 나누는 그룹 공동 학습(GCL) 전략을 설계한다.
- 각 분류기가 부분 집합의 술어만을 학습하고 이전 분류 공간을 점진적으로 확장하는 그룹-증분형 분류 공간을 구현한다.
- 각 분류기의 학습 데이터를 균형 잡기 위해 중앙값 재표본화(Median Re-Sampling)를 도입하여 희귀 술어에서의 일반화 능력을 향상시킨다.
- 공유된 기울기 집합을 통한 동시 최적화를 통해 모든 분류기를 공동으로 최적화하는 병렬 분류기 최적화(PCO)를 적용하며, 이는 훈련 안정화를 위한 약한 제약 조건으로 작용한다.
- 이전 분류기에서 이후 분류기로 지식을 이전하는 공동 지식 정착(CKD)을 개발하여 강력한 제약 조건을 강제함으로써 분류 능력을 유지하고 헤드 클래스 과적합을 줄인다.

실험 결과
연구 질문
- RQ1스택드 하이브리드 어텐션 메커니즘이 시나리오 그래프 생성에서 시각적 및 언어적 특징 간의 모달리티 융합을 효과적으로 향상시킬 수 있는가?
- RQ2빈도 기반으로 술어를 그룹화하고 균형 잡힌 부분집합에서 전문화된 분류기를 학습시키는 것이 장꼬리 데이터로 인한 관계 예측 편향을 완화하는가?
- RQ3다중 분류기 간의 공동 최적화 및 지식 정착이 헤드 클래스와 꼬리 클래스 모두에서 성능 향상을 동시에 달성할 수 있는가?
- RQ4제안된 GCL 전략이 비편향 평가 지표에서 표준 및 탈편향 기반 방법보다 얼마나 뛰어나게 성능을 발휘하는가?
주요 결과
- 제안된 SHA+GCL 모델은 VG150 데이터셋에서 새로운 최고 성능을 달성하였으며, PredCls에서 mR@50/100이 각각 41.6/44.0로 이전 방법보다 뚜렷이 뛰어나다.
- 제거 실험 결과, GCL 제거 시 성능이 18.8/20.5 mR@50/100으로 떨어지며, 이는 GCL가 기준선 대비 성능을 거의 두 배로 높인다는 것을 확인한다.
- CKD 제거 시 헤드 클래스 성능에 뚜렷한 하락이 발생하지만, CKD 적용 시 꼬리 클래스 예측 성능이 유지됨을 확인하여 지식 정착의 효과를 입증한다.
- SHA에서 CA 또는 SA 유닛을 제거할 경우 성능에 심각한 하락이 발생함을 확인하여, 내모달리티 및 간모달리티 어텐션 모두가 정확한 예측에 필수적임을 입증한다.
- 최적의 설정은 μ=4이며, 탑다운 지식 매칭 전략을 사용할 경우 모든 지표에서 최고의 종합 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.