[논문 리뷰] Classification-Then-Grounding: Reformulating Video Scene Graphs as Temporal Bipartite Graphs
이 논문은 제안 기반 방법의 한계를 극복하기 위해 비디오 시나리오 그래프 생성(VidSGG)를 위한 새로운 분류-그라운딩 프레임워크를 제안한다. 비디오 시나리오 그래프를 시간적 이분 그래프로 재정의함으로써, 전체 주어-목적어 트랙킷에 대한 술어 분류를 그라운딩 이전에 수행함으로써 고차원 관계를 유지하고 일관성 없는 레이블링을 방지하며 성능을 햖थ한다. 이로 인해 새로운 모델 BIG를 통해 VidOR 및 VidVRD에서 최신 기준 성능을 달성하였다.
Today's VidSGG models are all proposal-based methods, i.e., they first generate numerous paired subject-object snippets as proposals, and then conduct predicate classification for each proposal. In this paper, we argue that this prevalent proposal-based framework has three inherent drawbacks: 1) The ground-truth predicate labels for proposals are partially correct. 2) They break the high-order relations among different predicate instances of a same subject-object pair. 3) VidSGG performance is upper-bounded by the quality of the proposals. To this end, we propose a new classification-then-grounding framework for VidSGG, which can avoid all the three overlooked drawbacks. Meanwhile, under this framework, we reformulate the video scene graphs as temporal bipartite graphs, where the entities and predicates are two types of nodes with time slots, and the edges denote different semantic roles between these nodes. This formulation takes full advantage of our new framework. Accordingly, we further propose a novel BIpartite Graph based SGG model: BIG. It consists of a classification stage and a grounding stage, where the former aims to classify the categories of all the nodes and the edges, and the latter tries to localize the temporal location of each relation instance. Extensive ablations on two VidSGG datasets have attested to the effectiveness of our framework and BIG. Code is available at https://github.com/Dawn-LX/VidSGG-BIG.
연구 동기 및 목표
- 제안 기반 VidSGG 방법의 내재된 결함, 즉 일관성 없는 참조 레이블링, 끊어진 고차원 관계, 제안 품질에 따른 제약를 해결한다.
- 엔티티와 술어를 시간 인식 노드 유형과 의미 롤 간선을 갖는 시간적 이분 그래프로 재정의하여 비디오 시나리오 그래프를 재구성한다.
- 분류 후 그라운딩의 두 단계로 구성된 프레임워크를 개발하여 술어 분류 및 시간적 국소화 정확도를 향상시킨다.
- 동일한 주어-목적어 쌍에 대해 다수의 술어 인스턴스가 존재할 경우 다중 인스턴스 그라운딩을 가능하게 하여 복잡한 비디오 상호작용에 대한 강건성을 향상시킨다.
- 전체 트랙킷 컨텍스트를 활용하고 관계 구조를 유지함으로써 VidOR 및 VidVRD 벤치마크에서 최신 기준 성능을 달성한다.
제안 방법
- 엔티티(주어/목적어)와 술어를 각각 시간 슬롯과 연결된 두 종류의 노드로 갖는 시간적 이분 그래프로 VidSGG를 재정의한다.
- 이분 그래프 내에서 방향성 간선을 사용해 엔티티와 술어 간의 의미 롤을 모델링함으로써 시간적 및 관계적 구조를 포착한다.
- 작업을 두 단계로 분해한다: 첫째, 전역 트랙킷 표현을 사용해 모든 노드 및 간선 카테고리 분류; 둘째, 예측된 관계 인스턴스의 시간 슬롯 국소화.
- 점수 기반 필터링과 시간 기반 NMS를 활용한 다중 인스턴스 그라운딩을 통해 각 관계 트리플릿에 대해 다수의 시간 슬롯을 예측함으로써 강건성을 향상시킨다.
- 분류 및 그라운딩 단계를 별도로 훈련하는 이중 단계 훈련 파이프라인을 적용하며, 최적화된 하이퍼파ram터와 손실 가중치를 사용한다.
- 주어-목적어 쌍 당 다수의 참조 인스턴스를 유지하는 레이블 할당을 적용하였으며, 98.43%의 박스가 오직 하나의 인스턴스만 포함함으로써 이 방법의 적합성을 검증하였다.

실험 결과
연구 질문
- RQ1일관성 없고 부분적인 참조 레이블링을 피함으로써 분류-그라운딩 프레임워크가 제안 기반 VidSGG 방법을 능가할 수 있는가?
- RQ2동일한 주어-목적어 쌍에 대해 다수의 술어 인스턴스가 존재할 때, 비디오 시나리오 그래프를 시간적 이분 그래프로 모델링하면 고차원 관계 모델링에 어떤 영향을 미치는가?
- RQ3VidSGG 성능이 제안 품질에 얼마나 의존하는가? 그리고 제안 없는 분류 단계가 이 상한선을 완화시킬 수 있는가?
- RQ4다중 인스턴스 그라운딩은 동일한 주어-목적어 쌍 간의 다중 동시 또는 순차적 관계를 얼마나 효과적으로 포착하는가?
- RQ5제안된 프레임워크는 VidOR 및 VidVRD와 같은 표준 VidSGG 벤치마크에서 최신 기준 성능을 달성할 수 있는가?
주요 결과
- 제안된 분류-그라운딩 프레임워크는 VidOR 및 VidVRD 양쪽 모두에서 기존 제안 기반 방법보다 뛰어난 일반화 능력과 강건성을 보였다.
- VidOR에서, 이 모델은 이전 방법 대비 평균 mAP에서 1.5%p의 절대적 향상을 기록하여 새로운 최신 기준 성능을 달성함을 입증하였다.
- VidVRD에서는 평균 mAP에서 2.1%p의 절대적 향상을 기록하여 다양한 데이터셋 및 설정에서 일관된 성능 향상을 보였다.
- 절단 실험 결과, 이 프레임워크는 레이블 불일치를 크게 감소시키고 고차원 관계적 맥락을 유지함을 확인하였으며, 이는 제안 기반 방법에서 손실되는 요소이다.
- 다중 인스턴스 그라운딩 메커니즘은 다수의 참조 인스턴스를 가진 술어의 32%를 효과적으로 포착하였고, 레이블 할당 전략은 매우 효과적이었으며, 전체 박스의 1.57%만이 두 개 이상의 인스턴스를 포함함으로써 높은 정확도를 확보하였다.
- 점수 필터링 및 시간 기반 NMS를 포함한 모델의 추론 파이프라인은 예측 신뢰도를 향상시키고, 잘못된 양성 결과를 감소시키며 국소화 정확도를 향상시켰다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.