[논문 리뷰] Cops-Ref: A new Dataset and Task on Compositional Referring Expression Comprehension
이 논문은 복합적 시각적 추론을 강조하기 위해 여섯 가지 추론 논리(예: 체인, 순서, 부정)를 풍부한 시각적 속성과 조합하는 새로운 표현 엔진을 결합한 새로운 벤치마크 데이터셋 및 작업인 Cops-Ref를 소개한다. 이 작업은 유사한 시각적 특성을 가진 여러 배경 이미지 중에서 대상 객체를 국소화해야 하며, 단순한 도메인 간 정렬에 의한 성공을 최소화한다. 최신 기술 모델을 평가하고 모듈러 하드 마이닝 전략을 제안함에도 불구하고 성능은 여전히 낮아, 시각적 기반 시스템의 더 강력한 추론 능력이 필요하다는 점을 시사한다.
Referring expression comprehension (REF) aims at identifying a particular object in a scene by a natural language expression. It requires joint reasoning over the textual and visual domains to solve the problem. Some popular referring expression datasets, however, fail to provide an ideal test bed for evaluating the reasoning ability of the models, mainly because 1) their expressions typically describe only some simple distinctive properties of the object and 2) their images contain limited distracting information. To bridge the gap, we propose a new dataset for visual reasoning in context of referring expression comprehension with two main features. First, we design a novel expression engine rendering various reasoning logics that can be flexibly combined with rich visual properties to generate expressions with varying compositionality. Second, to better exploit the full reasoning chain embodied in an expression, we propose a new test setting by adding additional distracting images containing objects sharing similar properties with the referent, thus minimising the success rate of reasoning-free cross-domain alignment. We evaluate several state-of-the-art REF models, but find none of them can achieve promising performance. A proposed modular hard mining strategy performs the best but still leaves substantial room for improvement. We hope this new dataset and task can serve as a benchmark for deeper visual reasoning analysis and foster the research on referring expression comprehension.
연구 동기 및 목표
- 기존의 참조 표현 데이터셋이 간단하고 짧은 표현에 의존하며 충분한 배경 이미지가 부족하여 시각적 추론 능력 평가가 열악한 점을 해결하기 위해.
- 풍부한 시각적 속성 위에서 여섯 가지 추론 논리(예: 체인, 순서, 부정)의 유연한 조합을 사용해 구성적 추론을 강조하는 새로운 데이터셋 및 작업인 Cops-Ref를 제안하기 위해.
- 참조 대상 객체와 유사한 시각적 특성을 가진 다수의 배경 이미지를 도입함으로써 데이터셋 편향을 줄이고, 추론 없이도 정렬에 의존한 성능 향상을 최소화하기 위해.
- 기존 최신 기술 모델의 이 새로운 벤치마크에서의 견고성과 현재의 추론 능력 격차를 평가하기 위해.
- 복합적 배경 이미지와 추론 중심의 작업인 Cops-Ref에서 성능 향상을 이끌 수 있는 모듈러 하드 마이닝 전략을 제안하고 검증하기 위해.
제안 방법
- ‘and’, ‘or’, ‘order’, ‘same’, ‘not’, ‘chain’의 여섯 가지 추론 논리와 시각적 속성(예: 객체 카테고리, 위치, 특성, 상호작용)을 조합하여 고도로 구성적인 참조 표현을 생성하는 새로운 표현 엔진을 설계하기 위해.
- GQA에서 가져온 실제 세계 이미지를 사용하여 Cops-Ref 데이터셋을 구축하여 시각적 현실감과 의미적 풍부성을 확보하고, 참조 대상과 유사한 객체 카테고리 및 특성을 가진 다양한 배경 이미지를 통합하기 위해.
- 모델이 참조 대상이 포함된 이미지와 여러 배경 이미지 중에서 정답 이미지를 선택해야 하는 새로운 테스트 설정을 구현하며, 각 배경 이미지는 참조 대상과 다양한 수준의 시각적 유사성을 가짐.
- 두 단계 파이프라인을 사용: 첫 번째 단계에서 검색 모델(SCAN-t2i)을 사용해 후보 이미지를 추출하고, 두 번째 단계에서 MattNet을 사용해 추출된 이미지 내에서 표현을 국소화하기 위해.
- 유사도 기반 모듈러 표현 특성에 따라 하드 음성 예제를 식별하고 우선순위를 정함으로써 복잡한 배경 이미지에서의 일반화 능력을 향상시키는 모듈러 하드 마이닝 전략을 제안하기 위해.
- 다양한 하드 음성 마이닝 전략(무작위, 클래스 기반, 문장 유사도 기반, 모듈 전용)을 비교하는 분석 실험을 수행하여 효과성 평가하기 위해.
실험 결과
연구 질문
- RQ1기존 최신 기술 참조 표현 이해 모델들이 구성적 추론과 복잡한 배경 이미지의 특성을 강조하는 새로운 벤치마크에 일반화될 수 있는가?
- RQ2'order'와 'not'과 같은 추론 논리가 'chain'이나 'and'와 같은 더 복잡한 형태에 비해 성능에 얼마나 기여하는가?
- RQ3표현 길이가 모델 성능에 미치는 영향은 무엇이며, 정보의 풍부성와 추론 복잡성의 균형을 이루는 최적의 길이는 존재하는가?
- RQ4모듈러 하드 마이닝 전략은 Cops-Ref와 같이 복잡한 배경 이미지와 추론 중심의 벤치마크에서 효과적으로 성능 향상을 이끌 수 있는가?
- RQ5유사한 배경 이미지가 포함될 경우, 추론 기반 모델과 추론 없이 정렬에 의존하는 모델 간의 성능 격차는 어떻게 변화하는가?
주요 결과
- 제안된 모듈러 하드 마이닝 전략을 사용한 최고 성능 모델도 Full 케이스에서 33.8%의 정확도에 그쳐, 시각적 추론 능력 향상에 여전히 큰 여건이 있음을 시사한다.
- 'order'와 'not' 추론 형태를 가진 표현이 각각 84.5%와 82.3%의 가장 높은 정확도를 기록했으며, 이는 단순한 추론 트리 구조와 정확한 공간적 또는 배제 기반 논리 덕분일 가능성이 높다.
- 중간 길이의 표현(10~20단어)이 가장 뛰어난 성능을 보였으며, 이는 정보의 충분성과 모델이 과도하게 복잡한 추론에 혼란을 겪는 것을 방지하는 균형을 잘 이루고 있음을 시사한다.
- ‘module-specific’ 하드 마이닝 전략이 다른 모든 전략보다 뛰어난 성능을 보였으며, 특히 Cat&attr 및 Cat&cat 배경 설정에서 효과가 뚜렷했으며, 의미적으로 유사한 음성 예제를 효과적으로 식별함을 입증했다.
- 'random' 및 'sentence-sim' 마이닝 전략은 기준 모델 대비 거의 향상되지 않아, 단순하거나 전역 특성 기반 샘플링은 복잡한 배경 이미지의 구조를 다루기에 부적절하다는 점을 시사한다.
- 최고의 모델조차도 Full 케이스에서 35%의 정확도를 초과하지 못해, 현재의 모델들이 Cops-Ref에서 도입된 구성적 추론과 복잡한 배경 이미지에 대해 충분히 견고하지 않음을 드러냈다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.