[논문 리뷰] CoSformer: Detecting Co-Salient Object with Transformers
CoSformer는 입력 순서에 관계없이 상호 이미지 간 관계를 모델링하고, 대비 학습 기반으로 상호 이미지 간 분리성을 향상시켜 안정성과 성능을 향상시키는 Transformer 기반 프레임워크를 제안한다. 자기 주의 메커니즘과 BCE, SSIM, F-measure 손실을 포함한 다중 손실 최적화를 결합하여 CoCA, CoSOD3k, Cosal2015 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.
Co-Salient Object Detection (CoSOD) aims at simulating the human visual system to discover the common and salient objects from a group of relevant images. Recent methods typically develop sophisticated deep learning based models have greatly improved the performance of CoSOD task. But there are still two major drawbacks that need to be further addressed, 1) sub-optimal inter-image relationship modeling; 2) lacking consideration of inter-image separability. In this paper, we propose the Co-Salient Object Detection Transformer (CoSformer) network to capture both salient and common visual patterns from multiple images. By leveraging Transformer architecture, the proposed method address the influence of the input orders and greatly improve the stability of the CoSOD task. We also introduce a novel concept of inter-image separability. We construct a contrast learning scheme to modeling the inter-image separability and learn more discriminative embedding space to distinguish true common objects from noisy objects. Extensive experiments on three challenging benchmarks, i.e., CoCA, CoSOD3k, and Cosal2015, demonstrate that our CoSformer outperforms cutting-edge models and achieves the new state-of-the-art. We hope that CoSformer can motivate future research for more visual co-analysis tasks.
연구 동기 및 목표
- 순차적 모델링에서 입력 이미지 순서 의존성으로 인해 발생하는 기존 CoSOD 방법의 불안정성 문제를 해결하기 위해.
- 공시적 객체와 잡음 간섭 요소 간의 분리성을 향상시키기 위해 상호 이미지 간 분리성 모델링을 통해 진짜 공시적 객체의 구분 능력을 향상시키기 위해.
- 자기 주의 메커니즘을 사용하여 내부 이미지 시각화와 상호 이미지 일관성을 동시에 최적화하는 통합형 엔드 투 엔드 프레임워크를 개발하기 위해.
- BCE, SSIM, F-measure 손실을 적용하여 예측된 시각화 맵의 경계 정확도와 구조적 세부 정보를 향상시키기 위해.
제안 방법
- 순열에 관계없는 방식으로 상호 이미지 간 관계를 모델링하기 위해 새로운 토큰 가로운 학습(TGL) 모듈을 갖춘 Transformer 기반 아키텍처를 사용한다.
- 공시적 영역을 양성 쌍으로, 비공시적 영역을 음성 쌍으로 간주하여 임베딩 공간의 분리성 향상을 위해 대비 학습 손실을 도입한다.
- 이중 브랜치 설계를 사용한다: 하나는 내부 이미지 시각화(픽셀 수준 주의)를 위한 브랜치이고, 다른 하나는 상호 이미지 일관성(이미지 수준 주의)을 위한 브랜치이다.
- BCE, SSIM, F-measure 손실을 다중 작업 감독으로 적용하여 경계 세부 정보를 정교화하고 전체 세그멘테이션 품질을 향상시킨다.
- 순서 불변성을 유지하고 그룹 표현 학습의 불안정성을 방지하기 위해 TGL 모듈에 위치 인코딩을 사용하지 않는다.
- 자기 주의를 활용하여 모든 이미지 간 쌍방향 유사도를 계산함으로써 장거리 의존성 모델링과 안정적인 그룹 표현 학습을 가능하게 한다.
실험 결과
연구 질문
- RQ1Transformer 기반 아키텍처가 다양한 입력 이미지 순서에서 CoSOD 모델의 안정성을 향상시킬 수 있는가?
- RQ2대비 학습을 통해 상호 이미지 간 분리성을 모델링하면 진짜 공시적 객체와 잡음 간섭 요소 간의 분리 능력이 향상되는가?
- RQ3자기 주의를 통해 내부 이미지 시각화와 상호 이미지 일관성을 동시에 최적화하면 더 뛰어난 세그멘테이션 성능을 달성할 수 있는가?
- RQ4보조 손실(SSIM, F-measure)이 공시적 객체 검출에서 경계 정확도 향상에 어느 정도 기여하는가?
주요 결과
- CoSformer는 CoCA, CoSOD3k, Cosal2015 세 가지 주요 벤치마크에서 최신 기술 수준의 성능을 달성하여 기존 방법들을 압도한다.
- 동일한 이미지 그룹에 대해 10가지의 랜덤 입력 순서에서도 일관된 성능을 유지하여 강력한 순서 불변성을 입증한다.
- TGL 모듈에 위치 인코딩을 추가하면 모델이 불안정해지며, 이는 순서 불변성이 위치 인코딩을 배제했을 때에만 유지됨을 확인한다.
- 제거 실험 결과, BCE, SSIM, F-measure 손실을 모두 조합한 경우 BCE 단독 사용보다 더 뛰어난 성능을 보인다.
- RNN 기반(RCAN) 및 CNN 기반(ICNet) 기준 모델과 비교해 CoSformer는 입력 재정렬 상황에서도 훨씬 더 안정적인 추론 성능을 보인다.
- 대비 학습 기반 설계가 실제 복잡한 환경에서 진짜 공시적 객체와 간섭 요소를 효과적으로 분리함을 입증하며, 성능 향상이 확인된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.