Skip to main content
QUICK REVIEW

[논문 리뷰] Referring Camouflaged Object Detection

Xuying Zhang, Bowen Yin|arXiv (Cornell University)|2023. 06. 13.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

이 논문은 유의미한 참조 이미지를 가이던스로 사용하여 특정 가림막된 물체를 분할하는 새로운 작업인 참조 가림막 물체 검출(Ref-COD)을 제안한다. 실제 7,000장의 이미지로 구성된 R2C7K 데이터셋과 참조 마스크 생성 및 참조 특징 강화 모듈을 갖춘 이중 분지형 R2CNet 프레임워크를 도입하여, 높은 정확도와 강건성을 갖춘 표적 가림막 물체 식별 성능을 달성한다.

ABSTRACT

We consider the problem of referring camouflaged object detection (Ref-COD), a new task that aims to segment specified camouflaged objects based on a small set of referring images with salient target objects. We first assemble a large-scale dataset, called R2C7K, which consists of 7K images covering 64 object categories in real-world scenarios. Then, we develop a simple but strong dual-branch framework, dubbed R2CNet, with a reference branch embedding the common representations of target objects from referring images and a segmentation branch identifying and segmenting camouflaged objects under the guidance of the common representations. In particular, we design a Referring Mask Generation module to generate pixel-level prior mask and a Referring Feature Enrichment module to enhance the capability of identifying specified camouflaged objects. Extensive experiments show the superiority of our Ref-COD methods over their COD counterparts in segmenting specified camouflaged objects and identifying the main body of target objects. Our code and dataset are publicly available at https://github.com/zhangxuying1004/RefCOD.

연구 동기 및 목표

  • 표준 가림막 물체 검출(COD)은 구분 없이 모든 가림막 물체를 검출하는 데 한계가 있기 때문에, 특정로 지정된 가림막 물체만 식별하는 새로운 작업을 도입함으로써 이를 해결하고자 한다.
  • 복잡한 환경에서 여러 개의 가림막 물체가 존재하고 배경과 시각적으로 유사한 경우에도 정확한 표적 가림막 물체 분할을 가능하게 하고자 한다.
  • 비용이 많이 들거나 수동으로 작성된 텍스트 레이블이 아닌, 쉽게 확보할 수 있는 유의미한 물체 이미지를 參조로 사용하여 실제 환경에서의 검출를 유도하고자 한다.
  • 일반적인 표현을 활용하여 분할 정확도와 강건성을 향상시키는 확장 가능하고 효과적인 딥 러닝 프레임워크를 개발하고자 한다.

제안 방법

  • 참조 이미지에 포함된 유의미한 물체에서 공통 표현을 추출하는 참조 분지와, 이러한 표현을 사용하여 가림막 물체를 식별하는 분할 분지로 구성된 이중 분지형 R2CNet 프레임워크를 제안한다.
  • 참조 마스크 생성(RMG) 모듈을 도입하여 참조 특징과 분할 특징 간의 밀도 높은 픽셀 단위 비교를 수행하여 픽셀 수준의 참조 사전 마스크를 생성한다.
  • 유의미한 물체의 외관과 대상 이미지의 가림막 물체 간의 외관 차이를 줄이기 위해 이중 소스 정보 융합 전략을 활용한다.
  • 참조 마스크에 의해 유도되는 다중 스케일 특징 상호작용을 가능하게 하는 참조 특징 강화(RFE) 모듈을 설계하여 표적 물체의 특징 분별력을 향상시킨다.
  • 분할 분지에서 다중 스케일 특징 융합을 활용하여 특징 표현과 국소화 정확도를 향상시킨다.
  • 지표 마스크를 사용하여 지도 학습을 수행하며, 지표(annotation)를 기반으로 특징를 마스킹하고 풀링하여 공통 표현을 학습한다.

실험 결과

연구 질문

  • RQ1유의미한 물체를 포함한 참조 이미지가 복잡하고 혼잡한 환경에서 특정 가림막 물체의 분할을 효과적으로 유도할 수 있는가?
  • RQ2참조 이미지에서 유도된 공통 표현을 사용할 경우, 표준 COD에 비해 가림막 물체 검출의 정확도와 강건성이 얼마나 향상되는가?
  • RQ3픽셀 수준의 참조 사전과 특징 강화 메커니즘이 표적 가림막 물체를 유사한 배경 물체와 구분하는 데 모델 능력을 얼마나 향상시키는가?
  • RQ4비용이 많이 들지 않는 레이블이 필요 없는 단순하지만 효과적인 이중 분지 아키텍처가 기존 COD 방법보다 특정 가림막 물체 식별에서 뛰어난 성능을 낼 수 있는가?

주요 결과

  • R2CNet 프레임워크는 다수의 가림막 물체가 존재하고 배경과 유사한 환경에서도 표준 COD 모델에 비해 훨씬 뛰어난 성능을 보이며 특정 가림막 물체를 분할한다.
  • 시각적 주의 맵 분석 결과, 참조 이미지를 사용할 경우 R2CNet이 표적 가림막 물체에 더 정확하게 집중하며, 유사한 비표적 물체의 간섭을 줄인다.
  • 텍스트나 세부 레이블이 없는 유의미한 물체 참조만을 사용하더라도, 대규모 사전 학습 모델을 사용한 텍스트 기반 참조 방법보다 더 뛰어난 성능을 달성한다.
  • 제거 실험 결과, RMG 및 RFE 모듈이 성능 향상에 필수적임을 확인하였으며, RMG 모듈은 국소화 정확도 향상에 기여하고 RFE 모듈은 특징 분별력을 강화한다.
  • R2C7K 데이터셋은 64개 카테고리에 걸쳐 실제 7,000장의 이미지를 포함하여 Ref-COD 방법의 대규모 및 다양한 벤치마크 평가를 가능하게 한다.
  • 저대비 가림막 물체(예: 고양이, 클라운피쉬)와 같은 어려운 케이스에서도 기준 모델이 실패하는 상황에서도 모델의 강력한 일반화 능력을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.