[논문 리뷰] Weakly-Supervised Camouflaged Object Detection with Scribble Annotations
이 논문은 픽셀 단위 마스크보다 360배 빠른 표류(annotation)를 사용하는 최초의 약한 감독형 은폐 객체 검출(COD) 프레임워크를 제안한다. 이는 저수준 대비를 향상시키기 위한 국소적 맥락 대비(LCC) 모듈과 객체 부분 간 논리적 의미 관계를 추론하기 위한 논리적 의미 관계(LSR) 모듈을 포함한 새로운 네트워크 아키텍처를 도입하며, 경계 정렬을 향상시키기 위해 일致성 손실 및 특징 유도 손실을 함께 제안한다. 이는 세 가지 벤치마크에서 SOTA 기준으로 MAE 11.0%, S-measure 3.2%, E-measure 2.5%, 가중치 F-measure 4.4% 향상하여 최신 기술 수준을 초월한다.
Existing camouflaged object detection (COD) methods rely heavily on large-scale datasets with pixel-wise annotations. However, due to the ambiguous boundary, annotating camouflage objects pixel-wisely is very time-consuming and labor-intensive, taking ~60mins to label one image. In this paper, we propose the first weakly-supervised COD method, using scribble annotations as supervision. To achieve this, we first relabel 4,040 images in existing camouflaged object datasets with scribbles, which takes ~10s to label one image. As scribble annotations only describe the primary structure of objects without details, for the network to learn to localize the boundaries of camouflaged objects, we propose a novel consistency loss composed of two parts: a cross-view loss to attain reliable consistency over different images, and an inside-view loss to maintain consistency inside a single prediction map. Besides, we observe that humans use semantic information to segment regions near the boundaries of camouflaged objects. Hence, we further propose a feature-guided loss, which includes visual features directly extracted from images and semantically significant features captured by the model. Finally, we propose a novel network for COD via scribble learning on structural information and semantic relations. Our network has two novel modules: the local-context contrasted (LCC) module, which mimics visual inhibition to enhance image contrast/sharpness and expand the scribbles into potential camouflaged regions, and the logical semantic relation (LSR) module, which analyzes the semantic relation to determine the regions representing the camouflaged object. Experimental results show that our model outperforms relevant SOTA methods on three COD benchmarks with an average improvement of 11.0% on MAE, 3.2% on S-measure, 2.5% on E-measure, and 4.4% on weighted F-measure.
연구 동기 및 목표
- 은폐 객체 검출(COD)에서 픽셀 단위 레이블링의 높은 레이블링 비용 문제를 해결하기 위해, 이미지당 약 60분이 소요되는 픽셀 단위 마스크를 대체하고자 한다.
- 희박한 표류(annotation) 레이블링(이미지당 약 10초)을 약한 감독으로 사용할 수 있는지 탐색하고자 한다.
- 기존의 표류(annotation)-기반 방법이 은폐 객체에서 모호한 경계와 복잡한 의미 관계에 대해 실패하는 한계를 극복하고자 한다.
- 희박한 표류(annotation)에서 유도된 구조적 및 의미적 정보를 활용해 검출 정확도를 향상시키기 위해 새로운 네트워크 아키텍처와 손실 함수를 개발하고자 한다.
- 약한 감독형 COD 연구를 위해 표류(annotation)로 레이블링된 4,040장의 이미지를 포함한 새로운 벤치마크 데이터셋 S-COD을 구축하고자 한다.
제안 방법
- 픽셀 단위 마스크 대신 표류(annotation) 레이블링을 사용하는 새로운 약한 감독형 COD 프레임워크를 제안하여, 레이블링 시간을 이미지당 약 60분에서 약 10초로 감소시킨다.
- 두 가지 구성 요소를 포함한 새로운 일치성 손실을 도입한다: 서로 다른 이미지의 증강된 시각 간 예측 일치성을 강제하는 교차 시각 손실과, 단일 예측 맵 내부에서의 일관성을 유지하는 내부 시각 손실.
- 시각적 억제를 모방하여 이미지 대비를 향상시키고, 낮은 수준의 구조적 차이를 강조함으로써 표류(annotation)를 잠재적인 은폐 영역으로 확장하는 국소적 맥락 대비(LCC) 모듈을 설계한다.
- 객체 부분 간 관계(예: 꽃잎과 줄기)를 분석하여 학습된 고수준 의미 정보를 활용해 최종 예측을 정밀하게 보정하는 논리적 의미 관계(LSR) 모듈을 개발한다.
- 수동으로 추출한 시각적 특징(예: 색상, 질감)과 모델이 학습한 의미 특징을 조합하여 네트워크가 숨겨진 전경 객체를 탐지하도록 유도하는 특징 유도 손실을 제안한다.
- COD10K에서 3,040장, CAMO에서 1,000장을 포함하는 총 4,040장의 이미지로 구성된 새로운 데이터셋 S-COD를 구축하여 약한 감독형 COD 학습을 지원한다.
실험 결과
연구 질문
- RQ1픽셀 단위 마스크보다 훨씬 빠르게 생성 가능한 표류(annotation) 레이블링이 은폐 객체 검출에 효과적인 약한 감독으로 기능할 수 있는가?
- RQ2희박한 표류(annotation) 레이블링만으로도 객체 경계를 정확하게 학습할 수 있는 딥 러닝 모델은 어떻게 설계할 수 있는가?
- RQ3제한된 표류(annotation) 감독만 존재할 때, 예측 일관성을 강제하고 의미 추론을 유도하는 데 가장 효과적인 손실 함수는 무엇인가?
- RQ4낮은 수준의 대비와 고수준의 의미 관계를 얼마나 잘 활용할 수 있는가? 이는 배경과 시각적으로 구분되지 않는 은폐 객체를 탐지하는 데 어떤 영향을 미치는가?
- RQ5표류(annotation)를 기반으로 훈련된 약한 감독 모델이 도전적인 COD 환경에서 완전 감독 SOTA 모델을 능가할 수 있는가?
주요 결과
- 제안된 방법은 세 가지 COD 벤치마크에서 SOTA 기준으로 평균 MAE 11.0% 향상, S-measure 3.2%, E-measure 2.5%, 가중치 F-measure 4.4% 향상하여 최신 기술 수준을 초월한다.
- 제거 실험을 통해 일치성 손실 및 특징 유도 손실이 성능 향상에 크게 기여하는 것으로 확인되었으며, LCC + LSR + 두 손실 함수를 모두 포함한 전체 모델이 개별 구성 요소보다 뛰어난 성능을 보였다.
- LCC 모듈은 낮은 수준의 대비를 향상시켜 표류(annotation)를 잠재적인 은폐 영역으로 효과적으로 확장하며, 특히 미세한 질감 차이가 있는 영역에서 유의미한 성능 향상을 보였다.
- LSR 모듈은 객체 부분 간 논리적 의미 관계를 분석함으로써 경계 정렬 성능을 향상시켜, 복잡한 환경에서의 오진 억제에 기여하였다.
- 교차 시각 및 내부 시각 정규화를 조합한 일치성 손실은 훈련을 안정화시키고 일반화 성능을 향상시켰으며, 특히 모호하고 혼잡한 배경에서 뛰어난 성능을 발휘하였다.
- 완전 감독 SOTA 모델과 경쟁 가능한 성능을 달성하여, 표류(annotation)를 기반으로 한 약한 감독 학습이 COD에 매우 효과적일 수 있음을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.