Skip to main content
QUICK REVIEW

[논문 리뷰] Boosting Camouflaged Object Detection with Dual-Task Interactive Transformer

Zhengyi Liu, Zhili Zhang|arXiv (Cornell University)|2022. 05. 21.
Visual Attention and Saliency Detection인용 수 7
한 줄 요약

이 논문은 교차 어텐션 메커니즘을 사용하여 은폐된 물체 검출(COD)과 경계 검출을 동시에 최적화하는 이중작업 상호작용 트랜스포머(DTIT)를 제안한다. 객체 및 경계 특징을 상호 간에 쿼리로 간주함으로써, 전역적이고 상호작용적인 어텐션을 통해 특징 정제를 향상시켜 공개된 COD 기준에서 최신 기술 수준의 성능을 달성하며 정확도 향상과 노이즈 억제를 동시에 달성한다.

ABSTRACT

Camouflaged object detection intends to discover the concealed objects hidden in the surroundings. Existing methods follow the bio-inspired framework, which first locates the object and second refines the boundary. We argue that the discovery of camouflaged objects depends on the recurrent search for the object and the boundary. The recurrent processing makes the human tired and helpless, but it is just the advantage of the transformer with global search ability. Therefore, a dual-task interactive transformer is proposed to detect both accurate position of the camouflaged object and its detailed boundary. The boundary feature is considered as Query to improve the camouflaged object detection, and meanwhile the object feature is considered as Query to improve the boundary detection. The camouflaged object detection and the boundary detection are fully interacted by multi-head self-attention. Besides, to obtain the initial object feature and boundary feature, transformer-based backbones are adopted to extract the foreground and background. The foreground is just object, while foreground minus background is considered as boundary. Here, the boundary feature can be obtained from blurry boundary region of the foreground and background. Supervised by the object, the background and the boundary ground truth, the proposed model achieves state-of-the-art performance in public datasets. https://github.com/liuzywen/COD

연구 동기 및 목표

  • 은폐된 물체 검출(COD)에서 생물학적 영감을 받은 이중 단계 검출 프레임워크의 한계를 극복하기 위해 객체 및 경계 특징의 병렬적이고 상호작용적인 학습을 가능하게 한다.
  • 트랜스포머의 전역 수용 영역을 활용하여 객체 위치 추적과 경계 구분을 동시에 정교화함으로써 검출 정확도를 향상시킨다.
  • 전경 및 배경 특징 간의 차이에서 날카운 경계 특징을 추출하는 새로운 경계 생성 전략을 개발하여 모호한 영역에서 경계 세부 정보를 향상시킨다.
  • 객체, 배경 및 경계의 진짜값을 함께 사용한 공동 감독을 통해 더 견고한 특징 학습을 가능하게 하여 뛰어난 성능을 달성한다.
  • 기존의 순차적 정제 방식을 대체하여 이중 작업 간의 상호작용적이고 다중 헤드 자기어텐션을 적용함으로써 기존 COD 모델을 뛰어넘는다.

제안 방법

  • 모델는 객체 특징가 경계 특징을, 반대로 경계 특징이 객체 특징을 쿼리하도록 하는 교차 어텐션을 사용하는 이중작업 상호작용 트랜스포머(DTIT)를 적용하여 이중 방향 특징 정제를 가능하게 한다.
  • 전경 및 배경 특징은 각각 별도의 트랜스포머 기반 백본을 사용하여 추출되며, 경계 특징은 원소별 뺄셈을 통해 생성된다: 경계 = 전경 − 배경.
  • 경계 특징 맵은 객체 검출을 정교화하기 위한 쿼리로 간주되며, 객체 특징 맵은 경계 검출 향상에 쿼리로 기능하여 피드백 루프를 형성한다.
  • 다중 헤드 자기어텐션 메커니즘을 두 작업 전반에 적용하여 장거리 의존성과 전역적 특징 상호작용을 포괄한다.
  • 표준 세그멘테이션 손실 함수를 사용하여 은폐된 물체, 배경 및 경계의 진짜값을 공동 감독으로 사용하여 모델을 훈련시킨다.
  • 전경 및 배경에서 불확실한 영역을 경계 특징으로 재할당함으로써 노이즈 억제 및 경계 세부 정보 향상을 설계한다.

실험 결과

연구 질문

  • RQ1은폐된 물체 검출에서 전통적인 생물학적 영감을 받은 이중 단계 프레임워크에 비해 객체 검출과 경계 검출 간의 상호작용적 병렬 학습이 우월한 성능을 낼 수 있는가?
  • RQ2객체 및 경계 특징 간의 교차 어텐션은 특징 표현과 세그멘테이션 정확도를 어떻게 향상시키는가?
  • RQ3특히 모호하거나 저대비 영역에서 전경과 배경 특징의 차이에서 효과적으로 경계 특징을 생성할 수 있는가?
  • RQ4객체, 배경 및 경계 진짜값을 공동 감독으로 사용할 경우, 공개 COD 기준에서 일반화 능력과 성능 향상에 기여하는가?
  • RQ5제안된 이중작업 상호작용 트랜스포머는 기존 방법에 비해 노이즈 감소와 경계 세부 정보 향상에 어느 정도 기여하는가?

주요 결과

  • 제안된 이중작업 상호작용 트랜스포머(DTIT)는 CAMO, COD10K, NC4K 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, 각각 $F^{eta}_{\text{F}}$ 값이 0.796, 0.695, 0.792를 기록하였다.
  • DTIT는 CAMO에서 $S_{\text{α}}$ 를 0.857로 향상시켰고, NC4K에서는 0.863을 기록하여 다음으로 우수한 방법보다 F-측정치에서 0.01 이상 높였다.
  • DTIT는 CAMO에서 MAE를 0.050, COD10K에서는 0.034, NC4K에서는 0.041로 줄여 세그멘테이션 오차율이 낮아졌음을 나타낸다.
  • 절단 실험 결과, DTIT에서의 교차 어텐션 상호작용이 초기 또는 후기 융합 전략보다 성능 향상에 뚜렷한 기여를 하며, 완전한 상호작용에서 최고의 지표를 확보함을 확인하였다.
  • 전경에서 배경 특징을 빼는 방식으로 제안된 경계 생성 방법은 특히 복잡한 시나리오와 유사한 질감 영역에서 더 정확하고 세밀한 경계를 생성한다.
  • 시각적 비교 결과, 모델이 노이즈를 효과적으로 억제하고, 일반적으로 기준 방법에서 놓치는 세부 정보(예: 거미 다리)를 향상시킴을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.