Skip to main content
QUICK REVIEW

[논문 리뷰] TRACER: Extreme Attention Guided Salient Object Tracing Network

Min Seok Lee, Woo-Seok Shin|arXiv (Cornell University)|2021. 12. 14.
Visual Attention and Saliency Detection인용 수 15
한 줄 요약

TRACER는 극단적 주의 메커니즘을 통해 성능과 효율성을 향상시키는 새로운 명현 객체 검출 네트워크를 제안한다: 가장자리 정밀화를 위한 마스크된 가장자리 주의, 다중 수준 특징 융합을 위한 유니온 주의, 디코더에서 누락된 객체를 복구하기 위한 객체 주의. 적응형 픽셀별 손실 함수와 선택적 모듈 사용을 통해 계산 비용을 줄이고 정확도를 향상시켜 다섯 가지 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Existing studies on salient object detection (SOD) focus on extracting distinct objects with edge information and aggregating multi-level features to improve SOD performance. To achieve satisfactory performance, the methods employ refined edge information and low multi-level discrepancy. However, both performance gain and computational efficiency cannot be attained, which has motivated us to study the inefficiencies in existing encoder-decoder structures to avoid this trade-off. We propose TRACER, which detects salient objects with explicit edges by incorporating attention guided tracing modules. We employ a masked edge attention module at the end of the first encoder using a fast Fourier transform to propagate the refined edge information to the downstream feature extraction. In the multi-level aggregation phase, the union attention module identifies the complementary channel and important spatial information. To improve the decoder performance and computational efficiency, we minimize the decoder block usage with object attention module. This module extracts undetected objects and edge information from refined channels and spatial representations. Subsequently, we propose an adaptive pixel intensity loss function to deal with the relatively important pixels unlike conventional loss functions which treat all pixels equally. A comparison with 13 existing methods reveals that TRACER achieves state-of-the-art performance on five benchmark datasets. We have released TRACER at https://github.com/Karel911/TRACER.

연구 동기 및 목표

  • 기존 명현 객체 검출(SOD) 방법에서 성능과 계산 효율성 간의 상충 관계를 해결하기 위해.
  • 중복된 주의 및 디코더 블록 사용을 최소화하여 인코더-디코더 아키텍처의 비효율성을 줄이기 위해.
  • 주의 유도 모듈을 사용하여 가장자리 표현과 다중 수준 특징 융합을 향상시키기 위해.
  • 배경 및 중심 객체 영역보다 세밀하고 명시적인 가장자리에 우선순위를 두는 픽셀 적응형 손실 함수를 개발하기 위해.
  • 최소한의 파라미터 및 FLOP 오버헤드로 벤치마크 데이터셋에서 최신 기술 수준 성능을 달성하기 위해.

제안 방법

  • 빠른 푸리에 변환을 사용하는 마스크된 가장자리 주의 모듈을 도입하여 첫 번째 인코더 블록에서 가장자리 특징을 정밀화하고 이를 하류로 전파한다.
  • 다중 수준 융합에서 유니온 주의 모듈을 활용하여 분포의 차이를 줄이고 중요한 채널 및 공간적 특징을 식별한다.
  • 디코더에서 객체 주의 모듈을 사용하여 정밀화된 특징에서 검출되지 않은 객체와 가장자리 세부 정보를 추출하여 디코더 블록 사용을 최소화한다.
  • 명시적인 가장자리 근처 픽셀에 더 높은 가중치를 할당하는 적응형 픽셀 강도 손실 함수를 제안하여 국소화 정확도를 향상시킨다.
  • 핵심 크기 {3, 15, 31}를 사용한 계층적 다중 커널 융합을 손실 함수에 적용하여 구조적 인식 능력과 노이즈 레이블에 대한 강건성을 향상시킨다.
  • 다양한 백본(예: ResNet, DenseNet, Xception)과 통합하여 여러 아키텍처에서의 효과성을 검증한다.

실험 결과

연구 질문

  • RQ1주의 메커니즘을 전략적으로 적용하여 SOD 성능을 향상시키고 계산 비용을 줄일 수 있는가?
  • RQ2파라미터나 FLOP 오버헤드를 증가시키지 않고 얕은 층에서 깊은 층으로 가장자리 특징을 효과적으로 전파할 수 있는가?
  • RQ3다중 수준 특징을 융합하는 최적의 방법은 무엇인가? 분포의 차이를 최소화하고 보완 정보를 강화하는 데 기여하는가?
  • RQ4적응형 픽셀별 손실 함수는 세밀한 가장자리 검출을 향상시키고 배경 노이즈의 영향을 줄일 수 있는가?
  • RQ5손실 함수에 계층적 다중 커널 융합을 적용하면 구조적 인식 능력과 모델의 강건성이 향상되는가?

주요 결과

  • TRACER는 다섯 가지 벤치마크 데이터셋(DUTS-TE, DUT-O, HKU-IS, ECSSD, PASCAL-S)에서 최신 기술 수준 성능을 달성한다.
  • DUTS-TE에서 TRACER는 MaxF 0.936, MAE 0.026, $S_m$ 0.931을 기록하여 13개의 기존 방법을 모두 능가한다.
  • TRACER의 TE4 버전은 오직 8.64 GFLOPs로 MaxF 0.936을 달성하여 높은 효율성을 입증한다.
  • 적응형 픽셀 강도 손실 함수에 세 개의 커널 크기(3, 15, 31)를 사용할 경우 가장 우수한 성능을 기록하며, 단일 또는 双핵심 커널 버전보다 뛰어나다.
  • Xception 기반 TRACER 버전은 25.38 GFLOPs로 MaxF 0.927의 높은 정확도를 기록하여 강력한 성능-효율 균형을 보여준다.
  • 절단 실험 결과 계층적 다중 커널 융합이 구조적 인식 능력 향상과 노이즈 레이블에 대한 강건성 향상에 기여함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.