Skip to main content
QUICK REVIEW

[논문 리뷰] Amodal Segmentation Based on Visible Region Segmentation and Shape Prior

Yuting Xiao, Yanyu Xu|arXiv (Cornell University)|2020. 12. 10.
Advanced Neural Network Applications참고 문헌 41인용 수 6
한 줄 요약

이 논문은 인간의 인지 방식을 모방하기 위해 가시 영역 특징과 카테고리별 형태 사전 지식을 활용하여 가림된 물체 영역을 추론하는 새로운 이모달 세그멘테이션 프레임워크를 제안한다. 교차 작업 어텐션을 사용해 가시 마스크와 이모달 마스크를 정밀하게 보정하고, 형태 사전 지식의 학습된 코드북을 통해 보정 및 후처리를 수행함으로써, 세 가지 데이터셋에서 최신 기술(SOTA) 수준의 성능을 달성하며 다양한 가림 상황에 대해 뛰어난 강건성을 보여준다.

ABSTRACT

Almost all existing amodal segmentation methods make the inferences of occluded regions by using features corresponding to the whole image. This is against the human's amodal perception, where human uses the visible part and the shape prior knowledge of the target to infer the occluded region. To mimic the behavior of human and solve the ambiguity in the learning, we propose a framework, it firstly estimates a coarse visible mask and a coarse amodal mask. Then based on the coarse prediction, our model infers the amodal mask by concentrating on the visible region and utilizing the shape prior in the memory. In this way, features corresponding to background and occlusion can be suppressed for amodal mask estimation. Consequently, the amodal mask would not be affected by what the occlusion is given the same visible regions. The leverage of shape prior makes the amodal mask estimation more robust and reasonable. Our proposed model is evaluated on three datasets. Experiments show that our proposed model outperforms existing state-of-the-art methods. The visualization of shape prior indicates that the category-specific feature in the codebook has certain interpretability.

연구 동기 및 목표

  • 기존의 이모달 세그멘테이션 방법이 전체 이미지 특징에 의존함으로써 다양한 가림 상황에서 일관성 없는 예측을 유도하는 모호함을 해결하기 위해.
  • 가시 영역에 집중하고 형태 사전 지식을 활용하여 보이지 않는 부분을 추론함으로써 인간과 유사한 이모달 인지 방식을 시뮬레이션하기 위해.
  • 어텐션 메커니즘과 형태 사전 지식을 통해 배경과 가림 영향을 분리함으로써 이모달 마스크 추정의 강건성과 정확도를 향상시키기 위해.
  • 이모달 마스크 임베딩의 학습된 코드북을 활용해 형태 사전 지식을 이모달 세그멘테이션에 새로운 방식으로 도입하고, 보정 및 후처리에 활용하기 위해.

제안 방법

  • 프레임워크는 먼저 마스크 R-CNN 기반 백본과 전용 이모달 및 가시 마스크 헤드를 사용하여 굵은 이모달 및 가시 마스크를 예측한다.
  • 교차 작업 어텐션 메커니즘은 굵은 이모달 마스크를 어텐션으로 사용하여 가시 마스크 예측을 정밀하게 보정하며, 가시 영역에 특징을 집중시키고 배경 및 가림 영향을 억제한다.
  • 재분류 정규화기는 전체 이미지 특징 대신 가시 영역 특징을 사용하여 분류를 수행함으로써 가림으로 인한 오분류를 줄인다.
  • 형태 사전 코드북은 이모달 진짜 마스크 임베딩에 대해 K-평균 클러스터링을 수행하여 구성되며, 카테고리별 형태 패턴을 저장한다.
  • 이모달 마스크는 가시 영역 특징과 형태 사전 코드북을 모두 활용하여 보정되며, 추론 과정에서 낮은 품질의 제안을 필터링하는 데 코드북이 사용된다.
  • 이 방법은 두 단계 보정을 적용한다: 먼저 이모달 마스크 어텐션을 사용해 가시 마스크를 보정하고, 그 다음에 보정된 가시 마스크를 어텐션으로 사용해 이모달 마스크를 보정한다.

실험 결과

연구 질문

  • RQ1인간의 인지 방식과 유사하게 전체 이미지 특징이 아닌 가시 영역 특징에 집중함으로써 이모달 세그멘테이션 성능을 향상시킬 수 있는가?
  • RQ2형태 사전 지식을 효과적으로 인코딩하고 활용하여 이모달 마스크 예측의 현실성과 강건성을 향상시킬 수 있는가?
  • RQ3粗모 이모달 마스크를 어텐션으로 사용해 가시 마스크를 보정하는 어텐션 메커니즘이 가시 마스크만을 사용하는 것보다 더 나은 이모달 세그멘테이션 성능을 내는가?
  • RQ4이모달 형태 임베딩의 학습된 코드북이 일반화 능력을 향상시키고 가림 변화에 대한 민감도를 줄이는 데 얼마나 기여하는가?
  • RQ5형태 사전 기반의 후처리가 낮은 품질의 이모달 마스크 예측을 효과적으로 걸러낼 수 있는가?

주요 결과

  • 제안된 방법은 세 가지 공개 데이터셋에서 기존 최신 기술(SOTA)을 초월하여 뛰어난 이모달 마스크 예측 정확도를 확보하였다.
  • 제거 분석 결과 이모달 및 가시 마스크 헤드 간의 특징 매칭이 성능 향상에 기여함을 확인하였으며, 정렬된 특징 학습의 유용성을 입증하였다.
  • 어텐션 분석 결과 이모달 마스크 보정에 가시 영역 특징을 어텐션으로 사용할 경우 이모달 마스크 특징을 사용하는 것보다 더 좋은 성능을 내었으며, 인간 인지 기반 설계의 타당성을 뒷받침하였다.
  • t-SNE를 사용한 코드북 시각화 결과 카테고리별 형태 사전 지식이 학습 가능하고 해석 가능하며, 클러스터링이 기울임, 회전 등의 형태 변화를 반영하고 있음을 확인하였다.
  • 후처리 단계에서 형태 사전 지식을 활용함으로써 낮은 신뢰도 제안을 걸러내어 예측된 이모달 마스크의 품질이 크게 향상되었다.
  • 모델은 다양한 가림 상황에서도 일관된 이모달 예측을 유지한다 — 예를 들어, 파프리카, 사과, 양배추 등 다른 물체에 의해 가려져도 녹색 채소는 유사한 보이지 않는 영역을 인식한다 — 이는 가림 맥락에 대해 강건함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.