[논문 리뷰] Object cosegmentation using deep Siamese network
이 논문은 객체 제안들 간의 깊이 있는 특성 유사도를 학습하기 위해 시아모이 네트워크를 사용하여 객체 공세그멘테이션을 클러스터링 문제로 공식화하는 엔드 투 엔드 딥 러닝 프레임워크를 제안한다. 이 방법은 iCoseg 및 MSRC 데이터셋에서 최신 기술 수준의 성능을 달성하며, MCG 기반 제안을 사용할 경우 Jaccard 유사도가 0.66이고 mAP가 0.84이다. 또한 학습된 유사도 점수를 바탕으로 시각적 요약을 생성한다.
Object cosegmentation addresses the problem of discovering similar objects from multiple images and segmenting them as foreground simultaneously. In this paper, we propose a novel end-to-end pipeline to segment the similar objects simultaneously from relevant set of images using supervised learning via deep-learning framework. We experiment with multiple set of object proposal generation techniques and perform extensive numerical evaluations by training the Siamese network with generated object proposals. Similar objects proposals for the test images are retrieved using the ANNOY (Approximate Nearest Neighbor) library and deep semantic segmentation is performed on them. Finally, we form a collage from the segmented similar objects based on the relative importance of the objects.
연구 동기 및 목표
- 전경 객체에 대한 사전 지식 없이 여러 이미지 간에 유사한 객체를 세그멘테이션하는 데 도전한다.
- 공통성 우선순위와 이미지의 공동 처리를 활용하여 내부 클래스 변형과 노이즈 상황에서도 세그멘테이션의 강건성을 향상시킨다.
- 유사도 학습을 위한 시아모이 네트워크와 의미 세그멘테이션을 위한 완전 컨volution 네트워크를 결합한 엔드 투 엔드 파이프라인을 개발한다.
- 상대적 유사도와 중요도를 바탕으로 공세그멘테이션된 객체의 시각적 요약을 생성한다.
제안 방법
- 공유 가중치를 가진 시아모이 네트워크를 사용하여 대칭된 객체 제안 쌍에 대해 대조 손실 함수를 사용해 판별적 깊이 특징을 학습한다.
- 대조 손실은 동일한 객체 클래스에 属하는 패치들은 임베딩 공간에서 가까이, 이질적인 패치들은 멀리 떨어지도록 보장한다.
- 다양한 기법들(EdgeBoxes, Selective Search, MCG, Salient Proposals)을 사용해 객체 제안을 생성하고, 훈련된 시아모이 네트워크에 입력하여 256차원 특징 벡터를 추출한다.
- 유사도 검색은 ANNOY 라이브러리를 사용하여 특성 공간에서 유클리드 거리 기반으로 테스트 이미지 간의 가장 가까운 이웃 제안을 검색한다.
- 검색된 유사한 제안에 대해 완전 컨volution 네트워크(FCN)를 적용하여 픽셀 수준의 세그멘테이션을 수행한다.
- 가장 유사한 객체들을 중심에 배치하고 상대적 거리를 유지하면서, 시각적 일관성을 확보하기 위해 합성 배경을 사용하여 시각적 콜라주를 구성한다.
실험 결과
연구 질문
- RQ1시아모이 네트워크는 객체 공세그멘테이션을 위한 공통성 우선순위를 인코딩하는 깊이 특징 표현을 효과적으로 학습할 수 있는가?
- RQ2객체 제안 생성 방법의 선택이 공세그멘테이션 파이프라인 성능에 미치는 영향은 어떠한가?
- RQ3제안된 방법은 사전 훈련된 특징만을 사용하고 미세조정 없이도 새로운 객체 클래스에 일반화 가능한가?
- RQ4시각적 콜라주 생성은 공세그멘테이션된 객체들의 상대적 유사도와 중요도를 효과적으로 반영하는가?
주요 결과
- MCG 기반 제안을 사용할 경우, 훈련 데이터의 70%로 훈련하고 테스트 데이터의 100%로 평가했을 때 MSRC 데이터셋에서 Jaccard 유사도 0.66과 mAP 0.84를 달성한다.
- iCoseg 데이터셋에서는 MCG 제안을 사용하고 훈련 데이터의 80%로 훈련, 테스트 데이터의 100%로 평가했을 때 Jaccard 유사도 0.654와 mAP 0.81을 기록한다.
- Pascal, 동물 등 타깃 클래스 외의 클래스에서 훈련된 시아모이 네트워크는 타깃 클래스(iCoseg, MSRC)로의 일반화가 매우 우수하며, 최소한의 미세조정으로도 강력한 제로샷 일반화 성능을 보인다.
- MCG 기반 객체 제안이 두 데이터셋 모두에서 가장 높은 성능을 기록하며, EdgeBoxes, Selective Search 및 샐런시 기반 제안보다 뛰어나다.
- 시각적 콜라주 생성은 유사도 계층을 효과적으로 반영하며, 가장 유사한 객체들이 중심에 위치하고 시각적으로 일관된 배열을 형성한다.
- 특징 추출에 대한 추론 시간은 이미지당 100ms 이내로, 실시간 응용에 매우 효율적이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.