Skip to main content
QUICK REVIEW

[논문 리뷰] Concept Mask: Large-Scale Segmentation from Semantic Concepts

Yufei Wang, Zhe Lin|arXiv (Cornell University)|2018. 08. 18.
Advanced Neural Network Applications참고 문헌 20인용 수 3
한 줄 요약

이 논문은 대규모 이미지 세분화를 위한 약한 지도 및 준지도 학습 프레임워크인 Concept Mask를 제안한다. 이는 세분화를 개념 기반 작업으로 간주하여 객체, 부위, 스타프(Stuff), 속성 간에 제로샷 및 피셔샷 일반화를 가능하게 한다. 네 개의 데이터셋에서 이미지 수준, 바운딩 박스, 픽셀 수준의 애너테이션을 삼단계 학습 파이프라인을 통해 활용함으로써, 완전히 지도된 개념에서 최고 성능을 달성하고, 알려지지 않은 개념과 약한 지도된 개념으로의 일반화도 효과적으로 수행한다.

ABSTRACT

Existing works on semantic segmentation typically consider a small number of labels, ranging from tens to a few hundreds. With a large number of labels, training and evaluation of such task become extremely challenging due to correlation between labels and lack of datasets with complete annotations. We formulate semantic segmentation as a problem of image segmentation given a semantic concept, and propose a novel system which can potentially handle an unlimited number of concepts, including objects, parts, stuff, and attributes. We achieve this using a weakly and semi-supervised framework leveraging multiple datasets with different levels of supervision. We first train a deep neural network on a 6M stock image dataset with only image-level labels to learn visual-semantic embedding on 18K concepts. Then, we refine and extend the embedding network to predict an attention map, using a curated dataset with bounding box annotations on 750 concepts. Finally, we train an attention-driven class agnostic segmentation network using an 80-category fully annotated dataset. We perform extensive experiments to validate that the proposed system performs competitively to the state of the art on fully supervised concepts, and is capable of producing accurate segmentations for weakly learned and unseen concepts.

연구 동기 및 목표

  • 계층적 레이블 공간 내에서 개념의 중복으로 인한 레이블 모호성과 확장성 문제를 해결한다.
  • 대규모 완전 애너테이션 데이터셋의 부족을 해결하기 위해, 클래스 기반 대신 개념 기반 작업으로 세분화를 재정의한다.
  • 약한 지도 학습을 통해 객체 부위, 스타프, 속성과 같은 알려지지 않은 개념에 대해 제로샷 및 피셔샷 세분화를 가능하게 한다.
  • 재학습 없이도 다양한 수준의 지도 학습을 제공하는 여러 데이터셋을 통합하면서 치명적인 잊힘 현상을 방지하는 통합형 점진적 학습 프레임워크를 개발한다.
  • 재학습 없이도 완전히 지도된 개념에서 경쟁력 있는 성능를 달성하면서도, 약한 지도된 개념과 제로샷 개념으로의 일반화 성능를 확보한다.

제안 방법

  • 18,000개의 의미적 개념에 대해 이미지 수준 레이블이 부여된 600만 장의 주식 이미지 데이터셋에서 딥 네ural 네트워크를 학습하여 시각-의미 임베딩을 학습한다.
  • 다중 작업 미세조정을 통해 750개의 개념으로 구성된 정제된 데이터셋의 바운딩 박스 애너테이션을 활용하여 임베딩 네트워크를 개선하며, 이전 지식을 유지한다.
  • MS-COCO의 80개 완전 애너테이션 객체 카테고리에서 클래스에 종속되지 않은 세분화 네트워크를 학습하고, 어텐션 맵을 입력으로 사용하여 세분화를 유도한다.
  • 완전 컨volutional 추론 파이프라인을 사용한다: 개념 임베딩 → 굵은 어텐션 맵 → 어텐션 기반 네트워크를 통해 고해상도 세분화 마스크 생성.
  • 모델 전체를 다시 학습하지 않고도 여러 데이터셋의 지도 학습을 통합하는 점진적 학습 전략을 적용한다.
  • 어텐션 맵을 활용하여 클래스에 종속되지 않은 영역에 집중함으로써, 클래스 기반 지도 학습이 필요 없이 제로샷 및 피셔샷 세분화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1완전 애너테이션된 클래스 수가 제한된 모델이 객체 부위, 스타프, 속성과 같은 알려지지 않은 개념으로 일반화할 수 있는가?
  • RQ2약한 지도 및 준지도 학습 프레임워크가 다양한 의미적 개념 간에 제로샷 세분화를 얼마나 효과적으로 가능하게 하는가?
  • RQ3이미지 수준 및 바운딩 박스 애너테이션은 완전히 애너테이션되지 않은 개념의 세분화 성능를 얼마나 향상시키는가?
  • RQ4어떤 정도로 어텐션 맵이 클래스에 종속되지 않은 가이드 메커니즘으로서 기존의 클래스 기반 바운딩 박스 제안 방법보다 성능을 뛰어넘는가?
  • RQ5완전히 지도된 개념에서 높은 성능를 유지하면서도, 약한 지도된 개념과 제로샷 개념으로의 일반화 성능를 확보할 수 있는가?

주요 결과

  • COCO-80에서 경쟁적인 성능를 달성하였으며, 객체 카테고리에서 평균 IoU는 0.603, 스타프에서 0.625, 부위에서 0.516의 성능를 기록하였다. (Weak-Box-670 벤치마크 기준)
  • 각 개념당 5~10개의 피셔샷 예제만 존재하는 ZeroTest-10 세트에서 효과적으로 일반화되었으며, 강력한 제로샷 세분화 능력을 입증하였다.
  • 직접 학습된 바가 없음에도 불구하고, 바지, 뿔 등의 객체 부위와 나무줄기, 하늘 등의 스타프를 성공적으로 세분화하였다.
  • 어텐션 네트워크를 통해 개념의 존재 여부를 정확히 확인할 수 있었으며, ZeroTest-10 및 Weak-Image-50의 시각화 결과에서 이를 확인할 수 있었다.
  • 특히 비객체 개념에 대해서는 DSS 및 Mask R-CNN와 같은 기준 모델보다 성능가 뛰어나, 약한 지도 및 제로샷 벤치마크에서 뛰어난 성능를 보였다.
  • 의약품 캐비닛과 일반 캐비닛처럼 시각적으로 모호한 개념이나, 새가 있는 연어 낚시대처럼 이미지 수준 레이블이 부족한 경우 실패 케이스가 발생하여 약한 지도 학습의 한계를 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.