Skip to main content
QUICK REVIEW

[논문 리뷰] Referring Expression Object Segmentation with Caption-Aware Consistency

Yiwen Chen, Yi‐Hsuan Tsai|arXiv (Cornell University)|2019. 10. 10.
Multimodal Machine Learning Applications참고 문헌 27인용 수 8
한 줄 요약

이 논문은 언어 지식을 시각적 특징에 전달하고 입력 및 생성된 참조 표현 간의 일관성을 강제함으로써 이해와 생성을 공동 최적화하는 캡션 인식 일관성 기반의 새로운 엔드 투 엔드 프레임워크를 제안한다. 공간 인식 동적 필터를 도입하여 언어 지식을 시각적 특징에 전달하고, 입력된 참조 표현과 생성된 참조 표현 간의 일관성을 확보함으로써 RefCOCO 및 RefCOCO+ 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Referring expressions are natural language descriptions that identify a particular object within a scene and are widely used in our daily conversations. In this work, we focus on segmenting the object in an image specified by a referring expression. To this end, we propose an end-to-end trainable comprehension network that consists of the language and visual encoders to extract feature representations from both domains. We introduce the spatial-aware dynamic filters to transfer knowledge from text to image, and effectively capture the spatial information of the specified object. To better communicate between the language and visual modules, we employ a caption generation network that takes features shared across both domains as input, and improves both representations via a consistency that enforces the generated sentence to be similar to the given referring expression. We evaluate the proposed framework on two referring expression datasets and show that our method performs favorably against the state-of-the-art algorithms.

연구 동기 및 목표

  • 참조 표현 이해 및 생성 작업을 공동으로 모델링하여 참조 표현 객체 분할 성능을 향상시키기.
  • 입력된 참조 표현과 생성된 참조 표현 간의 일관성 손실을 통해 언어와 시각 간의 다중 모odal 특징 학습을 향상시키기.
  • 공간 위치 지침을 기반으로 언어 지식을 시각적 특징에 전달하는 공간 인식 동적 필터를 설계하기.
  • 개선된 국소화 정확도와 복잡한 환경에 대한 강건성을 확보하는 엔드 투 엔드 학습을 달성하기.

제안 방법

  • 모odal 별 특징을 추출하기 위한 별도의 언어 및 시각 인코더를 갖춘 이해 네트워크.
  • 텍스트 특징에서 생성된 컨volutional 필터를 통해 관련 이미지 영역에 주의를 기울이는 공간 인식 동적 필터.
  • 공유된 특징을 입력으로 받아 참조 표현을 생성하여 입력과의 일관성을 강제하는 캡션 생성 네트워크.
  • 입력된 참조 표현과 생성된 문장 간의 차이를 최소화하는 캡션 인식 일관성 손실.
  • 분할 및 생성을 공동 최적화하기 위해 교차 엔트로피 손실과 일관성 손실을 사용한 엔드 투 엔드 학습.
  • 동적 필터링의 정밀도 향상을 위해 특징 맵에 공간 좌표를 통합하기.

실험 결과

연구 질문

  • RQ1참조 표현 이해 및 생성의 공동 최적화가 분할 성능 향상에 기여하는가?
  • RQ2입력된 참조 표현과 생성된 참조 표현 간의 일관성 강제가 특징 표현 품질에 어떤 영향을 미치는가?
  • RQ3표준 또는 비공간 기반 동적 필터에 비해 공간 인식 동적 필터가 목표 객체를 더 잘 국소화할 수 있는가?
  • RQ4공간 인식 필터와 캡션 일관성의 각 구성 요소가 전체 성능에 기여하는 정도는 어떠한가?

주요 결과

  • 제안된 방법은 RefCOCO에서 58.90% 및 61.77%의 마스크 교차 과정률(mIoU)을 달성하여 최신 기술 수준의 방법들을 능가한다.
  • RefCOCO+에서는 53.81%의 mIoU를 기록하여 다양한 데이터셋 간의 강력한 일반화 능력을 입증한다.
  • 제거 실험 결과, 공간 인식 동적 필터와 캡션 인식 일관성 모두 기준 모델 대비 성능 향상에 크게 기여하는 것으로 확인된다.
  • 두 구성 요소를 모두 포함한 전체 모델은 RefCOCOg에서 46.95%의 mIoU를 기록하여 MAttNet 및 DMN를 포함한 기존 방법들을 초월한다.
  • 정성적 결과는 색상, 위치, 동작 등을 포함한 복잡한 기술 기반의 설명에 기반한 정확한 객체 분할을 보여준다.
  • 배경 혼동이 흔한 '등 뒤에 있는 코끼리' 예시와 같이 혼잡한 환경에서도 모델이 효과적으로 객체를 분할하는 것을 확인할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.