Skip to main content
QUICK REVIEW

[논문 리뷰] MaIL: A Unified Mask-Image-Language Trimodal Network for Referring Image Segmentation

Zizhang Li, Mengmeng Wang|arXiv (Cornell University)|2021. 11. 21.
Multimodal Machine Learning Applications참고 문헌 37인용 수 8
한 줄 요약

MaIL는 참조 이미지 세그멘테이션을 위한 통합 마스크-이미지-언어 삼모달 트랜스포머 네트워크를 제안하며, 기존의 인코더-융합-디코더 파이프라인을 깊은 모odal 상호작용 인코더로 대체한다. 마스크를 제1의 모달리티로 도입하고 적응형 선택 전략을 사용함으로써, RefCOCO, RefCOCO+, G-Ref 벤치마크에서 3%-10%의 상대적 향상으로 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Referring image segmentation is a typical multi-modal task, which aims at generating a binary mask for referent described in given language expressions. Prior arts adopt a bimodal solution, taking images and languages as two modalities within an encoder-fusion-decoder pipeline. However, this pipeline is sub-optimal for the target task for two reasons. First, they only fuse high-level features produced by uni-modal encoders separately, which hinders sufficient cross-modal learning. Second, the uni-modal encoders are pre-trained independently, which brings inconsistency between pre-trained uni-modal tasks and the target multi-modal task. Besides, this pipeline often ignores or makes little use of intuitively beneficial instance-level features. To relieve these problems, we propose MaIL, which is a more concise encoder-decoder pipeline with a Mask-Image-Language trimodal encoder. Specifically, MaIL unifies uni-modal feature extractors and their fusion model into a deep modality interaction encoder, facilitating sufficient feature interaction across different modalities. Meanwhile, MaIL directly avoids the second limitation since no uni-modal encoders are needed anymore. Moreover, for the first time, we propose to introduce instance masks as an additional modality, which explicitly intensifies instance-level features and promotes finer segmentation results. The proposed MaIL set a new state-of-the-art on all frequently-used referring image segmentation datasets, including RefCOCO, RefCOCO+, and G-Ref, with significant gains, 3%-10% against previous best methods. Code will be released soon.

연구 동기 및 목표

  • 기존의 이모달 인코더-융합-디코더 파이프라인의 한계를 해결하기 위해, 특히 부족한 다모달 상호작용과 정렬되지 않은 사전 훈련 작업을 개선한다.
  • 일반적으로 이전 방법에서 부족하게 활용되는 인스턴스 수준의 특징을 명시적으로 모델링함으로써 세그멘테이션 정확도를 향상시킨다.
  • 단일 깊은 모달 상호작용 인코더로 단모달 특징 추출과 다모달 융합을 통합함으로써, 별도로 사전 훈련된 단모달 인코더가 필요 없도록 한다.
  • 사전에 세그멘테이션된 인스턴스 마스크를 제3의 모달리티로 도입함으로써 정교한 국소화 성능 향상을 검토한다.
  • 디코더에서 선택적 마스크 융합 메커니즘을 개발하여 예측을 정밀하게 보정하기 위해 가장 관련성이 높은 마스크 표현을 적응적으로 선택한다.

제안 방법

  • 이미지, 언어, 마스크 특징이 동시에 처리되는 단일 깊은 모달 상호작용 트랜스포머 인코더를 사용하는 통합 인코더-디코더 아키텍처를 제안한다.
  • 인스턴스 마스크를 전용 모달리티로 도입하여, 이미지, 언어, 마스크 모달 간의 저수준 및 고수준 특징에서 명시적인 다모달 상호작용을 가능하게 한다.
  • 단일 모달 인코더를 제거하고 통합된 모달 상호작용 메커니즘으로 대체함으로써 아키텍처의 복잡성을 감소시키고 모달 간 정렬을 향상시킨다.
  • 디코더에서 K개의 후보 마스크 중 가장 높은 점수를 가진 마스크 표현을 선택하는 적응형 마스크 선택 전략을 적용하여 최종 세그멘테이션 출력을 정밀하게 보정한다.
  • 통합 인코더에 다모달 사전 훈련된 가중치를 사용하여 표현을 목표 다모달 작업과 정렬함으로써, 단모달 사전 훈련에서 발생할 수 있는 일관성 없는 문제를 방지한다.
  • 인코더에서 모든 세 모달 간에 학습 가능한 어텐션 메커니즘을 적용하여 동적이고 다수준의 특징 상호작용을 가능하게 하여 표현 품질을 향상시킨다.

실험 결과

연구 질문

  • RQ1기존의 인코더-융합-디코더 파이프라인을 통합된 모달 상호작용 인코더로 대체할 경우 참조 이미지 세그멘테이션 성능 향상이 가능한가?
  • RQ2인스턴스 마스크를 제1의 모달리티로 도입하면 인스턴스 수준의 특징 학습이 향상되고 더 정교한 세그멘테이션 결과를 얻을 수 있는가?
  • RQ3적응형 마스크 선택 전략은 단순한 풀링 또는 가중 평균 방법에 비해 관련 마스크 특징을 어떻게 더 잘 선택하는가?
  • RQ4전체 이미지 대비 마스크 컷 이미지를 사용할 경우 배경 정보와 위치 맥락이 성능에 어떤 영향을 미치는가?
  • RQ5통합된 삼모달 프레임워크는 다양한 참조 이미지 세그멘테이션 벤치마크에서 기존의 이모달 접근 방식을 초월할 수 있는가?

주요 결과

  • MaIL은 RefCOCO, RefCOCO+, G-Ref 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하였으며, 이는 이전 최고 성능 방법 대비 3%-10%의 상대적 향상이다.
  • 마스크를 별도의 모달리티로 도입함으로써 이모달 베이스라인 대비 2.89%의 IoU 향상이 이루어졌으며, 명시적인 인스턴스 수준 특징 모델링의 유용성을 입증한다.
  • 마스크 컷 이미지(버전 2)를 사용할 경우 배경 맥락의 손실과 사전에 세그멘테이션된 마스크의 품질에 의존함으로써 성능이 심각하게 저하된다.
  • 제안된 적응형 마스크 선택 전략은 마스크 특징을 사용하지 않을 경우 대비 2.57%의 향상을 기록하며, 평균, 최대값, 가중 평균 풀링 전략보다도 뛰어난 성능을 보인다.
  • 시각화 결과는 선택된 마스크가 참조 대상과 매우 관련성이 높으며, 사전에 생성된 마스크의 결함(예: 불필요한 세그먼트)을 보완함으로써 최종 예측이 정밀해지는 것을 확인한다.
  • 깊은 모달 상호작용을 통한 통합 인코더-디코더 파이프라인은 기존의 이단계 융합 방식보다 더 효과적인 다모달 표현 학습을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.