Skip to main content
QUICK REVIEW

[논문 리뷰] Linguistic Structure Guided Context Modeling for Referring Image Segmentation

Tianrui Hui, Si Liu|arXiv (Cornell University)|2020. 10. 01.
Multimodal Machine Learning Applications참고 문헌 42인용 수 10
한 줄 요약

이 논문은 참조 이미지 분할에서 다중모달 컨텍스트를 '수집-확산-분배' 방식을 통해 의존성 파싱 트리로 억제된 단어 그래프(DPT-WG)를 사용하여 모델링하는 언어적 구조 유도 컨텍스트 모델링(LSCM) 모듈을 제안한다. 이 방법은 관련성이 있는 시각적 및 언어적 특징을 선택적으로 집계하면서 불필요한 특징을 억제함으로써 분할 정확도를 향상시키며, 네 가지 벤치마크에서 최신 기술(SOTA) 성능을 달성한다.

ABSTRACT

Referring image segmentation aims to predict the foreground mask of the object referred by a natural language sentence. Multimodal context of the sentence is crucial to distinguish the referent from the background. Existing methods either insufficiently or redundantly model the multimodal context. To tackle this problem, we propose a "gather-propagate-distribute" scheme to model multimodal context by cross-modal interaction and implement this scheme as a novel Linguistic Structure guided Context Modeling (LSCM) module. Our LSCM module builds a Dependency Parsing Tree suppressed Word Graph (DPT-WG) which guides all the words to include valid multimodal context of the sentence while excluding disturbing ones through three steps over the multimodal feature, i.e., gathering, constrained propagation and distributing. Extensive experiments on four benchmarks demonstrate that our method outperforms all the previous state-of-the-arts.

연구 동기 및 목표

  • 참조 이미지 분할에서 잡음이 많고 중복되는 다중모달 컨텍스트 모델링 문제를 해결하기 위해.
  • 언어적 구조를 활용하여 선택적이고 컨텍스트 인식 특징 집합을 유도함으로써 참조 대상 정위치를 향상시키기 위해.
  • 다중모달 특징 융합 과정에서 관련 없는 시각적 또는 언어적 특징의 간섭을 줄이기 위해.
  • 제약된 그래프 전파를 통해 유효하고 문장 수준의 다중모달 컨텍스트를 효율적이고 효과적으로 모델링하는 메커니즘을 개발하기 위해.

제안 방법

  • 각 노드가 단어를 나타내고, 문법적 의존성에 의해 제약된 간선을 갖는 의존성 파싱 트리로 억제된 단어 그래프(DPT-WG)를 구축한다.
  • 교차모달 어텐션을 통해 각 단어를 시각적으로 관련된 이미지 영역과 연관지켜 초기 다중모달 특징을 형성한다.
  • DPT 유도 간선 억제를 통한 제약된 그래프 컨볼루션을 적용하여 단어 간 컨텍스트를 전파하며, 의미적으로 거리가 먼 또는 관련 없는 연결을 배제한다.
  • 개선된 다중모달 특징을 이미지 특징 맵으로 다시 전파하여 분할 헤드 입력을 제공하기 위해 '분배'를 수행한다.
  • 교차엔트로피 및 Dice 손실을 사용하여 엔드 투 엔드 훈련이 가능한 분할 프레임워크에 LSCM 모듈을 통합한다.
  • 학습 가능한 트리 마스크와 파라미터 α를 활용하여 직접 연결과 DPT 제약 전파 간 균형을 조절하며, 노이즈 억제를 위한 간선 가중치 최적화를 수행한다.

실험 결과

연구 질문

  • RQ1참조 이미지 분할에서 방해 요소가 되는 특징을 배제하면서 언어적 구조를 효과적으로 활용해 관련 다중모달 컨텍스트를 모델링할 수 있는 방법은 무엇인가?
  • RQ2다중모달 컨텍스트 모델링을 위한 단어 그래프 전파에서 완전 연결과 문법적 제약 간 최적의 균형은 무엇인가?
  • RQ3'수집-확산-분배' 프레임워크와 DPT 억제 그래프 전파를 통해 기존 방법보다 분할 정확도를 향상시킬 수 있는가?
  • RQ4그래프 간선 가중치 선택(예: 트리 마스크의 α)이 모델의 불필요한 컨텍스트 억제 능력에 미치는 영향은 무엇인가?

주요 결과

  • LSCM 모듈은 네 개의 참조 이미지 분할 벤치마크에서 최신 기술(SOTA) 성능을 달성한다. 이는 이전 SOTA 방법을 초월한다.
  • 트리 마스크에서 α = 0.1일 때, 모델은 UNC 검증 세트에서 55.93% IoU를 기록하여 DPT 억제 없이 테스트한 기준선(α = 1)보다 1.12% 향상된 성능을 보였다.
  • 그래프 컨볼루션 레이어를 하나만 사용할 경우(즉, n=1)가 최고의 성능을 보였으며, 이는 깊은 전파가 유의미한 이점을 줄이지 않고 오히려 노이즈를 유발한다는 것을 시사한다.
  • 제거 실험 결과에 따르면, DPT를 통한 제약 전파가 필수적임을 확인하였으며, 단어 수준의 특징 수집을 하더라도 제약 전파가 없는 모델은 성능이 열등하다.
  • 정성적 결과에서는 ' browm coat'이나 '분홍색 테이블 위의 골드엔 강아지'와 같은 복잡한 표현을 정확하게 정위치하는 데 성공하였으며, 다수의 엔티티와 특성 조합이 존재하는 상황에서도 유사한 성능을 기록하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.