Skip to main content
QUICK REVIEW

[논문 리뷰] Ref-NMS: Breaking Proposal Bottlenecks in Two-Stage Referring Expression Grounding

Long Chen, Wenbo Ma|arXiv (Cornell University)|2020. 09. 03.
Topic Modeling참고 문헌 51인용 수 13
한 줄 요약

이 논문은 Ref-NMS를 제안하며, 두 단계 형식의 참조 표현 기반 지문(grounding)을 향상시키기 위해 첫 번째 단계에서 표현 인식 객체 제안을 생성하고, 경량 모듈을 사용해 제안-참조 대상 간 일치도를 평가하고 NMS를 이끌어내는 새로운 방법을 제시한다. 다양한 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, testB 세트에서 최대 4.72%의 절대적 향상률을 기록한다.

ABSTRACT

The prevailing framework for solving referring expression grounding is based on a two-stage process: 1) detecting proposals with an object detector and 2) grounding the referent to one of the proposals. Existing two-stage solutions mostly focus on the grounding step, which aims to align the expressions with the proposals. In this paper, we argue that these methods overlook an obvious mismatch between the roles of proposals in the two stages: they generate proposals solely based on the detection confidence (i.e., expression-agnostic), hoping that the proposals contain all right instances in the expression (i.e., expression-aware). Due to this mismatch, current two-stage methods suffer from a severe performance drop between detected and ground-truth proposals. To this end, we propose Ref-NMS, which is the first method to yield expression-aware proposals at the first stage. Ref-NMS regards all nouns in the expression as critical objects, and introduces a lightweight module to predict a score for aligning each box with a critical object. These scores can guide the NMS operation to filter out the boxes irrelevant to the expression, increasing the recall of critical objects, resulting in a significantly improved grounding performance. Since Ref- NMS is agnostic to the grounding step, it can be easily integrated into any state-of-the-art two-stage method. Extensive ablation studies on several backbones, benchmarks, and tasks consistently demonstrate the superiority of Ref-NMS. Codes are available at: https://github.com/ChopinSharp/ref-nms.

연구 동기 및 목표

  • 두 단계 형식의 참조 표현 기반 지문(REG) 방법에서 검출된 제안과 진짜 지문 제안 간 성능 격차를 해소한다.
  • 중요한 불일치를 규명한다: 첫 번째 단계 검출기는 검출 신뢰도만 사용하지만, 두 번째 단계 지문은 제안이 표현에 인지된 객체여야 한다.
  • 제안 필터링 단계에서 참조 표현의 언어적 단서를 통합하여 핵심 객체(예: 참조 대상 및 맥락)의 재현율을 향상시킨다.
  • 지문 헤드를 수정하지 않고도 어떤 두 단계 형식의 REG 프레임워크에도 쉽게 통합할 수 있는 플러그 앤 플레이 모듈을 개발한다.
  • 다양한 백본, 데이터셋, 작업(Recall, Evaluation, REC 및 RES) 간 일관된 성능 향상을 입증한다.

제안 방법

  • 참조 표현에 포함된 모든 명사를 핵심 객체로 간주하여 국소화한다.
  • 각 제안과 각 핵심 객체 간 유사도 점수를 예측하는 경량의, 미분 가능한 모듈을 도입한다.
  • 유사도 점수를 검출 신뢰도와 조합하여 NMS 억제를 위한 복합 점수를 형성한다.
  • 검출 신뢰도가 높고 동시에 참조 표현의 핵심 객체와 일치하는 제안을 우선순위로 정렬하도록 NMS 연산을 수정한다.
  • 지문 모듈에 종속되지 않도록 하여, 어떤 두 단계 형식의 REG 모델에도 통합 가능하도록 보장한다.
  • 관련성 점수 헤드를 검출기와 함께 엔드 투 엔드로 훈련하기 위해 이진 교차 엔트로피 손실을 사용한다.

실험 결과

연구 질문

  • RQ1왜 두 단계 형식의 REG 방법은 표준 검출기로 제안을 생성할 경우 성능이 크게 떨어지는가?
  • RQ2검출 신뢰도 기반 제안 생성과 표현 인식 지문 간의 불일치가 모델 성능에 얼마나 큰 영향을 미치는가?
  • RQ3핵심 객체(참조 대상 및 맥락)에 대한 제안 재현율을 향상시키면 지문 정확도에 측정 가능한 향상이 이루어지는가?
  • RQ4지문 헤드를 수정하지 않고도 표현 인식 NMS 메커니즘이 성능 향상에 얼마나 효과적인가?
  • RQ5제안된 Ref-NMS 방법은 다양한 백본, 데이터셋, 작업(Recall 및 Evaluation, REC 및 RES) 간 일반화 가능한가?

주요 결과

  • Ref-NMS는 RefCOCO testB 세트에서 최대 4.72%의 절대적 성능 향상을 기록하며, 평가된 모든 백본에서 일관된 성능 향상을 보였다.
  • RefCOCO, RefCOCO+, RefCOCOg에 대해 각각 REC 작업에서 평균 2.64%, 0.53%, 2.26% 향상되었다.
  • RES 작업에서는 세 데이터셋에서 평균 2.82%, 0.31%, 1.65% 향상되었으며, 두 단계 형식 방법 중 최신 기술 수준(SOTA)을 달성했다.
  • 성능 향상은 핵심 객체의 재현율 증가와 강하게 상관관계가 있어, 제안의 한계를 완화하는 데 효과적임을 확인했다.
  • 정성적 결과에서는 Ref-NMS가 더 많은 표현 인식 제안을 생성하며, 기준 모델 대비 참조 대상 누락을 줄이고 가짜 양성 결과를 감소시켰다.
  • 실패 케이스조차도 Ref-NMS는 더 합리적인 제안을 생성했으며, 이는 지문 오류의 주요 원인이 제안 품질이 아니라 두 번째 단계에 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.