[논문 리뷰] Multi-task Collaborative Network for Joint Referring Expression Comprehension and Segmentation
이 논문은 공동 참조 표현 이해(Rec) 및 분할(Res)을 위한 다중 작업 협업 네트워크(MCN)를 제안하며, 공유 백본과 작업별 전용 브랜치를 통해 두 작업 간 상호 감독을 활용한다. 예측 갈등을 해결하기 위해 일致성 에너지 최대화(CEM)와 적응형 소프트 비위치 억제(ASNLS)를 도입하여 기준 데이터셋에서 REC에 최대 +7.13% 향상, RES에 최대 +11.50% 향상으로 최신 기술 수준(SOTA) 성능을 달성한다.
Referring expression comprehension (REC) and segmentation (RES) are two highly-related tasks, which both aim at identifying the referent according to a natural language expression. In this paper, we propose a novel Multi-task Collaborative Network (MCN) to achieve a joint learning of REC and RES for the first time. In MCN, RES can help REC to achieve better language-vision alignment, while REC can help RES to better locate the referent. In addition, we address a key challenge in this multi-task setup, i.e., the prediction conflict, with two innovative designs namely, Consistency Energy Maximization (CEM) and Adaptive Soft Non-Located Suppression (ASNLS). Specifically, CEM enables REC and RES to focus on similar visual regions by maximizing the consistency energy between two tasks. ASNLS supresses the response of unrelated regions in RES based on the prediction of REC. To validate our model, we conduct extensive experiments on three benchmark datasets of REC and RES, i.e., RefCOCO, RefCOCO+ and RefCOCOg. The experimental results report the significant performance gains of MCN over all existing methods, i.e., up to +7.13% for REC and +11.50% for RES over SOTA, which well confirm the validity of our model for joint REC and RES learning.
연구 동기 및 목표
- 공동 학습에서의 예측 갈등 문제를 해결하기 위해.
- 협업 다중 작업 프레임워크를 설계하여 Rec과 Res 간 상호 감독을 가능하게 하기 위해.
- 공유 모듈 및 작업별 전용 모듈을 통해 Rec의 언어-비전 정렬 및 Res의 공간 정밀도를 향상시키기 위해.
- 다중 작업 환경에서 예측 갈등으로 인한 성능 저하를 줄이기 위해.
제안 방법
- MCN는 공유 시각적 백본과 언어 인코더를 사용하며, 작업별 특성을 유지하기 위해 Rec과 Res 각각의 별도 다중 모odal 추론 브랜치를 갖춘다.
- 일치성 에너지 최대화(CEM)는 언어 중심의 손실로, Rec과 Res 예측 간 일치성 에너지를 최대화하여 둘 다 유사한 시각적 영역에 집중하도록 유도한다.
- 적응형 소프트 비위치 억제(ASNLS)는 학습 가능한 소프트 어텐션 메커니즘을 사용해 Rec 예측 기반으로 관련 없는 영역의 Res 반응을 억제한다.
- 모델는 일단에 최적화되는 아키텍처를 사용해 엔드 투 엔드 방식으로 Rec(박스 예측)과 Res(픽셀 수준 분할)를 동시에 최적화한다.
- CEM은 Rec과 Res 학습을 연결하는 피벗 역할을 하여 교차 작업 정렬을 향상시킨다.
- ASNLS는 객체의 무결성을 유지하는 강력한 소프트 후처리를 가능하게 하며, RoI-Pooling과 같은 딱딱한 방법과는 달리 유사하다.
실험 결과
연구 질문
- RQ1Rec과 Res의 공동 학습이 상호 감독을 통해 성능 향상에 기여할 수 있는가?
- RQ2다중 작업 환경에서 Rec과 Res 간 예측 갈등을 효과적으로 완화할 수 있는가?
- RQ3Rec과 Res를 공동으로 학습할 경우 언어-비전 정렬이 얼마나 향상되는가?
- RQ4소프트, 적응형 후처리가 Res에서 딱딱한 고정 영역 억제보다 뛰어난 성능을 내는가?
- RQ5제안된 협업 프레임워크는 기존 방법에 비해 일관성 오류를 줄이는가?
주요 결과
- MCN는 이전 SOTA에 비해 RefCOCO 테스트B 스플릿에서 Rec 성능을 +7.13% 절대 향상시켰다.
- MCN는 RefCOCO+ 데이터셋에서 Res 성능을 +11.50% 절대 향상시켜 기존 방법을 크게 앞서 갔다.
- CEM 적용으로 불일치 오차(IE) 지표가 17.12%에서 13.51%로 감소하여 예측 갈등 감소가 확인되었다.
- ASNLS는 RoI-Pooling 및 RoI-Align과 같은 딱딱한 후처리 방법보다 뛰어나, 박스 외부 객체 부분을 더 잘 유지하는 데 유리했다.
- 제거 실험 결과, CEM과 ASNLS 각각이 크게 기여하며, 개별적으로 사용할 경우 Res에서 최대 14.84% 향상, Rec에서 최대 7.04% 향상이 이루어졌다.
- MCN는 MAttNet과 같은 다단계 SOTA 모델 대비 6배 빠르며, 높은 정확도와 함께 효율성도 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.