[논문 리뷰] WebSeg: Learning Semantic Segmentation from Web Searches
WebSeg는 키워드 검색을 통해 확보한 웹 이미지를 활용하여 약한 감독(semisupervised) 방식의 의미 분할을 학습하는 방법을 제안한다. 저수준 신호(saliency, edge, over-segmentation)를 이용해 프록시 애너테이션을 생성하고, 레이블 노이즈를 처리하기 위한 온라인 노이즈 필터링 모듈을 도입한다. 인간이 수작업으로 애너테이션한 마스크가 전혀 필요 없이 PASCAL VOC 2012에서 57.0% mIoU를 달성하여 순수 웹에서 학습한 방식으로도 뛰어난 성능을 보여준다.
In this paper, we improve semantic segmentation by automatically learning from Flickr images associated with a particular keyword, without relying on any explicit user annotations, thus substantially alleviating the dependence on accurate annotations when compared to previous weakly supervised methods. To solve such a challenging problem, we leverage several low-level cues (such as saliency, edges, etc.) to help generate a proxy ground truth. Due to the diversity of web-crawled images, we anticipate a large amount of 'label noise' in which other objects might be present. We design an online noise filtering scheme which is able to deal with this label noise, especially in cluttered images. We use this filtering strategy as an auxiliary module to help assist the segmentation network in learning cleaner proxy annotations. Extensive experiments on the popular PASCAL VOC 2012 semantic segmentation benchmark show surprising good results in both our WebSeg (mIoU = 57.0%) and weakly supervised (mIoU = 63.3%) settings.
연구 동기 및 목표
- 의미 분할에서 픽셀 수준의 애너테이션 비용을 줄이기 위해 키워드 검색을 통한 자유로운 웹 이미지를 활용한다.
- 특정 키워드와 연관된 이미지에 관련 없는 객체가 포함될 수 있는 웹에서 크롤링한 이미지의 레이블 노이즈 문제를 해결한다.
- 수작업 애너테이션 없이 키워드 기반 이미지 검색만으로도 미리 보지 못한 카테고리에 대해 제로샷 의미 분할을 가능하게 하는 방법을 개발한다.
- 딥 네트워크 내에 경량의 온라인 노이즈 필터링 모듈을 설계하여 히وري스틱 신호로부터 유도된 노이즈가 많은 프록시 애너테이션에 대한 모델의 강건성을 향상시킨다.
제안 방법
- 주어진 키워드에 대한 웹 검색 결과를 활용해 인간이 수작업으로 애너테이션한 마스크가 필요 없이 대규모이고 다양한 이미지 세트를 훈련 데이터로 확보한다.
- 저수준 신호—사람의 시각적 주목 영역 지도(DSS), 에지 지도(RCF), 오버세그멘테이션 영역(MCG)—를 사용해 카테고리에 종속되지 않은 프록시 정답을 생성한다. 이는 학습이 필요 없으며, 모든 카테고리에 적용 가능하다.
- 오버세그멘테이션 영역 내에서의 사전 지도 값의 평균을 취해 각 이미지에 대해 페르소 애너테이션(가짜 애너테이션)을 생성한다.
- 딥 네트워크(예: DeepLab)에 경량의 브랜치로 온라인 노이즈 필터링 모듈을 도입하여 노이즈가 많거나 관련 없는 영역의 예측을 동적으로 억제한다.
- 노이즈가 있는 프록시 애너테이션을 사용해 세그멘테이션 네트워크를 엔드 투 엔드로 훈련하며, 필터링 모듈은 최적화 과정에서 잘못된 양성 예측을 거부하도록 학습한다.
- 이중 단계 훈련 설정에서 이미지 수준의 감독 신호와 필터링 모듈을 결합하여 약한 감독을 활용함으로써 성능을 크게 향상시킨다.
실험 결과
연구 질문
- RQ1키워드 기반 웹 이미지 검색과 수작업 애너테이션 없이도, 딥 러닝 모델이 새로운 객체 카테고리에 대해 정확한 의미 분할을 학습할 수 있는가?
- RQ2저수준 신호(saliency, edge, region)에서 파생된 프록시 애너테이션은 웹 데이터의 본질적인 레이블 노이즈가 존재하더라도 어떻게 효과적으로 의미 분할 모델을 훈련하는 데 사용될 수 있는가?
- RQ3온라인 노이즈 필터링 메커니즘이 노이즈가 많은 웹 감독 데이터에서 학습할 경우 모델의 일반화 능력과 성능을 얼마나 향상시킬 수 있는가?
- RQ4제안된 방법은 PASCAL VOC 2012와 같은 표준 벤치마크에서 완전 감독 또는 약한 감독 기반의 최신 기준 방법들과 비교해 경쟁력 있는 성능을 달성할 수 있는가?
주요 결과
- WebSeg는 인간이 수작업으로 애너테이션한 마스크가 전혀 없는 조건에서 PASCAL VOC 2012 벤치마크에서 57.0% mIoU를 달성하여 제로샷 일반화 능력이 뛰어나다는 것을 입증한다.
- 약한 감독(예: 이미지 수준의 레이블)을 활용할 경우 WebSeg는 63.3% mIoU로 대부분의 카테고리에서 기존 최고 성능 기법들을 능가한다.
- 온라인 노이즈 필터링 모듈은 강건성을 크게 향상시켜 대규모이고 노이즈가 많은 웹 데이터에서 학습하면서도 관련 없는 영역에서 잘못된 예측을 억제할 수 있도록 한다.
- 이 방법은 카테고리에 종속되지 않으며, 재학습이나 피팅 없이도 저수준 신호(saliency, edge, region)를 그대로 활용해 새로운 카테고리에 빠르게 적용할 수 있다.
- 제거 실험(ablation study) 결과, 프록시 애너테이션 생성과 노이즈 필터링 메커니즘이 성능 향상에 필수적임을 확인하였으며, 둘 중 하나를 제거하면 mIoU가 크게 감소한다.
- 약한 감독 설정에서 최고의 성능 기록을 달성하였으며, 가장 우수한 변종(WebSeg$^{oldsymbol{ op}}$)은 21개 카테고리 중 18개에서 이전의 모든 방법들을 능가한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.