[논문 리뷰] Discriminative out-of-distribution detection for semantic segmentation
이 논문은 OOD 탐지기를 전용으로 학습시켜 도로 주행 픽셀을 광범위한 배경(ILSVRC)으로부터 구분하도록 하여 의미론적 분할에서 OOD 픽셀을 식별하고, 기존 방법에 비해 OOD 탐지 성능을 향상시킵니다.
Most classification and segmentation datasets assume a closed-world scenario in which predictions are expressed as distribution over a predetermined set of visual classes. However, such assumption implies unavoidable and often unnoticeable failures in presence of out-of-distribution (OOD) input. These failures are bound to happen in most real-life applications since current visual ontologies are far from being comprehensive. We propose to address this issue by discriminative detection of OOD pixels in input data. Different from recent approaches, we avoid to bring any decisions by only observing the training dataset of the primary model trained to solve the desired computer vision task. Instead, we train a dedicated OOD model which discriminates the primary training set from a much larger "background" dataset which approximates the variety of the visual world. We perform our experiments on high resolution natural images in a dense prediction setup. We use several road driving datasets as our training distribution, while we approximate the background distribution with the ILSVRC dataset. We evaluate our approach on WildDash test, which is currently the only public test dataset that includes out-of-distribution images. The obtained results show that the proposed approach succeeds to identify out-of-distribution pixels while outperforming previous work by a wide margin.
연구 동기 및 목표
- 실세계 주행 시나리오에서 닫힌 세계 가정이 실패하는 상황에서 의미론 분할의 견고한 OOD 탐지를 동기화합니다.
- 주요 분할 모델과 독립적으로 학습된 판별적이고 완전 합성곱 신경망(OOD 탐지기)을 제안합니다.
- 시각 세계의 다양성을 근사하기 위해 대규모 배경 데이터셋(ILSVRC)을 활용하고 OOD를 ID로부터 분리합니다.
- 여러 베이스라인과 도로 주행 및 WildDash 데이터셋에서 방법을 평가하여 OOD 탐지 성능의 향상을 보여줍니다.
제안 방법
- 전용 OOD 탐지기를 학습시켜 ID 픽셀과 ILSVRC에서 얻은 OOD 픽셀 사이의 이진 픽셀 단위 분류를 수행합니다.
- DenseNet-121 기반 특징 추출기를 ILSVRC 사전 학습으로 초기화하고, 선택된 층(DB4와 T3)과 OOD 헤드를 미세조정하여 도로 주행 장면과 일반 배경을 구별합니다.
- ID 및 OOD 소스로부터 512x512 크롭의 혼합 배치를 형성하고, 학습의 균형을 맞추기 위해 ID 데이터를 오버샘플링하며 ILSVRC 픽셀은 모두 OOD로, 도로 주행 픽셀은 ID로 라벨링합니다.
- 주요 분할 모델(Cityscapes, Vistas, WildDash)과 함께 OOD 탐지 모델을 학습시켜 Dense OOD 탐지 성능을 max-softmax, ODIN, 학습된 신뢰도 베이스라인과 비교합니다.
- WildDash 테스트에서 평균 정밀도(AP)로 OOD 탐지를 평가하되, 두 가지 변형으로 평가합니다: 모든 음수 이미지를 포함하는 경우와 변경된 음수를 제외하는 경우.
실험 결과
연구 질문
- RQ1ILSVRC와 같은 대규모 배경 데이터셋에서 학습된 판별적이고 작업 독립적인 OOD 탐지기가 의미론적 분할 작업의 OOD 픽셀을 신뢰성 있게 식별할 수 있는가?
- RQ2주요 분할 모델에서 OOD 탐지를 분리하는 것이 OOD 탐지 성능을 향상시키고, OOD 불확실성 전략을 주 모델에 공동으로 적용하는 것보다 효과적이며 더 나은가?
- RQ3다양한 ID 데이터셋(Cityscapes, Cityscapes+WildDash, Vistas)으로 OOD 탐지 역량을 학습시키면 WildDash 및 기타 데이터셋에서의 OOD 탐지 성능에 어떤 차이가 나타나는가?
- RQ4ILSVRC와 같은 배경 데이터셋을 OOD 탐지에 사용하는 것이 다양한 도로 주행 및 실내/실외 장면에 어떤 영향을 미치는가?
- RQ5최대 소프트맥스, ODIN, 학습된 신뢰도와 같은 기존의 이미지 전반에 걸친 OOD 방법들이 Dense 예측에 적용될 때 제안된 판별적 접근법과 비교하여 어떤 성능 차이를 보이는가?
주요 결과
- ILSVRC를 배경으로 학습된 판별적 OOD 탐지가 WildDash OOD 탐지 AP에서 최대 소프트맥스 및 다른 적응형 베이스라인보다 유의하게 우수한 성능을 보입니다.
- 다양한 배경 데이터(특히 WildDash val 포함)로 OOD 탐지기를 학습시키면 최상의 OOD 탐지 성능이 나타나며, 학습에 도전적인 예제를 포함하는 이점이 확인됩니다.
- Vistas를 ID 데이터로 사용하는 모델이 강한 OOD 탐지 성능을 보이는 반면, Cityscapes만으로는 과적합과 WildDash 일반화 저하가 발생할 수 있습니다.
- ILSVRC와 도로 주행 데이터셋을 함께 학습시킨 경우 최적의 OOD 탐지 성능을 보여주고, 다양한 테스트 설정에서 베이스라인 대비 AP가 크게 증가합니다.
- 이 접근법은 포괄적인 배경 분포와 픽셀 수준의 OOD 라벨링이 Dense 예측에서 인식 가능한 불확실성 추정을 개선하는 데 중요함을 시사합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.