[논문 리뷰] Anytime Dense Prediction with Confidence Adaptivity
이 논문은 세분화 및 인간 자세 추정을 위한 점진적이고 신뢰도 적응형 추론을 가능하게 하는, 처음으로 엔드 투 엔드 anytime 밀도 예측 프레임워크인 ADP-C를 제안한다. 인코더-디코더 헤드를 사용해 초기 종료 구조를 재설계하고, 예측 신뢰도 기반으로 공간적으로 적응형 계산을 적용함으로써, Cityscapes와 MPII에서 각각 총 FLOPs를 44.4%와 59.1% 감소시켰지만 기준 모델과 동일한 최종 정확도를 유지한다.
Anytime inference requires a model to make a progression of predictions which might be halted at any time. Prior research on anytime visual recognition has mostly focused on image classification. We propose the first unified and end-to-end approach for anytime dense prediction. A cascade of "exits" is attached to the model to make multiple predictions. We redesign the exits to account for the depth and spatial resolution of the features for each exit. To reduce total computation, and make full use of prior predictions, we develop a novel spatially adaptive approach to avoid further computation on regions where early predictions are already sufficiently confident. Our full method, named anytime dense prediction with confidence (ADP-C), achieves the same level of final accuracy as the base model, and meanwhile significantly reduces total computation. We evaluate our method on Cityscapes semantic segmentation and MPII human pose estimation: ADP-C enables anytime inference without sacrificing accuracy while also reducing the total FLOPs of its base models by 44.4% and 59.1%. We compare with anytime inference by deep equilibrium networks and feature-based stochastic sampling, showing that ADP-C dominates both across the accuracy-computation curve. Our code is available at https://github.com/liuzhuang13/anytime .
연구 동기 및 목표
- 예측을 언제든지 중단해도 점진적으로 향상되는 품질을 갖는 밀도 예측 작업을 위한 anytime 추론을 가능하게 하기 위해.
- 특히 실시간 또는 저자원 환경에서의 구현을 위해 최종 정확도를 희생시키지 않고 밀도 예측 모델의 계산 비용을 줄이기 위해.
- 다양한 예측 단계와 공간적으로 적응형 계산을 지원하는 통합된 엔드 투 엔드 훈련 가능한 프레임워크를 설계하기 위해.
- 공간 및 레이어 간에 이미 높은 신뢰도를 보이는 예측에 대해 불필요한 계산을 방지하는 신뢰도 기반 마스킹 메커니즘을 개발하기 위해.
제안 방법
- 다양한 단계에서의 특징 깊이와 공간 해상도 변화를 처리하기 위해 인코더-디코더 헤드를 갖춘 초기 종료의 계열을 도입한다.
- 충분한 수신 영역과 공간 스무딩을 보장하기 위해 종료 헤드를 재설계하여 초기 예측 품질을 향상시킨다.
- 예측 신뢰도가 높은 픽셀을 마스킹하여 공간적으로 적응형 추론을 적용하고, 이들의 출력을 유지하며 이후 레이어의 컨볼루션을 건너뛴다.
- 클래스 예측의 최대 확률을 신뢰도 측정 기준으로 사용하여 어느 픽셀을 마스킹하고 추가 계산을 생략할지 결정한다.
- 컨볼루션을 대신해 마스킹된 픽셀의 특징을 보간함으로써 FLOPs를 감소시키면서도 예측 일관성을 유지한다.
- 모든 종료 지점과 신뢰도 기반 마스킹 메커니즘을 포함한 전체 모델을 엔드 투 엔드로 훈련하여 정확도와 효율성을 동시에 최적화한다.
실험 결과
연구 질문
- RQ1통합적이고 엔드 투 엔드 딥 러닝 프레임워크가 점진적인 정확도 향상과 함께 anytime 밀도 예측을 지원할 수 있는가?
- RQ2밀도 예측의 공간적 구조는 어떻게 활용하여 정확도 손실 없이 계산을 줄일 수 있는가?
- RQ3밀도 예측 작업에서 효과적이고 효율적인 공간적 적응형 추론을 가능하게 하는 신뢰도 측정 기준은 무엇인가?
- RQ4신뢰도 기반 계산은 균일하거나 무작위 마스킹과 비교해 정확도 및 FLOP 감소 측면에서 어떻게 성능을 내는가?
- RQ5제안된 방법은 다양한 밀도 예측 벤치마크에서 최종 모델 정확도를 유지하면서도 상당한 FLOPs 감소를 달성할 수 있는가?
주요 결과
- ADP-C는 기준 HRNet-W18 모델과 비교해 Cityscapes 세분화 작업에서 총 FLOPs를 44.4% 감소시키고, MPII 자세 추정에서 59.1% 감소시켰다.
- ADP-C의 최종 예측 결과는 기준 모델과 동일한 mIoU를 달성하여, 계산량 감소에도 불구하고 정확도 저하가 발생하지 않았음을 보여준다.
- 최대 확률 기반 마스킹은 고정 비율 및 무작위 마스킹보다 우수했으며, 엔트로피 기반 신뢰도 역시 유사한 성능를 보였지만 효율성이 떨어졌다.
- 제거 실험을 통해 인코더-디코더 구조를 갖춘 재설계된 종료 헤드가 초기 예측 품질과 정확도-계산량 트레이드오프를 크게 향상시킴을 확인했다.
- 시각화 결과는 높은 신뢰도 영역(예: 도로, 하늘)이 조기에 마스킹되는 반면, 복잡한 영역(예: 보행자, 가림된 사지)은 더 깊이 처리되는 것으로 나타나 직관적인 계산 할당과 일치함을 보였다.
- 두 벤치마크에서 ADP-C는 정확도-계산량 곡선 전반에서 딥 에คว일리브리엄 네트워크와 피처 기반 스토케스틱 샘플링을 모두 압도했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.