Skip to main content
QUICK REVIEW

[논문 리뷰] Uncertainty aware audiovisual activity recognition using deep Bayesian variational inference

Mahesh Subedar, Ranganath Krishnan|arXiv (Cornell University)|2018. 11. 27.
Human Pose and Action Recognition참고 문헌 49인용 수 7
한 줄 요약

이 논문은 깊이 있는 베이지안 변동형 추론을 사용하여 예측 불확실성 인식이 가능한 다중모态 청각 활동 인식 프레임워크를 제안한다. 결정론적 및 변동형 레이어를 결합하여 베이지안 딥 네트워크의 스케일링을 향상시켜 불확실성 추정을 개선한다. 이 방법은 UCF101 및 Moments-in-Time 데이터셋에서 비베이지안 기반 모델 대비 정밀도-재현율 AUC에서 10.2% 향상되었으며, 분포 외 샘플을 효과적으로 식별한다.

ABSTRACT

Deep neural networks (DNNs) provide state-of-the-art results for a multitude of applications, but the approaches using DNNs for multimodal audiovisual applications do not consider predictive uncertainty associated with individual modalities. Bayesian deep learning methods provide principled confidence and quantify predictive uncertainty. Our contribution in this work is to propose an uncertainty aware multimodal Bayesian fusion framework for activity recognition. We demonstrate a novel approach that combines deterministic and variational layers to scale Bayesian DNNs to deeper architectures. Our experiments using in- and out-of-distribution samples selected from a subset of Moments-in-Time (MiT) dataset show a more reliable confidence measure as compared to the non-Bayesian baseline and the Monte Carlo dropout (MC dropout) approximate Bayesian inference. We also demonstrate the uncertainty estimates obtained from the proposed framework can identify out-of-distribution data on the UCF101 and MiT datasets. In the multimodal setting, the proposed framework improved precision-recall AUC by 10.2% on the subset of MiT dataset as compared to non-Bayesian baseline.

연구 동기 및 목표

  • 딥 네트워크를 사용한 다중모달 청각 활동 인식에서 예측 불확실성 모델링의 부족을 해결하기 위해.
  • 더 깊은 모델을 위한 확장 가능한 베이지안 딥 러닝 아키텍처를 개발하여 결정론적 및 변동형 레이어를 통합하기 위해.
  • 모odal별 불확실성 측정을 통해 신뢰할 수 있는 불확실성 인식 다중모달 융합을 가능하게 하기 위해.
  • 청각 활동 인식 작업에서 불확실성 추정을 사용하여 분포 외 샘플을 식별하기 위해.
  • 노이즈가 많거나 모호한 입력이 있는 실세계 배포 시나리오에서 모델의 신뢰성과 강건성을 향상시키기 위해.

제안 방법

  • 베이지안 딥 네트워크를 더 깊은 네트워크로 확장하기 위해 결정론적 및 변동형 레이어를 결합한 하이브리드 베이지안 DNN 아키텍처를 제안한다.
  • 네트워크 가중치에 대한 사후분포를 근사하기 위해 확률적 변동형 추론(SVI)을 사용하여 불확실성 정량화를 가능하게 한다.
  • 가중치의 사후분포에 대해 마르진라이즈하여 예측 불확실성 계산을 위한 베이지안 신경망 추론을 수행한다.
  • BALD 및 예측 엔트로피와 같은 불확실성 측정법을 사용하여 분포 외 입력을 탐지한다.
  • 다중모달 융합 전략에 모달별 불확실성 추정치를 통합하여 의사결정의 신뢰도와 정확도를 향상시킨다.
  • Moments-in-Time(MiT) 데이터셋을 사용해 모델을 훈련하고, MiT 및 UCF101에서의 분포 내 및 분포 외 샘플에서 평가한다.

실험 결과

연구 질문

  • RQ1변동형 추론을 사용하는 베이지안 딥 러닝 프레임워크가 청각 활동 인식에서 비베이지안 DNN 및 MC 드롭아웃 대비 더 신뢰할 수 있는 불확실성 추정치를 제공할 수 있는가?
  • RQ2제안된 결정론적-변동형 아키텍처가 불확실성 추정 성능를 유지하면서 더 깊은 네트워크로 확장될 수 있는가?
  • RQ3제안된 프레임워크의 불확실성 추정치가 청각 인식 작업에서 분포 외 샘플을 효과적으로 식별할 수 있는가?
  • RQ4불확실성 인식 다중모달 융합은 기존 비베이지안 융합 대비 정밀도-재현율 AUC를 향상시키는가?
  • RQ5다양한 불확실성 측정법(예: BALD, 예측 엔트로피)은 분포 내 및 분포 외 입력을 어떻게 구분하는가?

주요 결과

  • 확률적 변동형 추론을 사용하는 제안된 베이지안 DNN는 MiT 데이터셋에서 비베이지안 DNN 기반 모델 대비 정밀도-재현율 AUC에서 10.2% 향상되었다.
  • 베이지안 DNN 모델은 청각 융합 작업에서 비베이지안 DNN(56.61% 및 79.39%) 대비 더 높은 상위 1위 및 상위 5위 정확도(58.2% 및 83.8%)를 보였다.
  • 제안된 프레임워크의 불확실성 추정치는 BALD 및 예측 엔트로피의 밀도 히스토그램을 통해 분포 내 및 분포 외 샘플 간 명확한 분리가 이루어졌음을 보여주었다.
  • 정확도 및 불확실성 캘리브레이션 측면에서 MC 드롭아웃 기반 베이지안 DNN보다 뛰어난 성능을 보였으며, 청각 작업에서 정밀도-재현율 AUC가 3.8% 높았다.
  • 확률적 SVI를 사용하는 베이지안 DNN는 시각 전용 모델 대비 9.2%의 상위 1위 정확도 향상을 기록하여 모달별 불확실성 융합이 효과적임을 입증하였다.
  • MiT 데이터셋에서의 분포 외 데이터를 UCF101의 분포 내 샘플에서 테스트한 결과 성공적으로 식별되었으며, 분포 이동에 대한 강건성을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.