Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-Domain First Person Audio-Visual Action Recognition through Relative Norm Alignment

Mirco Planamente, Chiara Plizzari|arXiv (Cornell University)|2021. 06. 03.
Human Pose and Action Recognition참고 문헌 58인용 수 6
한 줄 요약

이 논문은 시각적 및 청각적 특징의 상대적 크기를 기반으로 기여도를 동적으로 조정함으로써 교차 도메인 1인칭 행동 인식 성능을 향상시키는 새로운 청각-시각 손실인 상대 노름 정렬(Relative Norm Alignment, RNA)을 제안한다. 모odal별 특징의 상대 노름을 정렬함으로써 RNA는 도메인 일반화 및 비지도 도메인 적응 설정 모두에서 일반화 성능을 햖थ하고, 간단한 아키텍처로 EPIC-Kitchens에서 최신 기준 성능을 달성한다.

ABSTRACT

First person action recognition is an increasingly researched topic because of the growing popularity of wearable cameras. This is bringing to light cross-domain issues that are yet to be addressed in this context. Indeed, the information extracted from learned representations suffers from an intrinsic environmental bias. This strongly affects the ability to generalize to unseen scenarios, limiting the application of current methods in real settings where trimmed labeled data are not available during training. In this work, we propose to leverage over the intrinsic complementary nature of audio-visual signals to learn a representation that works well on data seen during training, while being able to generalize across different domains. To this end, we introduce an audio-visual loss that aligns the contributions from the two modalities by acting on the magnitude of their feature norm representations. This new loss, plugged into a minimal multi-modal action recognition architecture, leads to strong results in cross-domain first person action recognition, as demonstrated by extensive experiments on the popular EPIC-Kitchens dataset.

연구 동기 및 목표

  • 학습된 표현에서 환경적 편향으로 인한 도메인 이동 문제를 해결하기 위해.
  • 학습 중 타겟 데이터에 접근할 필요 없이 미관측 도메인으로의 일반화를 향상시키기 위해.
  • 청각 및 시각 모달리티의 상보적 성질을 활용하여 다양한 환경에서의 강건성 향상시키기 위해.
  • 복잡한 아키텍처 없이도 효과적이고 경량의 손실 함수를 개발하여 모달리티 간 협업을 향상시키기 위해.
  • 에고세트릭 비디오 행동 인식에서 단일 소스 및 다중 소스 도메인 일반화에 대한 새로운 벤치마크를 수립하기 위해.

제안 방법

  • 시각적 및 청각적 특징 노름의 상대 크기에 기반한 새로운 다중모달 손실인 상대 노름 정렬(Relative Norm Alignment, RNA)을 제안한다.
  • RNA 손실은 학습 중에 두 모달리티의 노름 분포 간 격차를 최소화함으로써 각 모달리티의 기여도를 동적으로 조정한다.
  • 유연성을 확보하기 위해 늦은 수준 또는 중간 수준의 특징 융합을 통한 단순한 청각-시각 이중 스트림 네트워크에 통합된다.
  • 손실 함수는 내부 클래스의 밀도와 구조적 분류 능력을 유지하면서도 모달리티 불균형을 줄이도록 설계된다.
  • EPIC-Kitchens 데이터셋에서 도메인 일반화(DG) 및 비지도 도메인 적응(UDA) 설정 모두에서 검증된다.
  • 제거 분석을 통해 RNA는 딱딱한 노름 정렬 기반(Baseline) 및 표준 자기지도 동기화 작업과 비교된다.

실험 결과

연구 질문

  • RQ11인칭 행동 인식에서 청각 및 시각 모달리티를 효과적으로 균형 조정하여 도메인 이동을 줄일 수 있는가?
  • RQ2청각 및 시각 스트림의 상대적 특징 노름을 동적으로 정렬함으로써 새로운 환경 간 일반화 성능이 향상되는가?
  • RQ3교차 도메인 설정에서 제안된 RNA 손실은 적대적 및 자기지도 정렬 방법과 비교해 어떻게 성능을 내는가?
  • RQ4RNA와 같은 경량의 모달리티 특화 손실이 도메인 일반화 과제에서 더 복잡한 아키텍처를 능가할 수 있는가?
  • RQ5RNA 손실은 클래스 활성화 맵을 통해 더 국소화되고 해석 가능한 주의를 유도하는가?

주요 결과

  • 다중 소스 도메인 일반화 설정에서 RNA는 51.06%의 상위-1 정확도를 달성하여 베이스라인 대비 6.39%p 향상되었다.
  • 비지도 도메인 적응 설정에서 RNA는 47.71%의 정확도를 기록하여 베이스라인 대비 1.95%p 향상되었다.
  • 적대적 정렬 방법 대비 성능이 4% 향상되었으며, 더 복잡한 MM-SADA 방법과 유사한 성능을 내는 데 성공했고, 간단한 아키텍처를 사용했다.
  • 제거 분석 결과 RNA는 고정된 노름 조정 방식인 하드 노름 정렬(HNA)보다 일관되게 뛰어난 성능을 보여, 상대적 조정의 이점이 확인되었다.
  • 정성적 분석 결과 RNA는 특징 선택도를 향상시키며, 상위 300개 특징이 노름 기여도를 유지하거나 증가시켜 더 선명한 클래스 활성화 맵을 유도하였다.
  • RNA와 적대적 정렬의 조합은 약간의 성능 향상을 가져왔으며, 분포 보존과 모달리티 균형 조정의 상호보완적 강점이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.