[논문 리뷰] Adversarial Cross-Domain Action Recognition with Co-Attention
이 논문은 원천 도메인과 대상 도메인 간에 시간적으로 대응하는 동작 정보가 풍부한 세그먼트를 정렬하는 데 사용되는 새로운 교차 도메인 공주의 메커니즘을 사용하는 시간적 공주의 네트워크(TCoN)를 제안한다. TCoN은 대상에 맞춘 원천 특징을 생성하고 이러한 시간적으로 정렬된 특징의 분포를 매칭함으로써, 세 가지 벤치마크 데이터셋에서 기존 방법보다 뚜렷하게 뛰어난 성능을 내며 교차 도메인 행동 인식 분야에서 최신 기술(SOTA) 성능을 달성한다.
Action recognition has been a widely studied topic with a heavy focus on supervised learning involving sufficient labeled videos. However, the problem of cross-domain action recognition, where training and testing videos are drawn from different underlying distributions, remains largely under-explored. Previous methods directly employ techniques for cross-domain image recognition, which tend to suffer from the severe temporal misalignment problem. This paper proposes a Temporal Co-attention Network (TCoN), which matches the distributions of temporally aligned action features between source and target domains using a novel cross-domain co-attention mechanism. Experimental results on three cross-domain action recognition datasets demonstrate that TCoN improves both previous single-domain and cross-domain methods significantly under the cross-domain setting.
연구 동기 및 목표
- 학습 데이터와 테스트 데이터가 서로 다른 분포를 가진 경우 발생하는 도메인 이동 문제를 해결하기 위해.
- 기존 방법들이 교차 도메인 환경에서 시간적 비일치성과 노이즈가 많은 세그먼트 매칭 문제를 다루지 못하는 한계를 극복하기 위해.
- 라벨이 부여된 원천 도메인 데이터를 활용하여 라벨이 없는 대상 도메인 비디오에서의 행동 인식 성능을 향상시키기 위해.
- 더 나은 특징 정렬을 위해 세그먼트 중요도와 교차 도메인 유사도를 동시에 고려하는 공주의 메커니즘을 설계하기 위해.
제안 방법
- 세그먼트의 자기 중요도와 교차 도메인 유사도를 기반으로 attention 점수를 계산하는 교차 도메인 공주의 모듈을 제안한다.
- 원천 특징을 대상 특징과 시간 순서에 따라 정렬하여 대상에 맞춘 원천 특징을 생성함으로써 분포 매칭을 향상시킨다.
- 대상에 맞춘 원천 특징과 대상 특징 간의 도메인 차이를 최소화하기 위해 세그먼트 수준의 판별자(Discriminator)를 도입한다.
- 두 개의 스트림으로 구성된 적대적 훈련 설정을 사용한다: 하나는 행동 분류를 위한 스트림이고, 다른 하나는 세그먼트 수준에서의 도메인 식별을 위한 스트림이다.
- 시간적 공주의 메커니즘을 적용하여 도메인 간에 의미적으로 유사한 핵심 프레임에 집중함으로써 배경이나 관련 없는 세그먼트에서 유래하는 노이즈를 줄인다.
- 정렬된 원천 특징을 시간 순서에 따라 연결하여 대상 비디오와 시간적으로 일관된 행동 수준의 표현을 형성한다.
실험 결과
연구 질문
- RQ1내부 도메인 중요도와 외부 도메인 유사도를 모두 고려하는 공주의 메커니즘이 교차 도메인 행동 인식을 향상시킬 수 있는가?
- RQ2원천 특징을 대상 비디오의 시간적 구조와 정렬함으로써 분포 매칭과 인식 정확도가 향상되는가?
- RQ3제안된 방법은 기존의 도메인 적응 기법들과 비교해 시간적 비일치 문제를 어떻게 다루는가?
- RQ4원천 도메인과 대상 도메인이 동일한 행동 클래스를 공유하지 않을 경우 모델의 일반화 능력은 어느 정도인가?
주요 결과
- TCoN은 세 가지 교차 도메인 행동 인식 벤치마크에서 최신 기술(SOTA) 성능을 달성했다: HMDB51→UCF101, UCF101→HMDB51, Jester(S)→Jester(T).
- Jester(S)→Jester(T) 분할에서 TCoN은 상위-1 정확도 89.7%를 기록하여 이전의 최신 기술 방법보다 2.1% 높은 성능을 보였다.
- 제거 실험 결과, 공주의 메커니즘과 대상에 맞춘 원천 특징 모두가 필수적임을 확인하였으며, 특히 후자는 시간적 비일치를 감소시키고 성능 향상에 기여하였다.
- 공주의 매트릭스 시각화 결과, 모델이 도메인 간 핵심 행동 단계(예: 디스크스로우 비디오에서의 던지기 단계)를 성공적으로 정렬하고 있음을 확인하였다.
- t-SNE 시각화 결과, TCoN의 대상에 맞춘 원천 특징가 원천과 대상 간의 분포 격차를 줄이며 더 매끄럽고 뭉친 특징 공간을 형성하고 있음을 보여주었다.
- 비교적 도전적인 설정, 즉 동일한 행동 클래스가 겹치지 않는 경우(HMDB51→UCF101_all)에서도 TCoN은 강력한 성능 유지를 보이며 도메인 이동에 대한 강건성을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.