Skip to main content
QUICK REVIEW

[논문 리뷰] Representation Learning via Adversarially-Contrastive Optimal Transport

Anoop Cherian, Shuchin Aeron|arXiv (Cornell University)|2020. 07. 11.
Human Pose and Action Recognition인용 수 5
한 줄 요약

이 논문은 저차원 데이터 부분공간, 워샤르스테인 GAN을 통한 적대적 부정 샘플 생성, 최적 운반 이론를 이용한 시간적 순서 제약 조건을 동시에 최적화하는 새로운 표현 학습 프레임워크인 적대적-대비 최적 운반(ACOT)을 제안한다. 이 방법은 적대적으로 생성된 노이즈와 효과적으로 대비되는 강건하고 압축된 표현을 학습하여 영상 행동 인식에서 경쟁적인 성능을 달성한다.

ABSTRACT

In this paper, we study the problem of learning compact (low-dimensional) representations for sequential data that captures its implicit spatio-temporal cues. To maximize extraction of such informative cues from the data, we set the problem within the context of contrastive representation learning and to that end propose a novel objective via optimal transport. Specifically, our formulation seeks a low-dimensional subspace representation of the data that jointly (i) maximizes the distance of the data (embedded in this subspace) from an adversarial data distribution under the optimal transport, a.k.a. the Wasserstein distance, (ii) captures the temporal order, and (iii) minimizes the data distortion. To generate the adversarial distribution, we propose a novel framework connecting Wasserstein GANs with a classifier, allowing a principled mechanism for producing good negative distributions for contrastive learning, which is currently a challenging problem. Our full objective is cast as a subspace learning problem on the Grassmann manifold and solved via Riemannian optimization. To empirically study our formulation, we provide experiments on the task of human action recognition in video sequences. Our results demonstrate competitive performance against challenging baselines.

연구 동기 및 목표

  • 시계열 영상 데이터에 대해 스펙트럴-시간적 구조를 유지하는 저차원 표현을 학습하는 데 도전하는 것.
  • 무작위 또는 히우리스틱 부정 샘플에 의존하는 대신, 고품질의 임무 관련 부정 샘플을 생성하여 대비 표현 학습을 향상시키는 것.
  • 최적 운반 기반의 통합 목표 함수를 이용해 표현 학습, 적대적 부정 샘플 생성, 시간적 순서 제약 조건을 동시에 최적화하는 것.
  • 투영된 표현이 원본 데이터와 임베딩 공간에서 가까이 유지되도록 하는 전용 왜곡 페널티를 통해 데이터 왜곡을 줄이고 무결성을 유지하는 것.

제안 방법

  • 워샤르스테인 거리 기반으로 적대적 노이즈로부터의 최대 분離를 달성하는 저차원 부분공간을 찾기 위해 표현 학습을 그라스만 다양체 최적화 문제로 공식화한다.
  • 양성 데이터를 조건으로 삼아 적대적 노이즈를 생성하는 새로운 WGAN 기반 프레임워크를 도입하여, 높은 분류 능력을 유지하면서도 입력 분포와의 관련성을 유지한다.
  • 양성 데이터와 생성된 부정 샘플을 최적 운반을 통해 연결하여, 데이터 포인트가 가장 가까운 부정 샘플에 할당되는 소프트하고 확률적인 할당을 학습한다.
  • 투영된 표현 내에서 순차적 구조를 유지하기 위해 시간적 순서 제약 조건을 통합한다.
  • 투영된 표현이 원본 데이터와 임베딩 공간에서 가까이 유지되도록 하기 위해 왜곡 페널티를 통합한다.
  • 선형 분류기를 사용하여 생성기의 적대적 샘플이 잘못 분류되도록 유도함으로써, 분류 능력과 표현 품질 사이의 근본적인 트레이드오프를 가능하게 한다.

실험 결과

연구 질문

  • RQ1무작위 또는 히우리스틱 부정 샘플에 비해, 적대적으로 생성된 부정 샘플이 영상 행동 인식에서 대비 표현 학습을 향상시키는가?
  • RQ2최적 운반 기반의 양성 및 부정 샘플 간 연결이 저차원 부분공간에서 표현 품질을 어떻게 향상시키는가?
  • RQ3표현 학습, 적대적 생성, 시간 모델링을 통합 최적화한 프레임워크가 영상 분류 작업 성능을 얼마나 향상시키는가?
  • RQ4분류기 유도 WGAN의 통합이 부정 샘플 품질을 향상시키고 최종 성능을 향상시키는가?
  • RQ5제안된 방법은 순차적 데이터에서 표현의 압축성, 왜곡, 시간 일관성을 어떻게 균형 잡는가?

주요 결과

  • 제안된 ACOT 프레임워크는 표준 특징을 사용하는 강력한 기준 모델들을 능가하는 성능을 영상 행동 인식 벤치마크에서 달성한다.
  • 분류기 유도 WGAN에 의한 부정 샘플 생성은 랜덤 또는 비적대적 부정 샘플링보다 더 효과적인 대비 표현 학습을 이끈다.
  • 왜곡 페널티를 통해 표현의 높은 무결성을 유지함으로써 과도한 정규화를 방지하고 분류 능력 있는 특징을 유지한다.
  • 부분공간 학습, 최적 운반 기반 연결, 시간 순서 제약 조건의 통합 최적화는 영상 시퀀스 전반에 걸쳐 잘 일반화되는 강건한 표현을 생성한다.
  • 분류기에서 WGAN 생성기의 속임수 비율은 약 500 반복 후 약 80%에 도달하여 효과적인 적대적 샘플 생성을 나타낸다.
  • 실증적 아블레이션 결과, 노이즈 주입에서 σ = 0.01이 적대적 품질과 최종 성능 사이의 최적 트레이드오프를 제공하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.