[논문 리뷰] JOKR: Joint Keypoint Representation for Unsupervised Cross-Domain Motion Retargeting
JOKR는 도메인 간 불변 키포인트 임베딩을 통해 운동과 외관을 분리하는 공동 키포인트 표현을 도입하여 무 supervision으로 다양한 도메인 간 운동 리타겟팅을 가능하게 한다. 이 방법은 쌍화된 데이터가 없이도 스케일 및 회전 차이에 대해 강건한 애핀 인variant 키포인트 표현을 사용하여, 동물, 꽃, 무용수 등 다양한 형태와 스타일을 가진 영상 간에 시간적으로 일관되고 시각적으로 현실적인 운동 전이를 달성한다.
The task of unsupervised motion retargeting in videos has seen substantial advancements through the use of deep neural networks. While early works concentrated on specific object priors such as a human face or body, recent work considered the unsupervised case. When the source and target videos, however, are of different shapes, current methods fail. To alleviate this problem, we introduce JOKR - a JOint Keypoint Representation that captures the motion common to both the source and target videos, without requiring any object prior or data collection. By employing a domain confusion term, we enforce the unsupervised keypoint representations of both videos to be indistinguishable. This encourages disentanglement between the parts of the motion that are common to the two domains, and their distinctive appearance and motion, enabling the generation of videos that capture the motion of the one while depicting the style of the other. To enable cases where the objects are of different proportions or orientations, we apply a learned affine transformation between the JOKRs. This augments the representation to be affine invariant, and in practice broadens the variety of possible retargeting pairs. This geometry-driven representation enables further intuitive control, such as temporal coherence and manual editing. Through comprehensive experimentation, we demonstrate the applicability of our method to different challenging cross-domain video pairs. We evaluate our method both qualitatively and quantitatively, and demonstrate that our method handles various cross-domain scenarios, such as different animals, different flowers, and humans. We also demonstrate superior temporal coherency and visual quality compared to state-of-the-art alternatives, through statistical metrics and a user study. Source code and videos can be found at https://rmokady.github.io/JOKR/ .
연구 동기 및 목표
- 객체별 사전 지식이나 레이블 데이터가 없이도 서로 다른 형태와 스타일을 가진 영상 간에 무 supervision으로 운동 리타겟팅을 가능하게 하는 것.
- 다양한 도메인 간 공통의 도메인 불변 키포인트 표현을 학습하여 운동 콘텐츠를 외관과 형태에서 분리하는 것.
- 최신 기법들과 비교해 도메인 간 영상 생성에서 시간적 일관성과 시각적 품질을 향상시키는 것.
- 생성된 영상에서 해석 가능하고 편집 가능한 키포인트 조작을 통해 직관적인 제어를 가능하게 하는 것.
- 비교적 어려운 도메인 쌍, 예를 들어 비율이 다른 동물이나 비인간 주제에 대해서도 운동 리타겟팅의 적용 가능성을 확장하는 것.
제안 방법
- 이 방법은 소스 영상 및 타겟 영상 양쪽에서 공동 키포인트 표현(JOKR)을 추출하기 위해 공유된 키포인트 헤드를 갖춘 인코더-디코더 아키텍처를 사용한다.
- 도메인 혼동 손실을 적용하여 키포인트 특징이 도메인 간에 구별되지 않도록 하여 공통 운동과 도메인 특화된 외관 및 형태를 분리한다.
- 학습된 애핀 변환을 JOKR에 적용하여 애핀 불변성을 확보함으로써 스케일, 회전, 종횡비의 차이에 대해 강건성을 확보한다.
- 시간적 정규화를 통해 연속 프레임 간 키포인트 이동을 제약하여 매끄럽고 일관된 운동을 보장한다.
- 수동적인 키포인트 위치 조작을 통해 의미 있는 운동 변형을 생성할 수 있도록 직관적인 편집을 지원한다.
- 두 단계 생성 과정을 사용한다: 먼저 키포인트에서 형태를 재구성하고, 그 다음에 타겟 스타일을 적용하여 최종 영상 프레임을 생성한다.
실험 결과
연구 질문
- RQ1다른 형태와 스타일을 가진 영상 간에 무 supervision으로 공동 키포인트 표현을 학습하여 운동 리타겟팅을 가능하게 할 수 있는가?
- RQ2공통 운동과 도메인 특화된 외관 및 기하학적 특징을 분리하기 위해 도메인 혼동을 효과적으로 적용할 수 있는가?
- RQ3애핀 불변 키포인트 표현이 도메인 간 운동 전이에서 스케일 및 회전 차이에 대해 얼마나 강건한가?
- RQ4학습된 키포인트 표현이 생성된 영상 운동에 대해 직관적이고 의미 수준의 편집을 지원할 수 있는가?
- RQ5다양한 도메인 간 영상 쌍에서 최신 기법들과 비교해 시간적 일관성과 시각적 품질 측면에서 제안된 방법이 얼마나 우수한가?
주요 결과
- 시간 정규화를 적용한 경우, 인접 프레임 간 정규화된 키포인트 이동 거리가 0.0023으로, 이를 생략한 경우 0.0055보다 훨씬 낮아 시간적 일관성이 뛰어나다.
- 도메인 혼동 손실을 생략할 경우, 키포인트 표현이 형태와 텍스처 정보를 포착하게 되어 분리가 어려워지고 아티팩트가 발생한다.
- 시간 정규화를 생략할 경우, 비정상적인 키포인트 이동으로 인해 운동이 일관되지 않게 되고, 몸통 일부가 사라지는 등의 눈에 띄는 아티팩트가 발생한다.
- 제거 실험 결과, 두 단계 생성 과정(먼저 형태 재구성, 그 다음 스타일 적용)이 직접 키포인트에서 프레임을 생성하는 것보다 더 높은 시각적 품질을 제공함을 확인했다.
- 학습된 애핀 변환은 훈련 안정성을 크게 향상시키며, 수평 고양이와 기울인 호랑이처럼 기울기와 스케일이 다른 영상의 성공적인 리타겟팅을 가능하게 한다.
- 사용자 연구와 정량적 지표는 JOKR가 동물, 꽃, 무용수 등 다양한 도메인 쌍에서 최신 기법들보다 시각적 품질과 시간적 일관성 측면에서 뛰어나다는 것을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.