[논문 리뷰] From Third Person to First Person: Dataset and Baselines for Synthesis and Retrieval
이 논문은 동기화된 에고세트릭(1인칭) 및 에кс오세트릭(3인칭) 영상 쌍을 포함한 새로운 합성 및 실세계 데이터셋을 소개하며, 3인칭 시점에서 1인칭 영상 합성을 위한 조건부 GAN 기반 프레임워크를 제안한다. 합성 데이터에서 실세계 데이터로의 도메인 적응이 교차 시점 검색 성능을 향상시킴을 입증하였으며, 도메인 적응을 통한 두 스트림 3D CNN을 사용하여 실세계 1인칭 데이터에서 30.82%의 상위 1위 정확도를 달성하였다.
First-person (egocentric) and third person (exocentric) videos are drastically different in nature. The relationship between these two views have been studied in recent years, however, it has yet to be fully explored. In this work, we introduce two datasets (synthetic and natural/real) containing simultaneously recorded egocentric and exocentric videos. We also explore relating the two domains (egocentric and exocentric) in two aspects. First, we synthesize images in the egocentric domain from the exocentric domain using a conditional generative adversarial network (cGAN). We show that with enough training data, our network is capable of hallucinating how the world would look like from an egocentric perspective, given an exocentric video. Second, we address the cross-view retrieval problem across the two views. Given an egocentric query frame (or its momentary optical flow), we retrieve its corresponding exocentric frame (or optical flow) from a gallery set. We show that using synthetic data could be beneficial in retrieving real data. We show that performing domain adaptation from the synthetic domain to the natural/real domain, is helpful in tasks such as retrieval. We believe that the presented datasets and the proposed baselines offer new opportunities for further research in this direction. The code and dataset are publicly available.
연구 동기 및 목표
- 동기화된 기록을 포함한 새로운 데이터셋을 구축하여 1인칭 및 3인칭 영상 도메인 간 격차를 해소하기 위해.
- 시야각과 시점의 극명한 차이가 있음에도 불구하고, 3인칭 시점에서 1인칭 영상 합성을 위한 조건부 GAN을 활용하여 가능하게 하기 위해.
- 실세계 1인칭 데이터로의 도메인 적응을 통해 합성 데이터를 활용하여 교차 시점 검색 성능을 향상시키기 위해.
- 1인칭 및 3인칭 영상 도메인 간의 시점에 강인한 표현을 학습하여 검색 및 동작 인식에 효과적으로 활용할 수 있는지를 평가하기 위해.
제안 방법
- 게임 엔진을 사용하여 대규모 합성 데이터셋을 수집하고, 1인칭/3인칭 카메라 자세 및 인간 행동에 대한 프레임 단위의 주석을 제공한다.
- 다양한 인간 행동을 촬영한 신체에 장착된(1인칭) 및 고정된(3인칭) 카메라의 동기화된 기록을 포함한 소규모 실세계 데이터셋을 구축한다.
- 장면 및 자세를 조건으로 하여 3인칭 입력 영상에서 1인칭 영상 합성을 위한 조건부 GAN(cGAN)을 학습한다.
- 광학 흐름(2채널)과 RGB(3채널) 입력을 사용하여 시점 간 강인한 특징을 학습하기 위해, 두 스트림 3D CNN을 설계한다.
- 실세계 1인칭 데이터를 사용하여 합성 데이터로 학습된 검색 네트워크를 미세조정하여 일반화 성능을 향상시킨다.
- 마지막 완전 연결층에서 추출한 특징을 사용하여 SVM을 적용하여 시점 간 간섭성 및 동작 인식 성능을 평가한다.
실험 결과
연구 질문
- RQ1제한된 视野 겹침이 있음에도 불구하고, 조건부 GAN이 3인칭 영상 프레임에서 신뢰할 수 있는 1인칭 영상 합성을 효과적으로 수행할 수 있는가?
- RQ2합성 1인칭 데이터가 실세계 1인칭 데이터에서의 교차 시점 검색 성능에 어느 정도 기여하는가?
- RQ3딥 네트워크가 1인칭 및 3인칭 영상 도메인 간에 일반화 가능한 시점 간 강인한 표현을 학습할 수 있는가?
- RQ4합성 데이터에서 실세계 데이터로의 도메인 적응이 1인칭-3인칭 교차 시점 설정에서 검색 정확도에 어떤 영향을 미치는가?
- RQ51인칭 및 3인칭 시점의 특징을 결합하면, 각각의 시점만 사용할 경우보다 동작 인식 성능을 향상시킬 수 있는가?
주요 결과
- 제안된 cGAN 기반의 합성 네트워크는 3인칭 입력에서 현실적인 1인칭 시점 영상을 성공적으로 환기시키며, 고수준의 의미 일致성을 유지한다.
- 합성 데이터로 학습하고 실세계 데이터로 미세조정한 검색 네트워크를 사용할 경우, 실세계 1인칭 데이터에서 30.82%의 상위 1위 정확도를 달성하여 검색 성능 향상을 입증하였다.
- 실제 RGB 데이터로 학습한 검색 네트워크는 42.58%의 상위 1위 정확도를 기록하여, 합성 데이터 전용 기준선을 초월함으로써 실세계 데이터의 가치를 입증하였다.
- 합성 데이터에서 실세계 데이터로의 도메인 적응이 검색 성능 향상에 기여하였으며, 합성 데이터로 학습하고 실세계 데이터로 미세조정한 네트워크가 가장 우수한 성능(30.82%)을 기록하였다.
- 검색 네트워크가 학습한 시점 간 강인한 표현은 동작 인식 정확도를 유지하였으며, 병합된 시점 특징을 사용한 SVM은 실세계 데이터에서 30.82%의 정확도를 기록했고, 일부 경우에서 개별 시점 분류기보다 뛰어난 성능을 보였다.
- 합성 광학 흐름 데이터로 학습한 검색 네트워크는 실세계 1인칭 데이터에서 32.31%의 상위 1위 정확도를 기록하여, 합성 데이터가 운동 기반 검색에 효과적으로 기여할 수 있음을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.