[논문 리뷰] Compositional Video Synthesis with Action Graphs
이 논문은 시간이 지남에 따라 조율된 행동을 인코딩하는 구조적 행동 그래프를 조건으로 삼아 복합 비디오 합성을 위한 새로운 프레임워크인 Action Graph to Video (AG2Vid)를 제안한다. 시계가 연결된 간선을 사용해 행동을 스케줄링하고 계층적 모델을 통해 레이아웃과 픽셀을 예측함으로써 AG2Vid는 더 높은 의미 일致성과 시각적 품질을 갖춘 비디오를 생성하며, CATER와 Something-Something V2에서 새로운 행동 조합에 대한 강력한 제로샷 일반화 성능을 입증한다.
Videos of actions are complex signals containing rich compositional structure in space and time. Current video generation methods lack the ability to condition the generation on multiple coordinated and potentially simultaneous timed actions. To address this challenge, we propose to represent the actions in a graph structure called Action Graph and present the new ``Action Graph To Video'' synthesis task. Our generative model for this task (AG2Vid) disentangles motion and appearance features, and by incorporating a scheduling mechanism for actions facilitates a timely and coordinated video generation. We train and evaluate AG2Vid on the CATER and Something-Something V2 datasets, and show that the resulting videos have better visual quality and semantic consistency compared to baselines. Finally, our model demonstrates zero-shot abilities by synthesizing novel compositions of the learned actions. For code and pretrained models, see the project page https://roeiherz.github.io/AG2Video
연구 동기 및 목표
- 현재 비디오 생성 모델이 다수의 조율된 행동과 시간 조절 기능을 제어할 수 없음에 대비하여 해결하고자 한다.
- 구조적 입력 표현을 통해 비디오 합성에서 행동의 정밀한 시공간 제어를 가능하게 하고자 한다.
- 학습된 행동의 복잡한 새로운 조합으로부터 현실적인 비디오를 합성할 수 있는 생성 모델을 개발하고자 한다.
- 학습 중에 볼 수 없었던 행동 조합과 시간 변형에 대한 제로샷 일반화 성능을 평가하고자 한다.
제안 방법
- 행동를 행동 그래프(AG)를 사용해 표현하며, 노드는 물체이고 간선은 시작/종료 시간과 공간적 특성을 포함한다.
- 행동 진행 상황을 시간에 따라 추적하기 위해 '시계가 연결된 간선'을 도입하여 생성 과정에서 시간적 스케줄링을 가능하게 한다.
- 시계가 연결된 간선을 갖는 AG 위에서 작동하는 그래프 신경망을 사용해 프레임 단위로 중간 장면 레이아웃을 예측한다.
- 예측된 레이아웃을 조건으로 하여 확산 또는 순차적 모델을 사용해 픽셀 수준의 비디오 생성을 수행한다.
- AG와 생성된 비디오 간의 정렬을 보장하기 위해 시공간 손실을 사용해 모델을 엔드 투 엔드로 훈련한다.
- 생성 품질과 제어를 향상시키기 위해 분리된 운동 및 외관 특징을 통합한다.
실험 결과
연구 질문
- RQ1구조적 입력을 사용해 다수의 동시에 발생하고 시간이 조절된 행동을 효과적으로 조건으로 삼을 수 있는가?
- RQ2학습 중에 볼 수 없었던 행동 조합에 대해 모델이 제로샷 일반화를 수행할 수 있는가?
- RQ3모델이 생성된 비디오에서 행동의 정밀한 시간 조절을 어느 정도 제어할 수 있는가?
- RQ4기존 기준 모델 대비 의미 일치성과 시각적 품질을 얼마나 잘 유지하는가?
주요 결과
- 인간 평가에서 AG2Vid는 행동의 정확한 타이밍을 89.45%의 정확도로 확인하여 행동 스케줄링에 대한 정밀한 제어를 입증했다.
- 모델는 강력한 제로샷 일반화 성능을 보였으며, CATER에서 평균 클래스 재현율 96.65%와 Something-Something V2에서 87.5%를 기록하여 새로운 복합 행동에 대해 뛰어난 성능을 보였다.
- CATER와 Something-Something V2 양쪽에서 AG2Vid가 생성한 비디오는 기준 모델 대비 뛰어난 시각적 품질과 의미 일치성을 확보했다.
- 학습 중에 볼 수 없었던 구성(4개의 물체와 2개의 동시에 발생하는 행동, 3개의 연속 행동 포함)을 가진 복잡한 AG조차도 모델이 성공적으로 비디오를 생성했다.
- 시계가 연결된 간선의 사용은 행동 진행 상황을 효과적으로 추적할 수 있게 하여 다수의 에이전트와 행동 간의 조율된 생성을 가능하게 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.