[논문 리뷰] ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation
ConsistI2V는 첫 번째 프레임의 시공간 주의 메커니즘과 저주파수 대역에서 유도된 노이즈 초기화를 활용하여 이미지에서 영상 생성(I2V) 과정에서 시각적 일관성을 향상시키는 확산 기반 방법을 제안한다. 이 방법은 기존 방법들과 비교해 움직임의 부드러움, 객체 일관성, 레이아웃 충실도를 크게 향상시키며, I2V-Bench에서 최고 성능을 기록한다.
Image-to-video (I2V) generation aims to use the initial frame (alongside a text prompt) to create a video sequence. A grand challenge in I2V generation is to maintain visual consistency throughout the video: existing methods often struggle to preserve the integrity of the subject, background, and style from the first frame, as well as ensure a fluid and logical progression within the video narrative. To mitigate these issues, we propose ConsistI2V, a diffusion-based method to enhance visual consistency for I2V generation. Specifically, we introduce (1) spatiotemporal attention over the first frame to maintain spatial and motion consistency, (2) noise initialization from the low-frequency band of the first frame to enhance layout consistency. These two approaches enable ConsistI2V to generate highly consistent videos. We also extend the proposed approaches to show their potential to improve consistency in auto-regressive long video generation and camera motion control. To verify the effectiveness of our method, we propose I2V-Bench, a comprehensive evaluation benchmark for I2V generation. Our automatic and human evaluation results demonstrate the superiority of ConsistI2V over existing methods.
연구 동기 및 목표
- 이미지에서 영상 생성 과정에서 첫 번째 프레임의 주제, 배경, 스타일을 유지하지 못하는 시각적 일관성 문제를 해결하기 위해.
- 특히 장시간 또는 복잡한 서사적 영상에서 움직임의 부드러움과 시간적 일관성을 향상시키기 위해.
- 세부 조정 또는 아키텍처의 대대적 개선 없이도 안정적이고 일반화 가능한 방법을 개발하기 위해.
- 기존 표준 지표를 넘어서 I2V 생성 모델을 평가할 수 있는 종합적인 벤치마크인 I2V-Bench를 제안하기 위해.
- 일관성 있는 조건부 조건을 통해 자동 회귀적 장시간 영상 생성 및 카메라 움직임 제어와 같은 실용적 응용을 가능하게 하기 위해.
제안 방법
- 시공간 주의 메커니즘을 도입하여 영상 확산 모델이 첫 번째 프레임의 공간적 레이아웃과 운동 일관성을 유지하도록 시공간 차원에서 조건화한다.
- 공간 레이어에서 프레임 간 주의 메커니즘을 적용하여 첫 번째 프레임의 내용과 구조와의 정밀한 정렬을 강제한다.
- 움직임 궤적의 안정성 향상과 진동 감소를 위해 시간 주의 메커니즘에 첫 번째 프레임의 국소 윈도우 특징을 통합한다.
- 학습과 추론 시 노이즈 분포의 일치를 도모하기 위해 첫 번째 프레임의 저주파수 대역을 활용하는 FrameInit라는 노이즈 초기화 전략을 제안한다.
- 동일한 조건화 및 초기화 메커니즘을 재사용하여 자동 회귀적 장시간 영상 생성 및 카메라 움직임 제어를 지원하도록 방법을 확장한다.
- 다양한 카테고리에서 자동 지표와 인간 평가를 융합한 다중 척도 평가 프레임워크를 활용하여 I2V-Bench를 활용한다.

실험 결과
연구 질문
- RQ1첫 번째 프레임에 대한 시공간 조건화가 이미지에서 영상 생성 과정에서 시각적 일관성을 크게 향상시킬 수 있는가?
- RQ2첫 번째 프레임의 저주파수 성분에서 유도된 노이즈 초기화가 영상 추론 과정에서 시각적 이질성을 감소시키는가?
- RQ3기존 I2V 모델들과 비교해 본다면 제안된 방법은 움직임의 부드러움, 객체 일관성, 레이아웃 충실도 측면에서 어떻게 성능을 내는가?
- RQ4FrameInit는 자동 회귀적 장시간 영상 생성과 같은 다른 영상 생성 파라다임으로 일반화될 수 있는가?
- RQ5I2V-Bench는 기존 표준 지표를 넘어서 I2V 모델 평가에 대해 신뢰성 있고 종합적인 평가를 제공하는가?
주요 결과
- ConsistI2V는 I2V-Bench에서 최고 성능을 기록하며, 텍스트-영상 전체 일관성 평균 점수 97.77점을 기록하여 SEINE(97.07)와 DynamiCrafter(95.89)를 압도적으로 앞선다.
- SEINE 대비 평균 1.87점 향상된 움직임의 부드러움 점수를 기록하며, 움직임 부드러움 평가의 All 카테고리에서 96.08점을 기록한다.
- 객체 일관성 측면에서 SEINE 대비 3.21점 향상되었으며, 객체 일관성 지표의 All 카테고리에서 ConsistI2V는 32.06점, SEINE는 35.43점이다.
- 레이아웃 및 장면 일관성 측면에서 크게 향상되었으며, ConsistI2V는 장면 일관성(All)에서 24.81점을 기록하여 SEINE의 27.68점을 초월한다.
- FrameInit는 학습과 추론 간 노이즈 이질성을 감소시켜, 특히 장시간 영상 및 카메라 움직임 시나리오에서 더 안정적이고 일관된 영상 생성을 가능하게 한다.
- 이 방법은 자동 회귀적 장시간 영상 생성 및 카메라 움직임 제어에 효과적으로 일반화되어 있으며, 표준 I2V 작업을 넘어서도 확장 가능한 잠재력을 보여준다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.