[논문 리뷰] EvalCrafter: Benchmarking and Evaluating Large Video Generation Models
이 논문은 다양한 LLM 확장 프롬프트 코퍼스와 시각적 품질, 운동 품질, 시간적 일관성, 텍스트-비디오 일치도 등 다각도 평가 지표를 결합하여 텍스트-비디오(T2V) 생성 모델을 평가하는 종합적인 벤치마크 프레임워크인 EvalCrafter를 소개한다. 인간 선호도와의 일치를 도모하기 위해 가중치를 적용한 회귀 분석 기반의 방법을 제안하여 단순 평균화보다 인간 평가와 더 높은 상관관계를 확보함으로써 대규모 T2V 모델 평가의 새로운 기준을 설정한다.
The vision and language generative models have been overgrown in recent years. For video generation, various open-sourced models and public-available services have been developed to generate high-quality videos. However, these methods often use a few metrics, e.g., FVD or IS, to evaluate the performance. We argue that it is hard to judge the large conditional generative models from the simple metrics since these models are often trained on very large datasets with multi-aspect abilities. Thus, we propose a novel framework and pipeline for exhaustively evaluating the performance of the generated videos. Our approach involves generating a diverse and comprehensive list of 700 prompts for text-to-video generation, which is based on an analysis of real-world user data and generated with the assistance of a large language model. Then, we evaluate the state-of-the-art video generative models on our carefully designed benchmark, in terms of visual qualities, content qualities, motion qualities, and text-video alignment with 17 well-selected objective metrics. To obtain the final leaderboard of the models, we further fit a series of coefficients to align the objective metrics to the users' opinions. Based on the proposed human alignment method, our final score shows a higher correlation than simply averaging the metrics, showing the effectiveness of the proposed evaluation method.
연구 동기 및 목표
- 현재 FVD나 IS와 같은 제한된 지표에 의존하는 대규모 텍스트-비디오(T2V) 생성 모델에 대한 종합적인 평가 프레임워크의 부재를 해결하기 위해.
- 대규모 언어 모델과 실제 사용자 입력을 활용하여 실생활을 반영한 다양한 프롬프트 벤치마크를 구축하고, 상세한 주석을 부여하기 위해.
- 시각적 품질, 운동 품질, 시간적 일관성, 텍스트-비디오 일치도 등 여러 측면에서 객관적 지표를 사용하여 T2V 모델을 평가하기 위해.
- 학습된 가중치 부여 방식을 통해 객관적 지표를 인간 선호도와 일치시켜 평가 정확도를 향상시키기 위해.
- 오픈소스 모델와 클로즈드소스 모델 간의 성능 격차와 한계를 규명하여 향후 모델 개발에 실질적인 통찰을 제공하기 위해.
제안 방법
- 실생활 프롬프트를 분석하고 대규모 언어 모델(예: ChatGPT)을 활용하여 객체, 특성, 운동 등 메타 유형을 확장하여 종합적인 프롬프트 목록을 구성한다.
- 4개 차원(시각적 품질, 운동 품질, 시간적 일관성, 텍스트-비디오 일치도)에 걸쳐 총 18개의 객관적 지표를 포함한 다각도 평가 파이프라인을 설계한다: 시각적 품질(VQA-T, VQA-A), 운동 품질(Motion AC, Flow-Score), 시간적 일관성(CLIP-Temp, Warp Error), 텍스트-비디오 일치도(SD-Score, CLIP-Score).
- 200개 샘플에 대해 생성된 비디오를 대상으로 3명의 평가자가 이원 비교 평가를 수행하여 인간 선호도 연구를 수행한다.
- 객관적 지표를 인간 선호도 점수로 매핑하기 위해 가중치를 적용한 회귀 모델을 학습하고, 상관관계(Spearman’s ρ와 Kendall’s τ)를 최대화하도록 계수를 최적화한다.
- 학습된 계수를 활용하여 인간 인식을 더 잘 반영하는 최종 복합 점수를 계산한다.
- 미리 보지 않은 데이터에서 인간 평가와 객관적 지표 간 상관관계를 비교함으로써 방법의 유효성을 검증한다.

실험 결과
연구 질문
- RQ1실생활 사용을 반영하는 다양한 프롬프트를 포함한 대표성 있는 텍스트-비디오 프롬프트 벤치마크를 어떻게 구축할 수 있는가?
- RQ2비디오 생성의 다양한 측면(예: 운동, 일치도, 품질)에서 인간 인식과 가장 잘 상관관계를 가지는 객관적 지표는 무엇인가?
- RQ3인간 선호도와 객관적 지표를 일치시키는 학습된 가중치 부여 방식이 단순 평균화보다 T2V 모델 평가에서 더 우수한 성능을 보일 수 있는가?
- RQ4오픈소스 모델과 클로즈드소스 모델 간의 핵심 한계와 성능 격차는 무엇인가?
- RQ5현재 최신 기술 수준의 모델들은 여러 차원에서 어떻게 성능을 발휘하며, 반복적으로 나타나는 실패 유형은 무엇인가?
주요 결과
- 제안된 인간 선호도 일치 방법은 인간 평가와 상당한 상관관계를 보였으며, 스피어만의 ρ는 50.2, 켄달의 τ는 37.6를 기록했고, 단순 평균화 방법(ρ=45.9, τ=33.7)보다 뛰어난 성능을 보였다.
- CLIP-Temp와 Warp Error는 시간적 일관성 측정에 있어 인간 인식과 강한 상관관계(ρ=50.0, τ=36.0)를 보였으며, 운동 안정성 측정에 효과적임을 시사했다.
- SD-Score와 CLIP-Score는 텍스트-비디오 일치도 평가에 매우 유용한 지표로 평가되었으며, 높은 상관관계(ρ=30.5, τ=21.7)를 보였다.
- Gen2는 총합 성능가장 높았지만, 인간과 동물의 신원 일관성 문제를 보였고, 낮은 IS 점수와 복잡한 장면 생성 실패로 나타났다.
- 오픈소스 모델(예: ModelScope-XL, ZeroScope)과 클로즈드소스 모델(예: PikaLab, Gen2) 사이에 상당한 성능 격차가 존재했으며, 특히 운동 품질과 일치도 측면에서 두드러졌다.
- 운동 진폭 지표(Motion AC, Flow-Score)는 인간 선호도와 상관관계가 없었으며, 인간 평가에서 안정성이 진폭보다 더 중요함을 시사했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.