[논문 리뷰] A Closer Look at Temporal Sentence Grounding in Videos: Datasets and Metrics
이 논문은 기존 영상 내 시간적 문장 지목(TSGV) 평가 벤치마크의 결함을 규명하며, 분포가 이동된 순간 주석을 가진 재조정된 데이터셋(Charudes-CD 및 ActivityNet-CD)과 과도하게 긴 예측을 페널티 처리하는 새로운 평가 지표 dR@$n,IoU@$m을 제안한다. 이 새로운 평가 프로토콜 하에서 심지어 최첨단 모델들 역시 성능이 크게 떨어지며, 이는 현재 모델들이 진정한 이해보다는 주로 주석 편향에 의존하고 있음을 드러낸다.
Despite Temporal Sentence Grounding in Videos (TSGV) has realized impressive progress over the last few years, current TSGV models tend to capture the moment annotation biases and fail to take full advantage of multi-modal inputs. Miraculously, some extremely simple TSGV baselines even without training can also achieve state-of-the-art performance. In this paper, we first take a closer look at the existing evaluation protocol, and argue that both the prevailing datasets and metrics are the devils to cause the unreliable benchmarking. To this end, we propose to re-organize two widely-used TSGV datasets (Charades-STA and ActivityNet Captions), and deliberately extbf{C}hange the moment annotation extbf{D}istribution of the test split to make it different from the training split, dubbed as Charades-CD and ActivityNet-CD, respectively. Meanwhile, we further introduce a new evaluation metric dR@$n$,IoU@$m$ to calibrate the basic IoU scores by penalizing more on the over-long moment predictions and reduce the inflating performance caused by the moment annotation biases. Under this new evaluation protocol, we conduct extensive experiments and ablation studies on eight state-of-the-art TSGV models. All the results demonstrate that the re-organized datasets and new metric can better monitor the progress in TSGV, which is still far from satisfactory. The repository of this work is at \url{this https URL}.
연구 동기 및 목표
- 데이터셋 및 평가 지표의 편향으로 인해 현재 TSGV 평가 프로토콜이 신뢰할 수 없음을 폭 드러내는 것.
- 학습 데이터와 테스트 데이터의 분포 일치를 깨뜨리기 위해, 기존 데이터셋(Charudes-STA 및 ActivityNet Captions)의 테스트 분할에서 순간 주석 분포를 의도적으로 변경하여 재조정하는 것.
- 과도하게 긴 순간 예측에 대해 페널티를 적용하는 새로운 평가 지표 dR@$n,IoU@$m을 제안하여 주석 편향으로 인한 과도한 성능 향상을 줄이는 것.
- 표면적인 성능 향상 이외의 진정된 진전을 측정할 수 있는 더 신뢰할 수 있는 벤치마크를 제공하는 것.
제안 방법
- 학습 분할과 다를 바람직한 분포를 가지도록 테스트 분할을 재구성하여, Charades-CD 및 ActivityNet-CD를 생성하는 것.
- 과도하게 긴 예측에 대해 페널티를 적용하는 새로운 평가 지표 dR@$n,IoU@$m을 도입하여 IoU 점수를 校정하는 것.
- 일致한 학습 및 평가 설정 하에서, 여덟 개의 최첨단 TSGV 모델을 새로운 프로토콜로 평가하는 것.
- 일반화 능력과 편향 이용 정도를 분석하기 위해, 새로운 벤치마크 하에서 광범위한 아블레이션 연구를 수행하는 것.
실험 결과
연구 질문
- RQ1주석 편향으로 인해 현재 TSGV 모델들이 학습 데이터 분포를 초월해 일반화하는 정도는 어느 정도인가?
- RQ2테스트 분할의 순간 주석 분포가 학습 분할과 다를 경우, 최첨단 TSGV 모델의 성능은 얼마나 떨어지는가?
- RQ3제안된 dR@$n,IoU@$m 지표는 과도하게 긴 예측으로 인한 성능 과대평가를 효과적으로 줄일 수 있는가?
- RQ4복잡한 모델들과 비교했을 때, 학습 없이 단순한 베이스라인 모델은 새로운 평가 프로토콜에서 얼마나 잘 수행되는가?
주요 결과
- 새로운 벤치마크 하에서 심지어 가장 뛰어난 성능을 내는 TSGV 모델들 역시 성능 저하가 심각하게 나타나, 주석 편향에 강하게 의존하고 있음을 시사한다.
- 학습 없이 단순한 베이스라인은 원래의 벤치마크에선 최첨단 성능을 내지만, 새로운 프로토콜 하에서는 성능 저하가 심각하게 나타나, 진정한 일반화 능력이 부족함을 드러낸다.
- 제안된 dR@$n,IoU@$m 지표는 과도하게 긴 예측에 효과적으로 페널티를 적용하여 과대된 IoU 점수를 줄이고 공정한 평가를 가능하게 한다.
- 재조정된 데이터셋(Charudes-CD 및 ActivityNet-CD)은 현재 모델들의 낮은 일반화 능력을 드러내며, TSGV 분야에서의 진전이 이전에 생각한 것만큼 견고하지 않음을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.