[논문 리뷰] InternVideo-Ego4D: A Pack of Champion Solutions to Ego4D Challenges
이 논문은 Ego4D ECCV 2022 챌린지의 다섯 개 트랙 전반에서 최고 성능을 기록한 비디오 기초 모델 기반 접근법인 InternVideo-Ego4D를 제안한다. VideoMAE와 UniFormer 기반의 InternVideo 백본을 활용하고 간단한 작업별 헤드를 결합함으로써, 이 방법은 순간 쿼리, 자연어 쿼리, 향후 손 예측, 상태 변화 객체 검출, 단기 객체 상호작용 예측에서 이전의 SOTA 모델을 능가했다.
In this report, we present our champion solutions to five tracks at Ego4D challenge. We leverage our developed InternVideo, a video foundation model, for five Ego4D tasks, including Moment Queries, Natural Language Queries, Future Hand Prediction, State Change Object Detection, and Short-term Object Interaction Anticipation. InternVideo-Ego4D is an effective paradigm to adapt the strong foundation model to the downstream ego-centric video understanding tasks with simple head designs. In these five tasks, the performance of InternVideo-Ego4D comprehensively surpasses the baseline methods and the champions of CVPR2022, demonstrating the powerful representation ability of InternVideo as a video foundation model. Our code will be released at https://github.com/OpenGVLab/ego4d-eccv2022-solutions
연구 동기 및 목표
- 단일 비디오 기초 모델을 사용하여 다양한 이고세트릭 비디오 이해 작업을 위한 통합적이고 효과적인 접근법을 개발하기 위해.
- 일반 비디오 데이터셋과 이고세트릭 비디오 데이터 간의 도메인 갭을 해소하기 위해 Ego4D 데이터셋으로의 피니테이닝을 통해.
- InternVideo가 다양한 이고세트릭 인식 작업 전반에서 강력한 전이 가능성과 적응 가능성 을 보여주기 위해.
- 이고세트릭 비디오 이해를 위한 다양한 백본 아키텍처와 융합 전략의 효과를 탐색하기 위해.
- 복잡한 작업별 헤드 설계가 필요로 하지 않도록 강력한 사전 훈련된 기초 모델에 의존함으로써 최소화하기 위해.
제안 방법
- 모든 다섯 개 작업에 대해 VideoMAE와 UniFormer을 통합한 InternVideo를 주요 백본으로 사용했다.
- 비트림이 없는 이고세트릭 비디오에서 스피아오토스페이셜 표현을 학습하기 위해 VideoMAE를 통한 마스킹 비디오 재구성 사전 훈련을 적용했다.
- 비디오 표현 학습의 효율성과 정확도를 향상시키기 위해 UniFormer의 통합된 컨볼루션 및 자기주의 메커니즘을 통합했다.
- 일반 비디오 데이터와 이고세트릭 비디오 데이터 간의 도메인 갭을 줄이기 위해 사전 훈련된 InternVideo 모델을 Ego4D 데이터셋으로 피니테이닝했다.
- 다섯 개의 Ego4D 챌린지 트랙 각각에 맞는 경량의 작업별 헤드를 설계하였으며, 이는 검출 헤드(VSGN, ActionFormer)와 시간까지의 예측을 위한 회귀 헤드를 포함한다.
- 로이널 인코딩을 적용하여 바운딩 박스 좌표의 학습 가능한 위치 인코딩을 통합하고 이를 RoI 특징과 연결함으로써 특징 융합을 향상시켜 국소화 및 회귀 성능을 향상시켰다.
실험 결과
연구 질문
- RQ1복잡한 헤드 설계 없이도 단일 강력한 비디오 기초 모델이 다양한 이고세트릭 비디오 이해 작업에 효과적으로 일반화될 수 있는가?
- RQ2InternVideo는 Ego4D 챌린지의 다섯 개 트랙에서 기존 SOTA 방법과 비교해 어떻게 성능을 내는가?
- RQ3Ego4D 데이터셋으로의 피니테이닝이 일반 비디오 데이터셋과 이고세트릭 비디오 데이터 간의 도메인 시프트를 어느 정도 완화하는가?
- RQ4시간까지의 예측과 같은 회귀 작업에서 RoI 특징에 위치 인코딩을 통합할 경우 어떤 영향을 미치는가?
- RQ5모델 예측과 공식 베이스라인 출력 간의 결과 융합은 전체 성능 향상에 얼마나 효과적인가?
주요 결과
- InternVideo-Ego4D는 다섯 개의 Ego4D 챌린지 트랙에서 모두 1위를 기록하여 다양한 이고세트릭 비디오 작업 전반에서 강력한 일반화 능력과 견고성을 입증했다.
- 모든 10개 평가 지표에서 기준 모델과 CVPR 2022 챌린지 우승자 모두를 능가하여 기초 모델 접근법의 우수성을 확인했다.
- 사전 훈련된 InternVideo 백본을 Ego4D로 피니테이닝함으로써 도메인 갭이 크게 감소하였고, 모든 작업에서 일관된 성능 향상이 이루어졌다.
- RoI 특징에 위치 인코딩을 통합함으로써 시간까지의 예측 성능이 향상되었으며, 이는 공간적 인덕티브 바이어스가 회귀 성능 향상에 기여함을 보여주었다.
- 모델과 공식 예측의 상위 10개 박스를 융합한 결과 융합은 개별 예측보다 더 높은 성능을 보였으며, 중복 제거를 위해 고 IoU 임계값을 사용한 NMS를 적용했다.
- 명사 분류 점수 기반으로 상위 5개 박스로 필터링함으로써 추론 속도와 일반화 능력이 향상되었고, 상위 3개 박스를 유지할 경우 검증 세트에서 과적합이 발생했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.