[논문 리뷰] Towards Training Stronger Video Vision Transformers for EPIC-KITCHENS-100 Action Recognition
이 논문은 EPIC-KITCHENS-100 데이터셋에서 비디오 비전 트랜스포머(ViViT)의 종합적인 훈련 레시피를 제안하여, 최적화된 데이터 증강, 해상도 스케줄링, 초기화를 통해 원래 ViViT보다 3.4% 높은 47.4%의 작업 인식 정확도를 달성한다. 저자들은 또한 ViViT를 컨volutional 네트워크(ir-CSN-152 등)와 앙상블하여, 작업 인식에서 최종 테스트 정확도 48.5%, 동사 예측에서 69.2%, 명사 예측에서 60.3%를 달성한다.
With the recent surge in the research of vision transformers, they have demonstrated remarkable potential for various challenging computer vision applications, such as image recognition, point cloud classification as well as video understanding. In this paper, we present empirical results for training a stronger video vision transformer on the EPIC-KITCHENS-100 Action Recognition dataset. Specifically, we explore training techniques for video vision transformers, such as augmentations, resolutions as well as initialization, etc. With our training recipe, a single ViViT model achieves the performance of 47.4\% on the validation set of EPIC-KITCHENS-100 dataset, outperforming what is reported in the original paper by 3.4%. We found that video transformers are especially good at predicting the noun in the verb-noun action prediction task. This makes the overall action prediction accuracy of video transformers notably higher than convolutional ones. Surprisingly, even the best video transformers underperform the convolutional networks on the verb prediction. Therefore, we combine the video vision transformers and some of the convolutional video networks and present our solution to the EPIC-KITCHENS-100 Action Recognition competition.
연구 동기 및 목표
- 원래 보고된 결과를 초월하여 비디오 비전 트랜스포머(ViViT)의 EPIC-KITCHENS-100 작업 인식 벤치마크 성능을 향상시키기 위해.
- 데이터 증강, 입력 해상도, 사전 훈련 초기화, 모델 아키텍처가 비디오 이해에서 ViViT 성능에 미치는 영향을 조사하기 위해.
- ViViT가 동사 예측에서 열등한 성능을 보이는 한계를 보완하기 위해, 컨볼루션 비디오 네트워크(ir-CSN-152, SlowFast 등)와 융합하여 상호 보완적인 예측을 수행하기 위해.
- ViViT의 강점(강한 명사 예측)과 컨볼루션 모델의 강점(강한 동사 예측)을 활용하는 견고한 앙상블 전략을 개발하여 전체 작업 인식 정확도를 극대화하기 위해.
제안 방법
- ImageNet-21k의 지도 학습 가중치를 사용해 사전 훈련한 ViViT-B/16x2를 Kinetics 400, Kinetics 700, Something-Something-V2에서 AdamW 옵티마이저와 코즈인 학습률 스케줄링을 사용해 미세조정하였다.
- 일반화 성능 향상을 위해 색상 왜곡, mixup, cutmix, 무작위 제거, 레이블 스무딩 등의 데이터 증강 전략을 적용하였다.
- 224×224, 320×320, 384×384의 입력 해상도를 탐색하여, 검증 세트에서 성능 향상을 위해 384×384 해상도가 가장 우수하다는 것을 발견하였다.
- 요소 분해된 비디오 트랜스포머 인코더를 사용하였으며, 2.5 에포크의 학습률 웜업과 0.1의 가중치 감소를 적용하여 훈련하였다.
- ir-CSN-152 모델에 장기 특징 백업(LFB)을 사용하여, 사전 훈련된 ViViT의 특징으로 초기화하여 명사 예측 성능을 향상시켰다.
- 여러 시각에서 예측을 평균화하여 최종 정확도를 향상시키기 위해 ViViT, ir-CSN-152, SlowFast 등의 여러 모델을 앙상블하였다.
실험 결과
연구 질문
- RQ1다양한 데이터 증강 전략이 EPIC-KITCHENS-100 데이터셋에서 비디오 비전 트랜스포머 성능에 어떤 영향을 미치는가?
- RQ2비디오 작업 인식에서 ViViT 성능을 극대화하기 위해 최적의 입력 해상도와 사전 훈련 초기화 전략은 무엇인가?
- RQ3ViViT가 강한 명사 및 전체 작업 인식 성능를 보임에도 불구하고, 동사 예측에서 왜 컨볼루션 네트워크에 뒤지나?
- RQ4ViViT를 컨볼루션 비디오 네트워크와 앙성하여, EPIC-KITCHENS-100에서 최종 작업 인식 정확도를 크게 향상시킬 수 있는가?
주요 결과
- 제안된 훈련 레시피로 미세조정한 단일 ViViT 모델이 EPIC-KITCHENS-100 검증 세트에서 47.4%의 작업 인식 정확도를 달성하여 원래 ViViT보다 3.4% 향상되었다.
- ViViT는 명사 예측에서 59.6%의 우수한 성능를 보였지만, 동사 예측에서는 68.4%로 성능이 열등하여, 행동의 대상을 인식하는 데서의 핵심 강점을 드러냈다.
- ir-CSN-152 및 SlowFast-16×8-101과 같은 컨볼루션 네트워크는 동사 예측에서 ViViT를 능가했으며, 후자는 68.4%의 동사 정확도를 기록했다.
- ViViT 특징를 사용한 장기 특징 백업(LFB)을 적용함으로써 ir-CSN-152의 명사 예측 정확도가 55.9%에서 60.3%로 향상되어, 작업 인식 성능 향상에 크게 기여했다.
- 최고 성능의 ViViT와 컨볼루션 모델을 앙성하여 최종 테스트 정확도를 48.5%로 높였으며, 동사 예측 정확도는 69.2%, 명사 예측 정확도는 60.3%를 기록했다.
- 입력 해상도를 384×384로 증가시켜 검증 정확도를 향상시켰지만, 컨볼루션 모델의 테스트 정확도에는 영향을 주지 않아, 추론 시 224×224를 유지하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.