[논문 리뷰] Flow-Distilled IP Two-Stream Networks for Compressed Video Action Recognition
이 논문은 I-프레임을 공간 모델링에 사용하고 P-프레임(운동 벡터와 잔차 포함)을 시간 모델링에 사용하며, 광학 흐름 특징 정련을 통해 경량 2D-3D 네트워크를 훈련시키는 압축 도메인 비디오 행동 인식 프레임워크인 플로우-정련 IP 이중스트림 네트워크(IP TSN)를 제안한다. 이 방법은 광학 흐름보다 60배 빠른 추론 속도를 달성하면서 HMDB51에서 정확도를 7% 향상시키고 UCF101에서 3% 향상시켜 이전의 압축 도메인 방법을 능가하며 복원 영상 기반 기준에 근접한다.
Two-stream networks have achieved great success in video recognition. A two-stream network combines a spatial stream of RGB frames and a temporal stream of Optical Flow to make predictions. However, the temporal redundancy of RGB frames as well as the high-cost of optical flow computation creates challenges for both the performance and efficiency. Recent works instead use modern compressed video modalities as an alternative to the RGB spatial stream and improve the inference speed by orders of magnitudes. Previous works create one stream for each modality which are combined with an additional temporal stream through late fusion. This is redundant since some modalities like motion vectors already contain temporal information. Based on this observation, we propose a compressed domain two-stream network IP TSN for compressed video recognition, where the two streams are represented by the two types of frames (I and P frames) in compressed videos, without needing a separate temporal stream. With this goal, we propose to fully exploit the motion information of P-stream through generalized distillation from optical flow, which largely improves the efficiency and accuracy. Our P-stream runs 60 times faster than using optical flow while achieving higher accuracy. Our full IP TSN, evaluated over public action recognition benchmarks (UCF101, HMDB51 and a subset of Kinetics), outperforms other compressed domain methods by large margins while improving the total inference speed by 20%.
연구 동기 및 목표
- 광학 흐름이 두 스트림 비디오 행동 인식 모델에서 높은 계산 비용을 유발하는 문제를 해결하기 위해.
- 비디오 코덱 내부의 I 및 P 프레임의 본질적 구조를 활용하여 압축 영상 행동 인식의 효율성과 정확도를 향상시키기 위해.
- P-프레임의 운동 벡터와 잔차를 통합된 운동 스트림으로 사용하여 중복된 시간 스트림을 제거하기 위해.
- 명시적인 흐름 재구성 없이도 고수준 광학 흐름 특징을 정련에 활용하는 훈련 전략을 개발하기 위해.
- 실시간 추론 속도를 유지하면서도 전체 해상도 영상 방법에 근접한 성능을 달성하기 위해.
제안 방법
- 모델은 I-스트림이 2D 컨볼루션 네트워크를 사용해 RGB I-프레임을 처리하여 공간적 외형을 캡처하고, P-스트림이 2D-3D 컨볼루션 네트워크를 사용해 P-프레임의 운동 벡터(MV)와 잔차 오차(R)를 처리하여 시공간 역학을 모델링하는 이중 스트림 아키텍처를 사용한다.
- 훈련 중에 광학 흐름 특징이 P-스트림이 명시적인 흐름 계산 없이도 운동 표현을 학습하도록 지도로 사용된다.
- 광범위한 정련을 적용하여 광학 흐름에서 MV 및 R 특징으로 운동 지식을 전이함으로써 특징 품질을 향상시킨다.
- I-스트림과 P-스트림은 최종 행동 예측을 위해 조기에 융합되어 중복된 시간 스트림을 방지한다.
- 엔드 투 엔드로 교차 엔트로피 손실과 정련 손실을 함께 사용하여 훈련함으로써 높은 정확도와 빠른 속도를 동시에 달성한다.
실험 결과
연구 질문
- RQ1P-프레임 구성요소(운동 벡터 및 잔차)가 이중 스트림 비디오 행동 인식에서 광학 흐름의 대체로 효과적으로 사용될 수 있는가?
- RQ2명시적인 흐름 추정 없이도 광학 흐름의 고수준 운동 정보를 압축 도메인 특징으로 전이할 수 있는가?
- RQ3통합된 P-스트림 아키텍처가 압축 영상 인식에서 별도의 모odal 스트림보다 우월한 성능을 낼 수 있는가?
- RQ4이중 스트림 아키텍처에서 광학 흐름을 MV 및 R로 대체할 경우 정확도와 추론 속도 사이의 상호 상충 관계는 어떠한가?
- RQ5광학 흐름에서의 정련이 압축 영상 행동 인식 성능 향상에 얼마나 기여하는가?
주요 결과
- 제안된 IP TSN은 HMDB51에서 69.1%의 상위-1 정확도를 달성하여 이전에 가장 우수한 압축 도메인 방법인 DMC-Net(61.8%)보다 7% 향상시켰다.
- UCF101에서는 93.4%의 상위-1 정확도를 기록하여 이전에 가장 우수한 압축 도메인 방법보다 2.5% 높게 달성했다.
- P-스트림은 광학 흐름 스트림보다 60배 빠른 속도로 실행되면서도 유사한 정확도를 유지하여 추론 효율성을 크게 향상시켰다.
- 기본 모델 대비 총 추론 GFLOPs를 20% 감소시켰으며 정확도는 향상시켰다.
- 심지어 ECO와 같은 일부 복원 영상 기반 이중 스트림 모델보다도 성능이 뛰어나면서도 훨씬 낮은 계산 비용을 기록했다.
- 16프레임 클립과 10개의 크롭을 사용하는 ResNet152 백본에서 최고의 성능를 기록하여 IP TSN에서 비대칭 네트워크 설계의 효과성을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.