[논문 리뷰] Hallucinating IDT Descriptors and I3D Optical Flow Features for Action Recognition with CNNs
이 논문은 RGB I3D 특징 맵에서 Improved Dense Trajectory (IDT) Bag-of-Words (BoW) 및 Fisher Vector (FV) 특징, 그리고 I3D 옵티컬 플로우 특징을 종합적으로 유추하는 엔드 투 엔드 학습 가능한 CNN 프레임워크를 제안한다. 이로 인해 고비용의 사전 처리 단계가 제거되며, 네 개의 데이터셋에서 최신 기술 수준의 행동 인식 성능를 달성하면서도 계산량을 20–55시간 감소시킨다.
In this paper, we revive the use of old-fashioned handcrafted video representations for action recognition and put new life into these techniques via a CNN-based hallucination step. Despite of the use of RGB and optical flow frames, the I3D model (amongst others) thrives on combining its output with the Improved Dense Trajectory (IDT) and extracted with its low-level video descriptors encoded via Bag-of-Words (BoW) and Fisher Vectors (FV). Such a fusion of CNNs and handcrafted representations is time-consuming due to pre-processing, descriptor extraction, encoding and tuning parameters. Thus, we propose an end-to-end trainable network with streams which learn the IDT-based BoW/FV representations at the training stage and are simple to integrate with the I3D model. Specifically, each stream takes I3D feature maps ahead of the last 1D conv. layer and learns to `translate' these maps to BoW/FV representations. Thus, our model can hallucinate and use such synthesized BoW/FV representations at the testing stage. We show that even features of the entire I3D optical flow stream can be hallucinated thus simplifying the pipeline. Our model saves 20-55h of computations and yields state-of-the-art results on four publicly available datasets.
연구 동기 및 목표
- 행동 인식을 위한 수작업 영상 표현 파이프라인에서 고비용의 오프라인 사전 처리 단계가 필요 없도록 하는 것.
- I3D 특징 맵으로부터 IDT 기반 BoW 및 FV 기술자들을 학습하는 CNN 스트림의 엔드 투 엔드 학습을 가능하게 하는 것.
- 즉, I3D 옵티컬 플로우 스트림이 RGB 스트림에서 유추될 수 있음을 보여주어 파이프라인을 단순화하는 것.
- 합성된 전역 기술자들을 통해 계산 비용을 줄이면서도 인식 정확도를 유지하거나 향상시키는 것.
제안 방법
- 최종 1D 컨볼루션 이전의 I3D 특징 맵 위에 전용 CNN 스트림을 학습하여 BoW 및 FV 표현을 생성하도록 학습하는 것.
- 학습 중에 Ground-truth IDT 특징을 사용하여 BoW 및 FV 기술자들의 유추를 감독하기 위해 평균 제곱 오차(MSE) 손실을 사용하는 것.
- BoW 및 FV 특징의 폭발적 특성(버스트니스)를 완화하고 일반화 성능을 향상시키기 위해 파wr 정규화(PN)를 적용하는 것.
- 다중 스트림을 융합할 때 과적합을 방지하고 차원을 감소시키기 위해 카운트 스케치(Count Sketch) 투영을 사용하는 것.
- 최종 분류 이전에 유추된 BoW, FV 및 고수준 추상화 특징(HAF)을 원본 I3D 특징과 연결하는 것.
- 추론 단계에서 MSE 손실을 비활성화하여, 지도 학습 없이도 테스트 중에 기술자들을 유추할 수 있도록 하는 것.
실험 결과
연구 질문
- RQ1CNN은 I3D 특징 맵에서 수작업으로 구성된 IDT 기반 BoW 및 FV 기술자들을 효과적으로 유추할 수 있는가?
- RQ2엔드 투 엔드 학습을 통해 I3D 옵티컬 플로우 스트림은 RGB 스트림으로부터 얼마나 정확하게 재구성될 수 있는가?
- RQ3합성된 전역 기술자들을 통해 계산 비용을 줄일 수 있는가, 동시에 인식 정확도를 손상시키지 않는가?
- RQ4파워 정규화 및 카운트 스케치와 같은 기법들이 유추된 기술자들의 강건성과 성능에 어떤 영향을 미치는가?
주요 결과
- 기존의 오프라인으로 IDT 특징을 추출하는 표준 파이프라인 대비 이 논문의 방법은 계산량을 20–55시간 감소시켰다.
- HMDB-51에서 512px 인간 중심 사전 처리를 사용할 경우 78.5%의 정확도를 달성하였으며, 256px 기준선 대비 1.3% 향상되었다.
- 다중 스케치와 파워 정규화를 적용한 모델은 MPII에서 81.7% mAP를 기록하여 기준선 대비 3.9%포인트 향상되었다.
- 유추된 BoW 및 FV 기술자들은 지도 특징과 매우 유사하며, 학습 및 추론 오차 분포 간의 차이가 최소한이었다.
- HMDB-51, UCF-101, Kinetics-400, MPII를 포함한 네 개의 공개 데이터셋에서 최신 기술 수준의 성능를 달성했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.