Skip to main content
QUICK REVIEW

[논문 리뷰] YH Technologies at ActivityNet Challenge 2018

Ting Yao, Xue Li|arXiv (Cornell University)|2018. 06. 29.
Human Pose and Action Recognition참고 문헌 23인용 수 11
한 줄 요약

이 논문은 ActivityNet Challenge 2018를 위한 YH Technologies의 다중 작업 영상 이해 시스템을 제시하며, 시간적 동작 제안, 국소화, 밀도 높은 캡션 작성, 트림된 동작 인식, 시공간 동작 국소화를 통합한다. 이 접근법은 다중 스케일 1차원 컨볼루션 네트워크, 이중 스트림 P3D 분류기, 정 politie 그레디언트와 검색 기반 캡션을 활용한 하이브리드 특징 융합을 통해 모든 다섯 가지 작업에서 최고 성능을 기록하였으며, 시공간 동작 국소화에서 AVA에 대해 22.20% mAP의 성과를 달성하였다.

ABSTRACT

This notebook paper presents an overview and comparative analysis of our systems designed for the following five tasks in ActivityNet Challenge 2018: temporal action proposals, temporal action localization, dense-captioning events in videos, trimmed action recognition, and spatio-temporal action localization.

연구 동기 및 목표

  • 실세계 환경에서 복잡하고 트림되지 않은 영상 분석을 위한 강력한 다중 작업 영상 이해 시스템을 개발하기 위해.
  • 거시적에서 미시적 제안 생성과 재순서 정렬, 다중 스트림 특징을 융합하여 시간적 동작 국소화 성능을 향상시키기 위해.
  • 검색 기반 캡션을 통해 트림되지 않은 영상 내 다수의 이벤트에 대해 다양하고 정확한 자연어 기술을 생성하기 위해.
  • 순환 아키텍처를 활용해 튜브릿 제안을 모델링하고 시공간 튜브 전역에서 동작를 인식하여 시공간 동작 국소화 성능을 향상시키기 위해.
  • 2D 및 3D CNN을 사용하여 프레임, 클립, 옵티컬 플로우에서 유사한 시공간 단서를 융합하여 트림된 동작 인식 성능을 향상시키기 위해.

제안 방법

  • 시간적 동작 제안을 위한 3단계 파이프라인: 점별, 쌍별, 순환 동작도 곡선을 사용한 거시적 제안 네트워크(CPN); 정밀화를 위한 시간적 컨volution 알림 네트워크(CAN); 최종 선택을 위한 제안 재순서 정렬 네트워크(PRN).
  • 시간적 동작 국소화를 위해 TAP 시스템에서 유도된 제안을 사용하고, 동작 인식을 위한 이중 스트림 P3D 분류기를 활용한 '분류를 통한 검출' 프레임워크.
  • 밀도 높은 캡션을 위해 강화 학습 최적화를 적용한 LSTM 기반 생성 모듈과 KNN를 활용한 검색 모듈을 통한 문장 후보 생성.
  • 트림된 동작 인식을 위해 2D 및 3D CNN을 사용하여 프레임 수준(ResNet), 클립 수준(P3D ResNet), 운동 수준(옵티컬 플로우) 특징의 후기 융합.
  • 시공간 동작 국소화를 위해 이중 스트림 시스템: 순환 튜브릿 제안(RTP) 네트워크는 RPN과 운동 추정을 활용해 프레임 간 제안을 생성하고 연결함; 순환 튜브릿 인식(RTR) 네트워크는 자르기, RoI 풀링, 전체 프레임 등의 다중 채널 특징을 CNN-LSTM 유닛에 입력하여 튜브릿 수준의 인식 수행.
  • 다양한 모odal에 대해 특징 양자화 전략을 평가하였으며, 25프레임/비디오를 일관되게 사용함.

실험 결과

연구 질문

  • RQ1다중 스케일, 다중 수준의 동작도 곡선은 트림되지 않은 영상에서 초기 시간적 동작 제안의 품질을 어떻게 향상시킬 수 있는가?
  • RQ2정책 그레디언트 최적화와 검색 기반 문장 후보를 융합할 경우, DCEV 작업에서 영상 캡션 성능은 얼마나 향상되는가?
  • RQ3프레임, 클립, 운동 특징을 융합하기 위한 최적의 융합 전략은 무엇인가?
  • RQ4순환 튜브릿 제안 및 인식 네트워크는 복잡한 영상에서 고 mAP 성능을 달성하기 위해 효과적으로 시공간 동작 국소화를 모델링할 수 있는가?
  • RQ5다양한 특징 양자화 방법은 다중 작업에 걸쳐 영상 이해 시스템의 성능에 어떤 영향을 미치는가?

주요 결과

  • CPN, CAN, PRN를 포함한 제안된 TAP 시스템은 세 가지 상호보완적 동작도 곡선과 다중 스케일 정밀화를 융합하여 고품질의 시간적 동작 제안을 달성하였다.
  • 정책 그레디언트 최적화와 검색 모듈을 통합한 밀도 높은 캡션 시스템은 METEOR 점수 향상이著명하여 강화 학습과 외부 문장 검색의 효과를 입증하였다.
  • 트림된 동작 인식에서 P3D ResNet를 사용한 후기 융합은 최고의 성능을 기록하였으며, 128프레임 클립에서 19.40% mAP를 달성하였다.
  • RTR 구성요소는 여러 스트림을 융합했을 때 AVA 검증 세트에서 22.20% mAP를 기록하여 개별 구성요소를 초월하였다.
  • P3D ResNet에서 128프레임 클립을 사용한 결과 RTR의 최고 단일 스트림 성능(19.40% mAP)을 기록하여 시공간 인식에서 더 긴 컨텍스트의 이점이 있음을 시사하였다.
  • 상위 300개의 근접 이웃을 활용한 검색 모듈은 다양한 문맥 기반 문장 후보를 제공하여 캡션 품질을 크게 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.