Skip to main content
QUICK REVIEW

[논문 리뷰] LP-3DCNN: Unveiling Local Phase in 3D Convolutional Neural Networks

Sudhakar Kumawat, Shanmuganathan Raman|arXiv (Cornell University)|2019. 04. 06.
Human Pose and Action Recognition참고 문헌 47인용 수 5
한 줄 요약

이 논문은 표준 3D 컨볼루션 레이어의 효율적인 대안으로, 저주수에서 3D 단기 푸리에 변환(3D STFT)을 통해 국소 위상 특징을 추출하고, ReLU 활성화 및 학습 가능한 선형 조합을 거친 Rectified Local Phase Volume (ReLPV) 블록을 제안한다. ReLPV 블록은 파arameter 수를 최대 13³ 배 감소시키며, ModelNet10/40 및 UCF-101에서 각각 이전 SOTA 모델의 11%와 15%의 파rameter로 최신 기준 성능을 달성한다.

ABSTRACT

Traditional 3D Convolutional Neural Networks (CNNs) are computationally expensive, memory intensive, prone to overfit, and most importantly, there is a need to improve their feature learning capabilities. To address these issues, we propose Rectified Local Phase Volume (ReLPV) block, an efficient alternative to the standard 3D convolutional layer. The ReLPV block extracts the phase in a 3D local neighborhood (e.g., 3x3x3) of each position of the input map to obtain the feature maps. The phase is extracted by computing 3D Short Term Fourier Transform (STFT) at multiple fixed low frequency points in the 3D local neighborhood of each position. These feature maps at different frequency points are then linearly combined after passing them through an activation function. The ReLPV block provides significant parameter savings of at least, 3^3 to 13^3 times compared to the standard 3D convolutional layer with the filter sizes 3x3x3 to 13x13x13, respectively. We show that the feature learning capabilities of the ReLPV block are significantly better than the standard 3D convolutional layer. Furthermore, it produces consistently better results across different 3D data representations. We achieve state-of-the-art accuracy on the volumetric ModelNet10 and ModelNet40 datasets while utilizing only 11% parameters of the current state-of-the-art. We also improve the state-of-the-art on the UCF-101 split-1 action recognition dataset by 5.68% (when trained from scratch) while using only 15% of the parameters of the state-of-the-art. The project webpage is available at https://sites.google.com/view/lp-3dcnn/home.

연구 동기 및 목표

  • 표준 3D CNN의 높은 계산량, 메모리 사용량 및 파arameter 복잡도 문제를 해결하기 위해.
  • 표준 3D 컨볼루션 레이어를 더 효율적이고 정보량이 많은 모듈로 대체하여 3D CNN의 특징 학습 능력을 향상시키기 위해.
  • 과적합과 모델 크기를 줄이면서도 3D 데이터 작업에서 성능을 유지하거나 향상시키기 위해.
  • 체적 및 시공간 데이터를 포함한 다양한 3D 데이터 표현에서 일관된 성능 향상을 보여주기 위해.

제안 방법

  • 각 입력 위치의 국소 n×n×n 영역 내에서 여러 고정된 저주수 주파수 점에서 3D 단기 푸리에 변환(STFT)을 계산한다.
  • 3D 국소 볼륨 내에서 STFT 출력으로부터 국소 위상 정보를 추출하여 방향성 및 구조적 특징을 캡처한다.
  • 다양한 주파수 점에서의 위상 응답은 ReLU 활성화 함수를 통과하여 활성화된 응답 맵을 생성한다.
  • 이러한 활성화된 맵들은 학습 가능한 가중치를 사용한 선형 조합을 거쳐 최종 출력 특징 맵을 형성한다.
  • ReLPV 블록은 3D CNN 아키텍처 내에서 표준 3D 컨볼루션 레이어의 플러그인 대체로 설계되어 있다.
  • 이 방법은 필터 크기가 3×3×3에서 13×13×13일 때 표준 3D 컨볼루션 대비 3³에서 13³ 배까지 파arameter 수를 크게 감소시키며, 특징 표현 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ13D STFT를 통해 국소 위상 정보를 활용하는 새로운 3D 컨볼루션 블록이 정확도와 효율성 측면에서 표준 3D 컨볼루션을 능가할 수 있는가?
  • RQ2ReLPV 블록은 3D CNN에서 모델 복잡도와 과적합을 어떻게 줄이고 특징 학습 능력을 향상시키는가?
  • RQ3ReLPV 블록은 체적 형태의 형상과 시공간 동작 시퀀스와 같은 다양한 3D 데이터 표현에 일반화되는가?
  • RQ4성능을 최대화하면서 파arameter를 최소화하기 위한 ReLPV 블록 하이퍼파ram터(n, f)의 최적 구성은 무엇인가?
  • RQ5ReLPV 블록과 표준 3D 컨볼루션을 조합한 하이브리드 아키텍처가 완전히 ReLPV 기반 모델을 능가할 수 있는가?

주요 결과

  • ReLPV 블록은 필터 크기가 3×3×3에서 13×13×13일 때 표준 3D 컨볼루션 대비 최소 3³에서 13³ 배까지 학습 가능한 파arameter 수를 감소시킨다.
  • ModelNet10 및 ModelNet40 데이터셋에서 ReLPV 기반 모델은 현재 SOTA 모델의 11%의 파arameter만으로 최신 기준 정확도를 달성한다.
  • UCF-101 split-1 행동 인식 데이터셋에서, ReLPV 모델은 기존 SOTA 모델 대비 5.68% 높은 정확도를 기록했으며, 학습을 처음부터 수행할 때도 파arameter의 15%만을 사용했다.
  • UCF-101 데이터셋에서 특징 맵 수(f)를 늘릴수록 성능이 향상되며, 이는 모델 크기와 파arameter 수 증가 폭이 미미하다.
  • 표준 3D CNN의 상위 레이어를 ReLPV 블록으로 대체한 하이브리드 모델은 성능 향상을 보였지만, 완전히 ReLPV 기반의 LP-mC3D 네트워크를 능가하지 못했다.
  • 제거 실험 결과, ReLPV 블록의 성능는 다양한 하이퍼파aram터와 데이터 유형에서 표준 3D 컨볼루션보다 뛰어나고 뚜렷하게 우월함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.