[논문 리뷰] AutoPose: Searching Multi-Scale Branch Aggregation for Pose Estimation
AutoPose는 2D 히ュ먼 포즈 추정을 위한 새로운 신경망 아키텍처 탐색(NAS) 프레임워크를 제안한다. 이 프레임워크는 셀 수준의 마이크로 구조, 다중 스케일 브랜치 선택, 그리고 크로스 스케일 아그리게이션을 동시에 최적화한다. 셀 아키텍처에 대해 기울기 기반 탐색을, 네트워크 수준의 분기 및 아그리게이션에 대해 강화 학습을 조합함으로써, 고성능의 다중 브랜치, 고해상도 아키텍처를 발견하였으며, MS COCO에서 73.6 AP를 달성하였다. 이는 기존의 NAS 방법보다 더 넓은 검색 공간 유연성과 높은 정확도를 확보하였다.
We present AutoPose, a novel neural architecture search(NAS) framework that is capable of automatically discovering multiple parallel branches of cross-scale connections towards accurate and high-resolution 2D human pose estimation. Recently, high-performance hand-crafted convolutional networks for pose estimation show growing demands on multi-scale fusion and high-resolution representations. However, current NAS works exhibit limited flexibility on scale searching, they dominantly adopt simplified search spaces of single-branch architectures. Such simplification limits the fusion of information at different scales and fails to maintain high-resolution representations. The presentedAutoPose framework is able to search for multi-branch scales and network depth, in addition to the cell-level microstructure. Motivated by the search space, a novel bi-level optimization method is presented, where the network-level architecture is searched via reinforcement learning, and the cell-level search is conducted by the gradient-based method. Within 2.5 GPU days, AutoPose is able to find very competitive architectures on the MS COCO dataset, that are also transferable to the MPII dataset. Our code is available at https://github.com/VITA-Group/AutoPose.
연구 동기 및 목표
- 기존의 NAS 방법이 2D 히ュ먼 포즈 추정을 위한 복잡한 다중 브랜치, 다중 스케일 아키텍처를 탐색하는 데에 한계를 보이고 있는 문제를 해결하기 위해.
- 세밀한 공간적 세부 정보를 유지하는 고해상도, 크로스 스케일 특징 융합 메커니즘을 자동으로 탐색할 수 있도록 하기 위해.
- 셀 수준, 스케일 수준, 네트워크 수준의 결합으로 인해 발생하는 거대한 검색 공간의 확장성 및 최적화 과제를 해결하기 위해.
- 다른 수준의 아키텍처 탐색에 적합한 기울기 기반 및 강화 학습 방법을 효과적으로 조화시키는 이중 최적화 전략을 개발하기 위해.
- 제안된 검색 공간과 최적화 방법이 MS COCO 및 MPII 데이터셋 모두에서 효과적임을 검증하여 이식성과 최신 기술 수준의 성능을 입증하기 위해.
제안 방법
- 셀 수준의 마이크로 아키텍처, 스케일 선택, 네트워크 수준의 분기 및 아그리게이션을 동시에 탐색할 수 있는 계층적 다중 스케일 검색 공간을 도입한다.
- 이중 최적화 전략을 적용한다: 셀 수준 아키텍처에 대해 기울기 기반 탐색을, 네트워크 수준의 결정(분기, 스케일, 아그리게이션)에 대해 강화 학습을 사용한다.
- 간단한 연결 또는 합산이 아닌, 조밀하고 구조화된 크로스 스케일 특징 융합을 지원하는 새로운 아그리게이션 셀을 설계한다.
- 공유된 가중치를 가진 슈퍼넷을 사용하여 검색 중 후보 아키텍처를 효율적으로 평가함으로써 학습 비용을 감소시킨다.
- 다양한 스케일의 병렬 브랜치를 유지함으로써 네트워크 전반에 걸쳐 전체 해상도 표현을 유지한다.
- 검색 과정에서 전체 해상도 입력($256\times192$)을 사용하여 검색과 학습 간의 분포 이탈을 방지하고 최종 성능을 향상시킨다.
실험 결과
연구 질문
- RQ1NAS 프레임워크가 2D 포즈 추정을 위해 셀 수준 아키텍처, 다중 스케일 분기, 크로스 스케일 아그리게이션을 동시에 최적화할 수 있는가?
- RQ2단일 경로 또는 고정된 브랜치 설계만 최적화하는 것과 비교해, 다중 브랜치, 다중 스케일 아키텍처를 탐색하는 NAS 방법의 성능은 어떻게 되는가?
- RQ3밀도 높은 예측 작업인 포즈 추정과 같은 작업에서, NAS 검색 중에 전체 해상도 이미지를 사용할 경우 최종 모델 성능에 어떤 영향을 미치는가?
- RQ4기울기 기반 및 강화 학습 방법을 조합한 이중 최적화 전략이 거대하고 다중 수준의 검색 공간을 효과적으로 탐색할 수 있는가?
- RQ5제안된 아그리게이션 셀과 다중 브랜치 설계는 단순 연결 또는 단일 브랜치 백본에 비해 성능 향상에 어떤 기여를 하는가?
주요 결과
- AutoPose는 MS COCO 검증 세트에서 73.6 AP를 달성하여, 기존의 NAS 방법과 경쟁 수준의 수작업 설계 모델인 HRNet-W32를 능가하였다.
- 각 스테이지에서 단일 스케일만 允許할 경우 성능이 급격히 떨어져 63.9 AP로 떨어지며, 다중 스케일 병렬 브랜치의 핵심적 역할을 입증하였다.
- 제안된 아그리게이션 셀을 간단한 연결으로 대체할 경우 고 IOU 임계값에서 성능 저하가 발생한다 (AP@75는 80.1%에서 77.6%로 감소), 이는 구조화된 크로스 스케일 융합의 중요성을 입증한다.
- 모든 네 개의 브랜치를 수동으로 고정하고 셀 수준 아키텍처만 탐색하는 경우 71.8 AP를 기록하며, AutoPose의 73.6 AP보다 낮은 성능을 보였다. 이는 네트워크 수준과 셀 수준의 공동 탐색의 이점이 있음을 보여준다.
- 검색 중에 이미지 크기를 축소($128\times96$)하면 AP가 3.5% 감소한다 (70.1% 대비 73.6%), 이는 밀도 높은 예측 작업에서 전체 해상도 검색이 필수적임을 확인한다.
- 이중 최적화 전략은 안정적으로 수렴하며, 셀 수준 및 네트워크 수준의 결정에서 엔트로피가 감소하고, 검증 AP와 컨트롤러 보상이 시간이 지남에 따라 증가한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.