Skip to main content
QUICK REVIEW

[논문 리뷰] Effective and Fast: A Novel Sequential Single Path Search for Mixed-Precision Quantization

Qigong Sun, Licheng Jiao|arXiv (Cornell University)|2021. 03. 04.
Advanced Image and Video Retrieval Techniques참고 문헌 60인용 수 7
한 줄 요약

이 논문은 하드웨어 제약 조건 하에서 네트워크 레이어 간 최적의 비트 정밀도 할당을 효율적으로 탐색할 수 있는 새로운 미분 가능한 순차적 단일 경로 검색(Sequential Single Path Search, SSPS) 방법을 제안한다. 선택 확신도를 기반으로 순차적으로 정밀도를 결정하고 단일 경로, 기울기 최적화 기반 검색 셀을 사용함으로써 메모리 사용량을 감소시키고 수렴 속도를 향상시킨다. ResNet-18 기준으로 CIFAR-10, ImageNet, COCO에서 최신 기준 성능을 달성하며, 총 28 GPU시간 미만의 자원을 소비한다.

ABSTRACT

Since model quantization helps to reduce the model size and computation latency, it has been successfully applied in many applications of mobile phones, embedded devices and smart chips. The mixed-precision quantization model can match different quantization bit-precisions according to the sensitivity of different layers to achieve great performance. However, it is a difficult problem to quickly determine the quantization bit-precision of each layer in deep neural networks according to some constraints (e.g., hardware resources, energy consumption, model size and computation latency). To address this issue, we propose a novel sequential single path search (SSPS) method for mixed-precision quantization,in which the given constraints are introduced into its loss function to guide searching process. A single path search cell is used to combine a fully differentiable supernet, which can be optimized by gradient-based algorithms. Moreover, we sequentially determine the candidate precisions according to the selection certainties to exponentially reduce the search space and speed up the convergence of searching process. Experiments show that our method can efficiently search the mixed-precision models for different architectures (e.g., ResNet-20, 18, 34, 50 and MobileNet-V2) and datasets (e.g., CIFAR-10, ImageNet and COCO) under given constraints, and our experimental results verify that SSPS significantly outperforms their uniform counterparts.

연구 동기 및 목표

  • 모델 크기, 지연 시간, 에너지 소비 등의 하드웨어 제약 조건 하에서 딥 네ural 네트워크 내 혼합 정밀도 비트 할당을 효율적으로 결정하는 데 도전하는 것.
  • 모든 후보를 동시에 평가하는 기존의 미분 가능한 NAS 기반 혼합 정밀도 탐색 방법이 유발하는 높은 메모리 및 계산 비용을 줄이는 것.
  • 선택 확신도 기반 순차적 정밀도 선택을 통해 검색 공간을 기하급수적으로 감소시켜 수렴 속도를 가속화하고 검색 안정성을 향상시키는 것.
  • 다중 반복이 필요 없이 특정 하드웨어 제약 조건(예: 평균 가중치/활성화 비트 폭)을 직접 목표로 삼는 단일 제약 유도 검색을 가능하게 하는 것.
  • 블록 단위 방법과는 달리 레이어 단위 혼합 정밀도 양자화를 지원함으로써 각 레이어에 대해 더 세밀한 정밀도 적응을 가능하게 하는 것.

제안 방법

  • 모든 포워드 프로세스에서 하나의 후보 정밀도만 평가하는 새로운 미분 가능한 단일 경로 검색 셀을 도입하여, 슈퍼넷 기반 방법 대비 메모리 사용량을 크게 감소시킨다.
  • 하드웨어 제약 조건(예: 평균 가중치 및 활성화 비트 폭)을 손실 함수에 직접 통합하여, 실현 가능하고 구현 가능한 모델로의 탐색을 유도한다.
  • Gumbel-Softmax와 온도 감쇠를 사용해 미분 가능한 아키텍처 탐색을 구현함으로써 정밀도 선택의 기울기 기반 최적화를 가능하게 한다.
  • 순차적 결정 메커니즘을 적용: 레이어는 선택 확신도 순서로 처리되며, 가장 확신도가 높은 선택 사항만 고정되어 검색 공간이 기하급수적으로 감소한다.
  • 모든 검색 셀이 여러 정밀도 후보(예: 2비트에서 6비트)를 포함하지만, 각 포워드 프로세스에서 하나의 후보만 활성화되는 완전히 미분 가능한 슈퍼넷을 활용한다.
  • 학습 안정성 향상과 수렴 향상을 위해 온도 감쇠 스케줄을 적용하며, 최종 모델는 최적화가 완료된 후 확보된다.

실험 결과

연구 질문

  • RQ1전체 슈퍼넷 기반 방법과 비교해 순차적 단일 경로 탐색 전략이 혼합 정밀도 양자화 탐색에서 메모리 소비를 줄이고 수렴 속도를 높일 수 있는가?
  • RQ2손실 함수에 하드웨어 제약 조건을 직접 통합하면 특정 목표 제약 조건(예: 평균 비트 폭)을 충족하는 모델에 대해 단일 반복 탐색이 가능한가?
  • RQ3동일한 제약 조건 하에서, 레이어 단위 정밀도 할당이 블록 단위 할당보다 모델 정확도 측면에서 우수한가?
  • RQ4선택 확신도 기반 순차적 결정 메커니즘이 검색 안정성과 수렴 속도에 어떤 영향을 미치는가?
  • RQ5제안된 방법이 다양한 데이터셋(CIFAR-10, ImageNet, COCO)에서 최신 기준 성능을 달성하면서도 탐색 비용을 최소화할 수 있는가?

주요 결과

  • SSPS는 DARTS 기반 방법 대비 GPU 메모리 사용량을 크게 줄였으며, 그림 1(a)는 탐색 중 메모리 소비가 현저히 낮음을 보여준다.
  • 이 방법은 DNAS보다 수렴 속도가 더 빠르며, ResNet-18 기준 ImageNet 탐색을 28 GPU시간 이내에 완료한다. 반면 DNAS는 40 GPU시간이 소요된다.
  • 선택 확신도 기반 순차적 결정 메커니즘과 정밀도 감소 전략이 검색 공간을 기하급수적으로 감소시켜 수렴 안정성을 향상시킨다. 그림 4에서 이를 확인할 수 있다.
  • CIFAR-10, ImageNet, COCO에서 SSPS는 동일한 제약 조건 하에서 균일한 양자화 및 최신 기준 기반 방법보다 더 높은 정확도를 달성한다.
  • 이 방법은 레이어 단위 혼합 정밀도 양자화를 지원하여, 동일한 블록 내부에서도 각 레이어에 대해 다른 정밀도를 부여할 수 있다. 이는 DNAS 및 BP-NAS와 같은 블록 단위 방법과는 대조된다.
  • 제거 실험 결과, 결정 연산을 제거한 SPS 변형에서는 수렴 속도가 느려지고 안정성이 떨어지므로, 순차적 선택의 중요성을 확인할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.