[논문 리뷰] QONNX: Representing Arbitrary-Precision Quantized Neural Networks
이 논문은 ONNX 기반의 임의 정밀도 양자화 신경망을 위한 새로운 고수준 중간 표현인 QONNX를 소개한다. QONNX는 기존 ONNX 포맷을 후행 호환성 있는 클리핑 기반 양자화로 확장하며, 균일 양자화의 유연하고 플랫폼에 구애받지 않는 표현을 가능하게 하는 세 가지 신규 연산자—Quant, BipolarQuant, Trunc—를 제안한다. 이는 QAT 프레임워크와 FINN, hls4ml 등의 FPGA 툴체인 간의 상호운용성을 가능하게 하며, 벤치마킹 및 공유를 위한 공개 모델 저널을 함께 제공한다.
We present extensions to the Open Neural Network Exchange (ONNX) intermediate representation format to represent arbitrary-precision quantized neural networks. We first introduce support for low precision quantization in existing ONNX-based quantization formats by leveraging integer clipping, resulting in two new backward-compatible variants: the quantized operator format with clipping and quantize-clip-dequantize (QCDQ) format. We then introduce a novel higher-level ONNX format called quantized ONNX (QONNX) that introduces three new operators -- Quant, BipolarQuant, and Trunc -- in order to represent uniform quantization. By keeping the QONNX IR high-level and flexible, we enable targeting a wider variety of platforms. We also present utilities for working with QONNX, as well as examples of its usage in the FINN and hls4ml toolchains. Finally, we introduce the QONNX model zoo to share low-precision quantized neural networks.
연구 동기 및 목표
- 딥 러닝 프레임워크와 하드웨어 툴체인 간에 표준화된 고수준 표현이 부족한 양자화 신경망(QNNs) 문제를 해결하기 위해.
- 기존 포맷인 QDQ와 양자화 연산자와 유사한 방식으로, 정수 클리핑을 사용해 후행 호환성 있게 8비트 이하의 양자화를 표현하기 위해.
- 양자화 세부 정보를 추상화하고 텐서 수준 및 채널 수준의 양자화를 브로드캐스트 의미 체계를 통해 지원하는 고수준 표현인 QONNX를 설계하기 위해.
- 이미 존재하는 양자화 인식 학습(QAT) 프레임워크인 Brevitas와 QKeras, 그리고 FINN 및 hls4ml 등의 FPGA 컴파일 툴체인과의 원활한 통합을 위해.
- 다양한 데이터셋과 비트 폭 설정에서 저정밀도 양자화 모델을 벤치마킹하고 공동으로 사용할 수 있도록 표준화되고 확장 가능한 저자리 모델 저널을 구축하기 위해.
제안 방법
- 기존 ONNX 양자화 포맷—양자화된 연산자 포맷과 QDQ—를 확장하여, 기존 도구 체인에 영향을 주지 않으면서도 8비트 이하의 양자화를 지원하는 정수 클리핑을 도입한다.
- 두 가지 새로운 저수준 포맷을 제안한다: 클리핑이 포함된 양자화된 연산자 포맷과 양자화-클리핑-다시양자화(QCDQ) 포맷으로, 제한된 정수 값으로 이루어진 저정밀도 양자화 텐서를 표현할 수 있다.
- 세 가지 새로운 연산자를 포함한 고수준 ONNX IR인 QONNX를 도입한다: 균일 양자화를 위한 Quant, 이진 또는 양극성 양자화를 위한 BipolarQuant, 그리고 잘라내기 기반 양자화를 위한 Trunc.
- QONNX에서 브로드캐스트 의미 체계를 사용해 양자화를 텐서 수준 및 채널 수준로 일반화함으로써 표현력과 이식성을 향상시킨다.
- 형상 추론, 상수 폴딩, 변환 파이프라인 등의 소프트웨어 유틸리티를 개발하여 QONNX 모델을 도구체인 전용 포맷(예: FINN-ONNX)으로 변환한다.
- 자동화된 변환 단계를 통해 QONNX를 FINN 및 hls4ml의 네이티브 ONNX 다이어ект로 변환함으로써, FPGA 컴파일러에서 QONNX 모델을 엔드 투 엔드로 수신하고 처리할 수 있도록 한다.
실험 결과
연구 질문
- RQ1기존 도구 체인을 손상시키지 않으면서도, ONNX에서 8비트 이하의 양자화 신경망을 후행 호환성 있게 어떻게 표현할 수 있는가?
- RQ2다양한 양자화 체계, 예를 들어 텐서 수준 및 채널 수준의 양자화를 지원하면서도, 임의 정밀도 균일 양자화를 영구적으로 표현할 수 있는 고수준이고 추상화된 ONNX 표현은 무엇인가?
- RQ3QONNX와 같은 통합 중간 표현이 Brevitas, QKeras 등의 QAT 프레임워크와 FINN, hls4ml 등의 FPGA 컴파일 툴체인 간에 원활한 상호운용성을 가능하게 할 수 있는가?
- RQ4저정밀도 양자화 모델의 표준화되고 확장 가능한 모델 저널을 어떻게 구축하여 벤치마킹과 커뮤니티 공유를 지원할 수 있는가?
- RQ5저정밀도 추론 환경에서 다양한 비트 폭 설정이 모델 정확도와 계산 비용에 미치는 영향는 어떠한가?
주요 결과
- QONNX는 고수준이고 확장 가능한 ONNX 기반 IR을 통해 임의 정밀도 비트 폭의 양자화 신경망, 특히 8비트 이하 정밀도까지 표현할 수 있다.
- QCDQ 및 클리핑이 포함된 양자화된 연산자 포맷은 기존 ONNX 도구 체인에서 저정밀도 양자화를 후행 호환성 있게 표현할 수 있도록 한다.
- QONNX 모델 저널에는 MNIST, CIFAR-10, ImageNet 데이터셋에 걸쳐 7개의 벤치마크 모델이 포함되어 있으며, 정확도는 MobileNet-w4a4의 71.14%에서부터 TFC-w2a2의 96.60%까지 다양하다. 이는 다양한 데이터셋에서 실용적인 배포 가능성을 보여준다.
- 모델 저널 내 모델들은 59k BOPs(TFC-w1a1)에서 740억 이상 BOPs(MobileNet-w4a4)에 이르는 광범위한 계산 복잡도를 보이며, 다양한 효율성과 정확도의 상호 교환 가능성을 반영한다.
- 성공적으로 QONNX 모델가 FINN-ONNX 형식으로 변환되어, FINN 툴체인을 사용한 FPGA에서의 완전한 컴파일 및 배포가 가능해졌다.
- 제안된 QONNX 형식은 양자화 세부 정보를 추상화하면서도 표현력을 유지하여, 더 넓은 하드웨어 지원과 ONNX 커뮤니티 내 향후 표준화를 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.