[논문 리뷰] Optical Transformers
이 논문은 광학 행렬-벡터 곱셈을 사용하여 디지털 시스템보다 극적으로 높은 에너지 효율성을 달성하는 광학 트랜스포머—신경망 가속기—를 제안한다. 소형 광학 하드웨어 시스템에서의 정확한 추론을 실험하고 대규모 모델을 시뮬레이션함으로써, 저자들은 광학 시스템이 에너지 소비를 1/d 비율로 감소시켜 트리리온 파라미터 모델에 대해 현재 최고 수준의 디지털 프로세서보다 최대 8,000배 높은 효율성을 달성할 수 있음을 보여준다.
The rapidly increasing size of deep-learning models has caused renewed and growing interest in alternatives to digital computers to dramatically reduce the energy cost of running state-of-the-art neural networks. Optical matrix-vector multipliers are best suited to performing computations with very large operands, which suggests that large Transformer models could be a good target for optical computing. To test this idea, we performed small-scale optical experiments with a prototype accelerator to demonstrate that Transformer operations can run on optical hardware despite noise and errors. Using simulations, validated by our experiments, we then explored the energy efficiency of optical implementations of Transformers and identified scaling laws for model performance with respect to optical energy usage. We found that the optical energy per multiply-accumulate (MAC) scales as $\frac{1}{d}$ where $d$ is the Transformer width, an asymptotic advantage over digital systems. We conclude that with well-engineered, large-scale optical hardware, it may be possible to achieve a $100 imes$ energy-efficiency advantage for running some of the largest current Transformer models, and that if both the models and the optical hardware are scaled to the quadrillion-parameter regime, optical computers could have a $>8,000 imes$ energy-efficiency advantage over state-of-the-art digital-electronic processors that achieve 300 fJ/MAC. We analyzed how these results motivate and inform the construction of future optical accelerators along with optics-amenable deep-learning approaches. With assumptions about future improvements to electronics and Transformer quantization techniques (5$ imes$ cheaper memory access, double the digital--analog conversion efficiency, and 4-bit precision), we estimated that optical computers' advantage against current 300-fJ/MAC digital processors could grow to $>100,000 imes$.
연구 동기 및 목표
- 대규모 딥 러닝 모델, 특히 트랜스포머의 학습 및 추론에 따른 증가하는 에너지 비용을 해결하기 위해.
- 광학 계산이 대규모 트랜스포머 모델에 대해 확장 가능하고 에너지 효율적인 디지털 전자 프로세서의 대안이 될 수 있는지 탐색하기 위해.
- 노이즈와 오류가 존재하는 상황에서도 광학 하드웨어가 트랜스포머 연산을 정확하게 수행할 수 있음을 입증하기 위해.
- 다양한 모델 크기와 광학 에너지 예산에서 광학 에너지 효율성과 모델 성능 간의 스케일링 법칙을 수립하기 위해.
- 실험 및 시뮬레이션 결과를 바탕으로 향후 광학 가속기 및 광학에 적합한 딥 러닝 아키텍처 설계에 통찰을 제공하기 위해.
제안 방법
- 트랜스포머 추론에 대응하는 행렬-벡터 곱셈 연산을 수행하기 위해 공간 광학 조절 장치(SLM) 기반의 프로토타입을 사용한 소규모 광학 실험을 수행하였다.
- 실제 광학 하드웨어에서 수집한 노이즈, 오류, 정밀도 부족 데이터를 바탕으로 전체 광학 트랜스포머의 고정밀 시뮬레이션을 캘리브레이션하였다.
- 실험 측정치에서 유도된 체계적인 오류, 노이즈, 가중치/입력 정밀도 부족을 포함한 광학 트랜스포머 추론을 시뮬레이션하였다.
- 광학 신경망(ONN) 가속기의 총 에너지 소비를 모델링하였으며, 이는 광학 MAC 당 에너지, 메모리 액세스, 디지털-아날로그 변환 오버헤드를 포함한다.
- 모델 폭(d)과 총 광학 에너지 소비의 함수로 에너지 효율성의 스케일링 법칙을 평가하였으며, 광학 MAC 당 에너지 소비가 1/d 비율로 감소함을 보였다.
- 향후 전자기기 향상, 메모리 액세스 향상, 4비트 양자화를 가정한 다양한 조건에서 성능 및 에너지 이점을 예측하였다.

실험 결과
연구 질문
- RQ1광학 하드웨어는 본질적인 노이즈와 오류가 존재하더라도 트랜스포머가 요구하는 선형 연산을 정확하게 수행할 수 있는가?
- RQ2광학 트랜스포머의 에너지 효율성은 모델 크기와 광학 에너지 소비에 따라 어떻게 스케일링되는가?
- RQ3대규모 트랜스포머 추론에서 광학 프로세서가 디지털 프로세서보다 이론적·실제로 얼마나 더 높은 에너지 효율성을 제공하는가?
- RQ4학습 및 양자화 기법은 광학 트랜스포머에서 광자 사용과 성능에 어떤 영향을 미치는가?
- RQ5트리리온 파라미터 모델을 대상으로 하는 미래의 광학 가속기 설계에서의 핵심 설계 트레이드오프와 스케일링 한계는 무엇인가?
주요 결과
- 노이즈와 오류가 존재하는 상황에서도 실제 하드웨어에서 광학 행렬-벡터 곱셈을 높은 정확도로 수행할 수 있으며, 이는 실험과 시뮬레이션을 통해 검증되었다.
- 광학 MAC 연산당 에너지 소비는 모델 폭 d에 대해 1/d 비율로 감소하며, 이는 일정한 MAC 당 에너지 소비를 가지는 디지털 시스템에 비해 점점 더 유리한 에너지 이점을 제공한다.
- 현재 대규모 트랜스포머(예: 175B 파라미터 모델)의 경우, 광학 시스템은 현재 최고 수준의 디지털 프로세서(300 fJ/MAC)보다 100배 높은 에너지 효율성을 달성할 수 있다.
- 모델과 광학 하드웨어가 모두 퀼리온 파라미터 수준으로 확장될 경우, 광학 시스템은 디지털 프로세서보다 8,000배 이상의 에너지 효율성을 확보할 수 있다.
- 유리한 가정(메모리 액세스 비용이 5배 저렴하고, 디지털-아날로그 변환 효율이 두 배로 향상되며, 4비트 양자화가 적용될 경우) 하에서는 에너지 이점이 100,000배를 초과할 수 있다.
- 8비트 디지털 모델 성능을 유지하기 위한 광자 사용은 모델 크기에 따라 비선형적으로 증가하지만, 효율성은 가중치 및 활성화 통계에 매우 민감하며, 이는 주로 양자화 및 학습 기법에 의해 영향을 받는다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.