Skip to main content
QUICK REVIEW

[논문 리뷰] CodeNet: Training Large Scale Neural Networks in Presence of Soft-Errors

Sanghamitra Dutta, Ziqian Bai|arXiv (Cornell University)|2019. 03. 04.
Advanced Memory and Neural Computing참고 문헌 89인용 수 4
한 줄 요약

CodeNet는 신뢰할 수 없는 저전력 하드웨어에서 흔히 발생하는 소프트 에러 상황에서도 신뢰할 수 있고 오버헤드가 낮은 대규모 딥 네ural 네트워크의 훈련을 가능하게 하는 분산형, 코드 이론 기반 전략을 제안한다. 각 레이어를 독립적으로 인코딩하고 분산된 방식으로 오류 검출 및 디코딩을 수행함으로써, 복제 방식보다 더 높은 오류 내성과 더 낮은 평균 계산 시간을 달성하며, 계산 및 통신 비용은 복제 방식과 유사하게 유지하면서 생물학적으로 타당하고 에너지 효율적인 훈련을 가능하게 한다.

ABSTRACT

This work proposes the first strategy to make distributed training of neural networks resilient to computing errors, a problem that has remained unsolved despite being first posed in 1956 by von Neumann. He also speculated that the efficiency and reliability of the human brain is obtained by allowing for low power but error-prone components with redundancy for error-resilience. It is surprising that this problem remains open, even as massive artificial neural networks are being trained on increasingly low-cost and unreliable processing units. Our coding-theory-inspired strategy, "CodeNet," solves this problem by addressing three challenges in the science of reliable computing: (i) Providing the first strategy for error-resilient neural network training by encoding each layer separately; (ii) Keeping the overheads of coding (encoding/error-detection/decoding) low by obviating the need to re-encode the updated parameter matrices after each iteration from scratch. (iii) Providing a completely decentralized implementation with no central node (which is a single point of failure), allowing all primary computational steps to be error-prone. We theoretically demonstrate that CodeNet has higher error tolerance than replication, which we leverage to speed up computation time. Simultaneously, CodeNet requires lower redundancy than replication, and equal computational and communication costs in scaling sense. We first demonstrate the benefits of CodeNet in reducing expected computation time over replication when accounting for checkpointing. Our experiments show that CodeNet achieves the best accuracy-runtime tradeoff compared to both replication and uncoded strategies. CodeNet is a significant step towards biologically plausible neural network training, that could hold the key to orders of magnitude efficiency improvements.

연구 동기 및 목표

  • 1956년 폰 노이만이 제안한 고장 내성 계산의 비전을 영감으로 삼아, 오류가 자주 발생하고 전력 소모가 낮은 하드웨어에서 딥 네럴 네트워크를 신뢰성 있게 훈련시키는 장기적인 과제를 해결하기 위해.
  • 높은 부담을 수반하고 단일 장애 지점에 취약한 기존의 복제 기반 접근 방식의 한계를 극복하기 위해.
  • 모든 계산 단계—인코딩, 디코딩, 비선형 활성화, 행렬 연산—이 오류가 발생할 수 있는 상황에서도 신뢰성을 유지할 수 있도록 분산형, 코드 이론 기반 프레임워크를 설계하기 위해.
  • 계산 및 통신 비용은 복제 방식과 유사하게 유지하면서 복제보다 더 높은 오류 내성을 달성하여 소프트 에러 조건 하에서 더 빠른 훈련을 가능하게 하기 위해.
  • 뇌가 신뢰성 없는 구성 요소에서 재현성과 오류 내성을 활용하는 방식을 모방함으로써 생물학적으로 타당한 신경망 훈련을 가능하게 하기 위해.

제안 방법

  • CodeNet는 각 레이어의 가중치 행렬을 오류 수정 코드를 사용해 인코딩하여, 오버헤드를 줄이기 위해 각 레이어별로 독립적으로 인코딩한다.
  • 모든 주요 연산—인코딩, 디코딩, 비선형 활성화, 행렬 곱셈—이 고장 날 수 있는 노드에서 수행될 수 있도록 분산 아키텍처를 채택한다.
  • 오류 검출은 오류가 발생하지 않는 것으로 가정되는 경량 검증 단계를 통해 구현되며, 중심 기관 없이 손상된 데이터를 감지할 수 있다.
  • 시스템은 하위 행렬이 노드 간에 분산되어 처리되고 계산 후 현지에서 디코딩이 수행되는 방식의 수정된 분산 행렬 계산 기법을 사용한다.
  • 코드 이론을 활용하여 신경망 계산의 구조와 오류 전파 특성을 고려함으로써, 복제보다 더 많은 오류를 견딜 수 있도록 한다.
  • 매 반복 후에 다시 행렬을 인코딩하지 않기 때문에 계산 오버헤드를 크게 줄였다.

실험 결과

연구 질문

  • RQ1분산 DNN 훈련에서 복제 방식보다 더 높은 오류 내성을 달성할 수 있는가?
  • RQ2모든 구성 요소가 고장 날 수 있는 상황에서 비선형 활성화 및 행렬 연산을 포함한 DNN 훈련의 모든 단계에서 오류 내성을 유지할 수 있는가?
  • RQ3오버헤드를 복제 방식과 유사하게 유지하면서도 신뢰성 없는 하드웨어에서 신뢰성 있는 훈련을 가능하게 할 수 있는가?
  • RQ4오류 검출 및 디코딩 조차도 고장 날 수 있는 상황이지만 전체 계산이 여전히 신뢰성 있게 유지될 수 있는가?
  • RQ5체크포인팅 및 오류 복구 오버헤드를 고려할 때, 복제 방식보다 더 빠른 기대 계산 시간을 달성할 수 있는가?

주요 결과

  • CodeNet는 복제 방식보다 더 높은 오류 내성을 확보하여 빈번한 체크포인팅이 필요 없어지면서 더 빠른 훈련을 가능하게 한다.
  • 오류 검출 및 복구 오버헤드를 고려하더라도 CodeNet 하에서의 기대 계산 시간은 복제 방식보다 낮다.
  • CodeNet는 계산 및 통신 비용을 복제 방식과 동일하게 유지하여 대규모 분산 훈련에 대해 확장 가능하다.
  • 실험 결과, CodeNet는 비코딩 및 복제 기반 전략 대비 최적의 정확도-실행 시간 트레이드오프를 달성한다.
  • 소프트 에러 확률이 3×10⁻⁴일지라도, 비코딩 훈련은 심각한 성능 저하를 겪는 반면 CodeNet는 높은 정확도를 유지한다.
  • 분산 설계로 단일 장애 지점이 제거되었으며, 모든 연산이 고장 날 수 있는 상황이지만도 전체 계산이 신뢰성 있게 유지되어 생물학적으로 타당한 계산을 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.