Skip to main content
QUICK REVIEW

[논문 리뷰] We need to talk about random seeds

Steven Bethard|arXiv (Cornell University)|2022. 10. 24.
Machine Learning and Data Classification인용 수 5
한 줄 요약

이 논문은 자연어 처리(NLP) 연구에서 랜덤 시드가 자주 오용되고 있다고 주장한다. 특히 '재현 가능성'을 확보한다는 명목으로 고정된 시드를 사용하거나, 성능 분포를 도출하기 위해 오직 랜덤 시드만을 사용하는 경우가 대표적이다. 연구자들은 ACL 앤서로지에 등재된 85篇의 논문을 분석한 결과, 50퍼센트 이상이 랜덤 시드를 위험수반하는 방식으로 사용하고 있음을 발견했으며, 향후 시드를 최적화해야 할 초모수(hyperparameter)로 간주해야 한다고 촉구한다.

ABSTRACT

Modern neural network libraries all take as a hyperparameter a random seed, typically used to determine the initial state of the model parameters. This opinion piece argues that there are some safe uses for random seeds: as part of the hyperparameter search to select a good model, creating an ensemble of several models, or measuring the sensitivity of the training algorithm to the random seed hyperparameter. It argues that some uses for random seeds are risky: using a fixed random seed for "replicability" and varying only the random seed to create score distributions for performance comparison. An analysis of 85 recent publications from the ACL Anthology finds that more than 50% contain risky uses of random seeds.

연구 동기 및 목표

  • NLP 신경망 연구에서 랜덤 시드의 일반적 사용 방식을 식별하고 분류하기.
  • 모델 훈련 및 평가 맥락에서 랜덤 시드의 안전한 사용과 위험한 사용을 구분하기.
  • 특히 고정된 시드 사용과 시드 단독 성능 비교 등 랜덤 시드 오용이 널리 퍼져 있는 NLP 논문을 부각하기.
  • NLP 분야의 재현 가능성과 모델 평가 향상을 위해 더 나은 훈련, 심사 및 저자 관행을 촉구하기.
  • 특히 랜덤 시드에 대한 초모수 처리 방식에 대한 더 넓은 공동체 논의를 시작하기.

제안 방법

  • NLP 분야에서의 랜덤 시드 사용을 다섯 가지 유형으로 분류한 분류 체계를 개발: 모델 선택, 앙상블 생성, 민감도 분석, 고정 시드 사용, 시드 변동에 의한 성능 비교.
  • ACL 앤서로지에서 최근 85편의 NLP 논문을 수작업으로 검토하여, 분류 체계의 카테고리에 따라 랜덤 시드 사용 방식을 분류.
  • 관련 논문를 식별하기 위해 '신경망'과 '랜덤 시드'가 동시에 언급된 논문만 포함하는 엄격한 검색 전략을 사용.
  • 텍스트적 증거를 바탕으로 각 논문을 주요 카테고리에 할당하였으며, 근거를 담은 스프레드시트를 공개.
  • 2015년부터 2021년까지의 추세를 분석하여 위험수반하는 시드 사용이 감소하고 있는지 여부를 평가.
  • 질적 분석과 인용 논문 리뷰를 통해 연구 결과를 맥락화하고, 연구 관행 향상을 위한 권고를 뒷받침.

실험 결과

연구 질문

  • RQ1현대 NLP 연구에서 랜덤 시드가 일반적으로 어떻게 사용되고 있는가?
  • RQ2모델 개발 및 평가 맥락에서 랜덤 시드의 어떤 사용이 안전하고, 어떤 사용이 위험한가?
  • RQ3최근 NLP 문헌에서 위험수반하는 랜덤 시드 사용이 얼마나 널리 퍼져 있는가?
  • RQ4ACL 앤서로지에서 위험수반하는 랜덤 시드 사용 빈도는 시간이 지남에 따라 감소했는가?
  • RQ5NLP 연구에서 랜덤 시드 오용을 줄이기 위해 기관과 개인이 지녀야 할 책임은 무엇인가?

주요 결과

  • 검토한 85편의 NLP 논문 중 50퍼센트 이상(48편 중 48편)이 랜덤 시드를 위험수반하는 방식으로 사용했으며, 이 중 24편은 단일 고정 시드를 사용하고, 24편은 오직 시드 변동에 의한 성능 비교만을 수행했다.
  • 2015년부터 2021년까지 위험수반하는 시드 사용 비율은 변화 없이 안정적으로 유지되어, 오랜 기간 동안 오용이 지속되고 있음을 시사한다.
  • 고정 시드 사용은 종종 '재현 가능성'을 확보하기 위한 이유로 정당화되지만, 이는 오해일 수 있다. 동일한 시드를 사용하더라도 하드웨어나 소프트웨어의 차이로 인해 재현이 깨질 수 있기 때문이다.
  • 단일 고정 시드를 사용할 경우 모델의 진정한 성능을 과소평가할 수 있다. 왜냐하면 최적의 초기화 상태에 도달하지 못할 수 있기 때문이다.
  • 학습률이나 드롭아웃 비율처럼, 랜덤 시드를 최적화해야 할 초모수로 간주하는 것이 성능 향상에 기여할 수 있으며, 이는 저자들이 인용한 이전 연구에서도 입증된 바 있다.
  • 분석은 보수적인 편이므로, '랜덤 시드'라는 단어를 명시적으로 언급한 논문들만 포함되어 있어, 전체 문헌에서 실제로 위험수반하는 시드 사용 비율은 이보다 더 높을 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.