Skip to main content
QUICK REVIEW

[논문 리뷰] AI capabilities can be significantly improved without expensive retraining

Tom Davidson, Jean-Stanislas Denain|arXiv (Cornell University)|2023. 12. 12.
Adversarial Robustness in Machine Learning인용 수 6
한 줄 요약

이 논문은 재훈련을 통해 동일한 성능 향상을 달성하는 데 필요한 계산 자원과 비교할 때, 도구 사용, 프롬프팅, 서포트 구조 설계 등 후훈련 AI 향상 기법의 성능 향상 정도를 정량화하기 위해 계산 자원 등가 이득(compute-equivalent gain, CEG) 지표를 도입한다. 다양한 기법들이 전처리 계산 자원의 5배에서 20배에 해당하는 성능 향상을 이룰 수 있으며, 이는 전체 비용의 몇 퍼센트不到에서 달성되므로 매우 효율적인 AI 능력 향상 수단임을 시사한다.

ABSTRACT

State-of-the-art AI systems can be significantly improved without expensive retraining via "post-training enhancements"-techniques applied after initial training like fine-tuning the system to use a web browser. We review recent post-training enhancements, categorizing them into five types: tool-use, prompting methods, scaffolding, solution selection, and data generation. Different enhancements improve performance on different tasks, making it hard to compare their significance. So we translate improvements from different enhancements into a common currency, the compute-equivalent gain: how much additional training compute would be needed to improve performance by the same amount as the enhancement. Our non-experimental work shows that post-training enhancements have significant benefits: most surveyed enhancements improve benchmark performance by more than a 5x increase in training compute, some by more than 20x. Post-training enhancements are relatively cheap to develop: fine-tuning costs are typically <1% of the original training cost. Governing the development of capable post-training enhancements may be challenging because frontier models could be enhanced by a wide range of actors.

연구 동기 및 목표

  • 다양한 기법 간 성능 향상 정도를 비교하는 데 어려움이 있는 상황에서, 동일한 기준 지표를 사용해 후훈련 향상 기법이 AI 능력에 미치는 영향을 정량화하는 것.
  • 추가 전처리 계산 자원 투자에 비해 후훈련 향상 기법이 얼마나 높은 성능 향상을 제공하는지 평가하는 것.
  • 후훈련 향상 기법의 경제적 및 전략적 영향을 고려해 AI 개발 및 거버넌스에 미치는 영향을 분석하는 것.
  • 이러한 향상 기법이 AI 발전의 방향성을 어떻게 재편할 수 있으며, 향후 안전 정책 결정에 어떤 영향을 미칠 수 있는지 탐색하는 것.

제안 방법

  • 계산 자원 등가 이득(CEG) 지표를 도입: 특정 후훈련 향상 기법이 달성한 성능 향상 정도를 동일한 전처리 분포에서 추가 전처리 계산 자원을 투입했을 때 얻을 수 있는 성능 향상과 비교하는 지표.
  • 후훈련 향상 기법을 다섯 가지 유형으로 분류: 도구 사용, 프롬프팅, 서포트 구조 설계, 해법 선택, 데이터 생성.
  • 기존 전처리 분포에서의 계산 자원 증가에 따른 성능 향상 가정을 바탕으로, 성능 테스트 전후의 모델 성능을 비교해 CEG 값을 추정한다.
  • 원래 전처리 비용과의 비교를 통해 후훈련 향상 기법의 일회성 비용 및 런타임 비용의 경제적 효율성을 평가한다.
  • 기존 연구에서 확보한 벤치마크 데이터(예: MATH, HumanEval, GSM8K)를 활용해 다양한 작업 및 향상 기법에 대해 CEG를 추정한다.
  • CEG 프레임워크를 활용해 다수의 향상 기법이 누적된 효과와 점진적 감소 효과를 평가하고, 능력 프로파일 및 시간에 따른 향상 속도를 분석한다.
Figure 1 : Illustration of the compute-equivalent gain. The enhanced model has the same performance as a non-enhanced model trained with $5\times$ more compute.
Figure 1 : Illustration of the compute-equivalent gain. The enhanced model has the same performance as a non-enhanced model trained with $5\times$ more compute.

실험 결과

연구 질문

  • RQ1후훈련 향상 기법이 재훈련을 통해 동일한 성능 향상을 달성하기 위해 필요한 계산 자원과 비교해 얼마나 많은 성능 향상을 제공하는가?
  • RQ2후훈련 향상 기법을 개발하고 구현하는 데 드는 비용은 전처리 계산 자원 증가에 비해 어느 정도인가?
  • RQ3후훈련 향상 기법은 일반화 가능한 능력 향상 기법인가, 아니면 작업에 특화된 기법인가?
  • RQ4다양한 후훈련 향상 기법이 상호작용할 경우, 성능 향상의 점진적 감소 또는 최대 한계가 존재하는가?
  • RQ5후훈련을 통한 광범위하고 저비용의 능력 향상이 널리 보급됨에 따라 AI 거버넌스 및 안전 정책에 어떤 영향을 미칠 수 있는가?

주요 결과

  • 조사된 대부분의 후훈련 향상 기법은 전처리 계산 자원을 5배 이상 증가시켰을 때 얻을 수 있는 성능 향상과 동등한 성능 향상을 제공하며, 일부는 20배 이상의 성능 향상을 달성한다.
  • 대부분의 향상 기법에 대한 피니튜닝 비용은 원래 전처리 비용의 1퍼센트 미만이므로, 재훈련 대비 매우 경제적 효율성을 지닌다.
  • 후훈련 향상 기법은 일반적으로 도메인에 특화되어 있으며, 전처리 스케일링과 달리 다양한 작업 전반에서 성능 향상을 이끌어내는 데에는 미치지 못한다.
  • 계산 자원 등가 이득(CEG)은 다양한 벤치마크와 도메인 간에 다양한 후훈련 기법의 영향을 비교할 수 있는 유용하고 표준화된 지표이다.
  • 후훈련 향상 기법을 통한 지속적인 발전 가능성이 크며, 다만 점차 감소하는 수익 또는 성능의 한계가 존재하는지는 여전히 미해결 과제이다.
  • 후훈련 향상 기법의 넓은 접근 가능성—다양한 주체들이 쉽게 개선할 수 있는 가능성—은 AI 거버넌스 및 안전 규제에 고유한 도전 과제를 제기한다.
Figure 2 : Distribution of CEG and additional costs of the techniques we studied. The one-time cost is given as a fraction of pre-training, the runtime cost is relative to the runtime cost without the enhancement. Enhancements without one-time cost are shown with an arrow on the y axis.
Figure 2 : Distribution of CEG and additional costs of the techniques we studied. The one-time cost is given as a fraction of pre-training, the runtime cost is relative to the runtime cost without the enhancement. Enhancements without one-time cost are shown with an arrow on the y axis.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.