Skip to main content
QUICK REVIEW

[논문 리뷰] What is Your Data Worth to GPT? LLM-Scale Data Valuation with Influence Functions

Sang Keun Choe, Hwijeen Ahn|arXiv (Cornell University)|2024. 05. 22.
Big Data Technologies and Applications인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)을 위한 영향 함수 기반 데이터 평가를 가속화하는 저랭크 기울기 투영 방법 LoGra를 제안한다. 이는 기존 기준 대비 GPU 메모리 사용을 5배 줄이고 처리량을 최대 6,500배 향상시킨다. LoGra는 Logix 소프트웨어 프레임워크를 통해 최소한의 코드 수정으로 Llama3-8B-Instruct 모델에 대해 확장 가능하고 정확한 데이터 평가를 가능하게 하며, 1B토큰 데이터셋을 기반으로 한다.

ABSTRACT

Large language models (LLMs) are trained on a vast amount of human-written data, but data providers often remain uncredited. In response to this issue, data valuation (or data attribution), which quantifies the contribution or value of each data to the model output, has been discussed as a potential solution. Nevertheless, applying existing data valuation methods to recent LLMs and their vast training datasets has been largely limited by prohibitive compute and memory costs. In this work, we focus on influence functions, a popular gradient-based data valuation method, and significantly improve its scalability with an efficient gradient projection strategy called LoGra that leverages the gradient structure in backpropagation. We then provide a theoretical motivation of gradient projection approaches to influence functions to promote trust in the data valuation process. Lastly, we lower the barrier to implementing data valuation systems by introducing LogIX, a software package that can transform existing training code into data valuation code with minimal effort. In our data valuation experiments, LoGra achieves competitive accuracy against more expensive baselines while showing up to 6,500x improvement in throughput and 5x reduction in GPU memory usage when applied to Llama3-8B-Instruct and the 1B-token dataset.

연구 동기 및 목표

  • LLM 훈련 과정에서 데이터 제공자에게 기여도를 인정하거나 보상할 수 있는 메커니즘이 부족한 문제를 해결하고자 하며, 특히 데이터 사용에 대한 법적 및 윤리적 갈등이 증가하는 상황에서 이를 고려한다.
  • 현대 LLM과 그들의 거대한 훈련 데이터셋에 영향 함수와 같은 데이터 평가 방법을 적용할 때 발생하는 금전적, 계산적, 메모리 비용이 지나치게 높은 문제를 해결하고자 한다.
  • 완전한 기울기 계산과 재훈련 없이도 저비용으로 실행 가능하면서도 이론적으로 타당한 기울기 투영 방법을 개발하여 확장성과 효율성을 확보하고자 한다.
  • Logix라는 소프트웨어 패키지를 도입하여 기존 훈련 코드를 최소한의 노력으로 데이터 평가 코드로 변환할 수 있도록 하여, 데이터 평가의 실용적 적용 장벽을 낮추고자 한다.

제안 방법

  • 기울기 투영의 공간 및 시간 복잡도를 O(nk)에서 O(√(nk))로 감소시키기 위해, 역전파 기울기의 구조를 활용하는 저랭크 기울기 투영 알고리즘인 LoGra를 도입한다.
  • 전체 기울기를 메모리에 저장하지 않고 직접 투영 기울기를 계산함으로써, 낮은 GPU 메모리 사용과 높은 GPU 활용도를 달성한다.
  • 감쇠 항을 스펙트럼 기울기 희소화 메커니즘으로 해석함으로써 영향 함수에서 기울기 투영의 이론적 근거를 제시하고, 방법에 대한 신뢰도를 높인다.
  • 감쇠 항의 이론적 해석을 바탕으로 전문화된 PCA 초기화 기법을 LoGra에 제안한다.
  • 기존 LLM 훈련 코드를 쉽게 데이터 평가 코드로 변환할 수 있도록 하며, LLM 생태계 도구와의 호환성과 다른 해석 가능성 방법에 대한 확장성까지 고려한 소프트웨어 패키지 Logix를 개발한다.
  • LoGra를 사전학습 및 파인튜닝 모두에 적용하여, 두 환경 모두에서 데이터 평가가 가능하도록 한다.
Figure 1 : Data valuation system architecture. (Left Bottom) We first extract the Hessian and gradients for all training data using efficient gradient projection LoGra and store them in a database. (Left Top) At test time, we similarly extract gradients and query the database. (Right) The database r
Figure 1 : Data valuation system architecture. (Left Bottom) We first extract the Hessian and gradients for all training data using efficient gradient projection LoGra and store them in a database. (Left Top) At test time, we similarly extract gradients and query the database. (Right) The database r

실험 결과

연구 질문

  • RQ1영향 함수는 억만 파ram터를 가진 LLM과 대규모 데이터셋에 대해 계산 및 메모리 비용을 감당할 수 있을 정도로 확장 가능한가?
  • RQ2데이터 평가 정확도를 희생시키지 않으면서도 영향 함수의 기울기 투영을 어떻게 더 효율적으로 만들 수 있는가?
  • RQ3영향 함수에서 기울기 투영을 사용하는 데 이론적 기초는 무엇이며, 이를 어떻게 활용해 방법의 신뢰성을 높일 수 있는가?
  • RQ4소프트웨어 추상화를 통해 데이터 평가 시스템을 연구자 및 실무자들이 얼마나 실용적이고 접근하기 쉽게 만들 수 있는가?
  • RQ5LoGra가 식별한 가장 영향력 있는 훈련 예제들이 모델 출력과 비교할 때 질적 유사성과 유용성 측면에서 어떻게 다른가?

주요 결과

  • LoGra는 Llama3-8B-Instruct와 1B토큰 데이터셋에 적용되었을 때, 유일하게 확장 가능한 기준인 EKFAC 영향 함수 대비 최대 6,500배 높은 처리량과 5배 낮은 GPU 메모리 사용을 달성한다.
  • LoGra는 반사적 평가에서 경쟁 수준의 정확도를 유지하며, 높은 효율성에도 불구하고 영향 추정치의 신뢰성이 높음을 입증한다.
  • LoGra가 식별한 가장 가치 있는 훈련 예제들은 일반적으로 쿼리된 LLM 출력과 질적으로 유사한 특성을 보이며, 이는 방법의 해석 가능성과 관련성에 대한 지원을 제공한다.
  • 스펙트럼 기울기 희소화와 PCA 초기화를 통한 이론적 근거는 데이터 평가 과정에 대한 신뢰도를 향상시킨다.
  • Logix는 최소한의 코드 수정으로 기존 훈련 파이프라인에 데이터 평가를 쉽게 통합할 수 있도록 하여 LLM 커뮤니티 전반의 도입을 촉진한다.
  • 모델 출력 품질이 낮을 경우(예: Pythia-1.4B), 데이터 기여도 분석의 실패 사례가 더 자주 발생함을 확인하여, 모델 품질이 평가 신뢰성에 영향을 미칠 수 있음을 시사한다.
(a) Brittleness test
(a) Brittleness test

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.