Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Stage Influence Function

Hongge Chen, Si Si|arXiv (Cornell University)|2020. 07. 17.
Topic Modeling참고 문헌 25인용 수 4
한 줄 요약

이 논문은 미세조정 모델의 예측을 사전학습 데이터의 영향을 미친 예시로 추적할 수 있는 다단계 영향 함수를 제안한다. 이는 모델의 볼록성 조건이 필요 없이 재학습 없이도 효율적인 영향도 추정을 가능하게 하며, 예측된 영향도와 실제 영향도 간 강한 상관관계(최대 0.92)를 보이며, 사전학습 및 미세조정 단계에서 데이터 영향을 분석할 수 있는 확장 가능한 방법을 제공한다.

ABSTRACT

Multi-stage training and knowledge transfer, from a large-scale pretraining task to various finetuning tasks, have revolutionized natural language processing and computer vision resulting in state-of-the-art performance improvements. In this paper, we develop a multi-stage influence function score to track predictions from a finetuned model all the way back to the pretraining data. With this score, we can identify the pretraining examples in the pretraining task that contribute most to a prediction in the finetuning task. The proposed multi-stage influence function generalizes the original influence function for a single model in (Koh & Liang, 2017), thereby enabling influence computation through both pretrained and finetuned models. We study two different scenarios with the pretrained embeddings fixed or updated in the finetuning tasks. We test our proposed method in various experiments to show its effectiveness and potential applications.

연구 동기 및 목표

  • 다단계 학습에서 사전학습 데이터가 미세조정 모델 성능에 미치는 영향을 정량적으로 측정할 수 있는 방법의 부족을 해결하기 위해.
  • 재학습 없이도 미세조정 예측에서 사전학습 데이터로의 영향 분석을 가능하게 하여, 직접 제거 방식의 계산 비용이 너무 높아 비현실적인 문제를 해결하기 위해.
  • 특히 '오류 전이'(false transfer)나 저샷 학습 상황에서 사전학습 데이터가 미세조정 작업에 유익한지 유해한지 이해하기 위해.
  • 영향을 두 가지 구성요소로 분해하기 위해: 사전학습 모델에 대한 영향과 미세조정 모델에 대한 영향, 이를 통해 더 나은 해석 가능성을 확보하기 위해.
  • 고정된 설정과 업데이트된 임bedding 설정 모두에서 작동하는 확장 가능한 일차 근사 방법을 제공하기 위해.

제안 방법

  • 사전학습과 미세조정 단계를 거쳐 사전학습 데이터로의 영향을 추적할 수 있도록 기존 영향 함수(Koh & Liang, 2017)를 일반화한 다단계 영향 함수를 제안한다.
  • 사전학습 예시를 제거했을 때 손실 변화의 일차 근사를 사용하여, 재학습 없이도 효율적인 계산이 가능하도록 한다.
  • 사전학습 임베딩이 고정되어 있는지, 또는 최종 태스크 동안 미세조정되는지의 두 가지 설정에서 별도로 영향도 점수를 유도한다.
  • 사전학습 단계와 미세조정 단계의 기울기 곱을 통해 전체 역전파 경로의 영향을 캡처한다.
  • 각 사전학습 예시가 최종 미세조정 예측에 미치는 영향을 추정하기 위해 자코비안 기반 근사를 활용한다.
  • 병렬 계산을 적용하여 대규모 모델(예: 9360만 파라미터를 가진 ELMo)에도 적용 가능하게 하며, 각 데이터 포인트의 영향도는 독립적으로 계산된다.

실험 결과

연구 질문

  • RQ1하나의 다운스트림 미세조정 작업에서 어떤 사전학습 예시가 가장 많은 영향을 미치는가?
  • RQ2사전학습과 미세조정 작업 간 유사도가 사전학습 데이터가 미세조정 모델에 미치는 영향에 어떻게 영향을 미치는가?
  • RQ3미세조정 예시의 수가 모델 예측에 대한 사전학습 데이터의 상대적 영향에 영향을 미치는가?
  • RQ4유해한 사전학습 데이터가 미세조정 성능에 악영향을 주는 '오류 전이'(false transfer)를 탐지할 수 있는가?
  • RQ5제안된 영향도 점수가 사전학습 예시를 제거했을 때 진정한 손실 변화와 얼마나 잘 상관되는가?

주요 결과

  • 제안된 다단계 영향 함수는 사전학습 예시를 제거했을 때 예측된 영향도 점수와 실제 손실 차이 간 강한 상관관계(최대 0.92)를 보였다.
  • 더 많은 미세조정 예시와 단계를 거치면서 사전학습 데이터의 평균 절대 영향도는 0.15에서 0.05로 감소하여, 사전학습 데이터에 대한 의존도가 감소함을 시사했다.
  • ELMo 기반 감성 분류 작업에서, 9360만 파라미터를 가진 모델에서 사전학습 데이터 포인트당 평균 0.94초가 소요되어 영향도 계산이 효율적으로 수행됨을 확인했다.
  • 메서드는 테스트 입력과 의미적으로 관련된 문장들(예: 정치 인물이나 정책 결정을 다루는 문장들)에서 높은 영향도(예: 0.0841)를 가진 사전학습 문장을 성공적으로 식별했다.
  • 미세조정 데이터가 풍부할 경우 사전학습 데이터의 영향도가 크게 감소함을 확인하여, 충분한 데이터가 있을 경우 미세조정 데이터가 지배적임을 확인했다.
  • 테스트 입력과 의미적으로 관련이 없는 저영향도 사전학습 예시들(예: 영향도 < 10^-6)을 정확히 식별하여, 이 방법이 관련성에 민감하게 반응함을 검증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.