Skip to main content
QUICK REVIEW

[논문 리뷰] Structural Knowledge Distillation: Tractably Distilling Information for Structured Predictor

Xinyu Wang, Yong Jiang|arXiv (Cornell University)|2020. 10. 10.
Explainable Artificial Intelligence (XAI)참고 문헌 40인용 수 6
한 줄 요약

이 논문은 지도 학습에서 큰 구조적 예측 모델(선생 모델)에서 작은 모델(학생 모델)으로 지식을 전이하기 위한 구조적 지식 정련(SKD)을 제안한다. 이 방법은 지식 정련 목표를 부분 구조로 인수 분해함으로써 계산 가능성을 확보한다. 이 접근법은 서로 다른 또는 상호 호환되지 않는 인수 분해 형태를 가진 모델 아키텍처 간에도 효과적인 정련을 가능하게 하며, 실험적으로 이전 방법들을 능가한다. 특히, 레이블이 없는 데이터를 활용할 경우, 학생 모델이 사전 훈련 없이도 다국어 간 전이에서 선생 모델을 능가할 수 있다.

ABSTRACT

Knowledge distillation is a critical technique to transfer knowledge between models, typically from a large model (the teacher) to a more fine-grained one (the student). The objective function of knowledge distillation is typically the cross-entropy between the teacher and the student's output distributions. However, for structured prediction problems, the output space is exponential in size; therefore, the cross-entropy objective becomes intractable to compute and optimize directly. In this paper, we derive a factorized form of the knowledge distillation objective for structured prediction, which is tractable for many typical choices of the teacher and student models. In particular, we show the tractability and empirical effectiveness of structural knowledge distillation between sequence labeling and dependency parsing models under four different scenarios: 1) the teacher and student share the same factorization form of the output structure scoring function; 2) the student factorization produces more fine-grained substructures than the teacher factorization; 3) the teacher factorization produces more fine-grained substructures than the student factorization; 4) the factorization forms from the teacher and the student are incompatible.

연구 동기 및 목표

  • 출력 공간이 기하급수적으로 큰 경우 표준 지식 정련이 비계산 가능해지는 문제를 해결하기 위해.
  • 구조적 모델의 부분 구조 인수 분해를 활용한 계산 가능한 지식 정련 목표를 개발하기 위해.
  • 다른 또는 상호 호환되지 않는 인수 분해 형태를 가진 선생 모델과 학생 모델 간의 효과적인 정련을 가능하게 하기 위해.
  • 더 큰 선생 모델의 지식을 활용하여 구조적 예측 작업에서 학생 모델의 성능을 향상시키기 위해.
  • SKD의 효과성을 저자원 및 제로샷 다국어 전이 환경에서 입증하기 위해.

제안 방법

  • 부분 구조 스코링 함수에 기반한 지식 정련 목표의 인수 분해 형태를 유도하여 계산 가능하게 한다.
  • 선생 모델의 부분 구조에 대한 주변 분포가 효율적으로 계산 가능하고, 학생 모델의 부분 구조 공간이 다항식 크기임을 가정한다.
  • 선생 모델의 부분 구조 예측에서 유도된 정련 손실을 사용하여 학생 모델을 훈련한다.
  • 네 가지 시나리오를 지원한다: 공통 인수 분해, 학생이 더 세밀한 경우, 선생이 더 세밀한 경우, 상호 호환되지 않는 인수 분해.
  • 특히 제로샷 다국어 전이에서 일반화 성능을 향상시키기 위해 레이블이 없는 데이터를 추가로 활용한다.
  • 평가를 위해 표준 구조적 예측 모델(예: CRF, MaxEnt, NER-as-parsing)을 사용한다.

실험 결과

연구 질문

  • RQ1출력 공간이 기하급수적으로 큰 구조적 예측 작업에 대해 지식 정련을 계산 가능하게 만들 수 있는가?
  • RQ2선생 모델과 학생 모델이 출력 스코링에 대해 서로 다른 또는 상호 호환되지 않는 인수 분해 형태를 사용할 경우, 정련을 효과적으로 수행할 수 있는가?
  • RQ3구조적 지식 정련은 표준 정련 또는 정련 없이 학습한 경우에 비해 학생 모델의 성능을 향상시키는가?
  • RQ4레이블이 없는 데이터는 제로샷 다국어 전이 환경에서 학생 모델의 성능을 추가로 향상시킬 수 있는가?
  • RQ5SKD를 통해 훈련된 학생 모델가 미세조정 없이도 다국어 전이에서 선생 모델을 능가할 수 있는가?

주요 결과

  • 제안된 구조적 지식 정련 방법은 선생-학생 모델 간 호환성의 네 가지 시나리오 전반에서 기준선 정련 방법보다 뛰어난 성능을 달성한다.
  • 이전 정련 방법이 적용 가능한 경우에도 SKD는 항상 그들을 능가하며, 특히 시퀀스 레이블링 및 의존성 파싱 작업에서 두드러진다.
  • 충분한 레이블이 없는 데이터가 있을 경우, SKD로 훈련된 학생 모델는 제로샷 다국어 전이에서 선생 모델를 초월할 수 있으며, 강력한 일반화 능력을 보여준다.
  • 선생 모델과 학생 모델의 인수 분해 형태가 상호 호환되지 않을 경우에도 이 방법은 효과적이며, 이는 이전 접근법이 어려워하는 영역이다.
  • 선생 모델의 주변 예측(예: 위치별 분포)만으로는 높은 정확도를 달성하기 어렵다는 점을 입증하며, 구조적 정련의 가치를 강조한다.
  • 인수 분해된 정련 목표는 효율적인 최적화를 가능하게 하며, CRF, MaxEnt, NER-as-parsing와 같이 널리 사용되는 모델에도 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.