Skip to main content
QUICK REVIEW

[논문 리뷰] Exploiting Asymmetry for Synthetic Training Data Generation: SynthIE and the Case of Information Extraction

Martin Josifoski, Marija Šakota|arXiv (Cornell University)|2023. 03. 07.
Topic Modeling인용 수 6
한 줄 요약

이 논문은 대규모 언어 모델(LM)이 사전 정의된 구조적 출력(예: (주어, 관계, 목적어) 삼중항)에서 자연어 입력을 생성하도록 프롬프팅하여 구조적 출력 생성과 텍스트 생성 간의 비대칭성을 활용하는 SynthIE를 제안한다. 이는 작업을 뒤집음으로써, 닫힘 정보 추출(cIE)을 위한 180만 개의 고품질 합성 데이터 포인트를 생성하며, 이는 파라미터 수 220M~770M인 소형 미세조정 모델이 최신 기술 수준 성능을 달성하게 한다. 이로써 마이크로-F1과 마크로-F1에서 각각 57점, 79점의 절대적 향상을 이룬다.

ABSTRACT

Large language models (LLMs) have great potential for synthetic data generation. This work shows that useful data can be synthetically generated even for tasks that cannot be solved directly by LLMs: for problems with structured outputs, it is possible to prompt an LLM to perform the task in the reverse direction, by generating plausible input text for a target output structure. Leveraging this asymmetry in task difficulty makes it possible to produce large-scale, high-quality data for complex tasks. We demonstrate the effectiveness of this approach on closed information extraction, where collecting ground-truth data is challenging, and no satisfactory dataset exists to date. We synthetically generate a dataset of 1.8M data points, establish its superior quality compared to existing datasets in a human evaluation, and use it to finetune small models (220M and 770M parameters), termed SynthIE, that outperform the prior state of the art (with equal model size) by a substantial margin of 57 absolute points in micro-F1 and 79 points in macro-F1. Code, data, and models are available at https://github.com/epfl-dlab/SynthIE.

연구 동기 및 목표

  • 닫힘 정보 추출(cIE)을 위한 기존 데이터셋의 부족함과 낮은 품질 문제를 해결하기 위해, 수작업로 어노테이션에 소요되는 비용과 시간을 줄이기 위해.
  • LLM이 직접적으로 구조적 출력을 생성하는 데에 한계가 있음을 극복하기 위해, 작업 비대칭성을 활용함으로써 LLM이 구조적 출력에서 자연어를 생성하도록 하는 것.
  • 작은 효율적인 모델이 우수한 일반화 능력을 가지기 위해 훈련할 수 있도록, 대규모, 고품질, 균일하게 분포된 합성 데이터셋을 cIE를 위해 생성하기 위해.
  • 역방향 프롬프팅을 통해 생성된 합성 데이터가 실제 세계 데이터셋을 초월해 품질 면에서 뛰어나고, 하류 작업에서 최신 기술 수준의 성능을 달성할 수 있음을 보여주기 위해.

제안 방법

  • 위키데이터에서 관계의 균형 잡힌 커버리지와 의미적 일관성을 확보하기 위해 (주어, 관계, 목적어) 삼중항의 일관된 집합을 샘플링한다.
  • 대규모 언어 모델(GPT-3.5 등)을 사용하여 샘플된 삼중항 집합을 정확히 표현하는 자연어 텍스트를 생성함으로써, 일반적인 cIE 방향을 뒤집는다.
  • 생성된 텍스트가 의도한 사실만 포함하고 부가적인 삼중항을 포함하지 않도록 검증함으로써, 높은 충실도를 확보하는 합성 데이터 생성 파이프라인을 설계한다.
  • T5 기반의 소형 모델(예: Flan-T5)을 합성 데이터셋에 대해 미세조정하여 cIE에 최적화된 SynthIE 모델을 생성한다.
  • 다단계 인간 평가를 통해 데이터 품질을 검증하며, 생성된 텍스트 내 목표 사실의 정밀도, 재현도, 커버리지 수준을 측정한다.
  • REBEL Clean을 기준으로 모델 성능을 비교하며, 골드 어노테이션과 모델 예측을 사용해 진정한 양성 수를 신중하게 추정한다.

실험 결과

연구 질문

  • RQ1직접 생성이 실패할 경우, 대규모 언어 모델이 구조적 예측 작업을 위한 고품질 합성 학습 데이터를 효과적으로 생성할 수 있는가?
  • RQ2구조적 출력에서 자연어를 생성하는 작업을 뒤집는 방식이 직접 생성보다 더 충실도가 높고 품질이 뛰어난 데이터를 생성하는가?
  • RQ3예를 들어 관계 빈도가 균일한 등의 분포적 특성을 제어하는 합성 데이터가, 분포가 비균형인 실제 세계 데이터셋보다 더 나은 모델 일반화를 이끌 수 있는가?
  • RQ4합성 데이터에 대해 미세조정된 소형 모델이 기존 실제 세계 데이터셋에 대해 훈련된 모델보다 닫힘 정보 추출에서 얼마나 뛰어난 성능을 보일 수 있는가?

주요 결과

  • SynthIE가 생성한 합성 데이터셋은 180만 개의 고품질 데이터 포인트를 포함하며, 목표 집합에서 텍스트에 포함되지 않은 정보 비율이 15%에 불과하고, 삼중항의 22%가 텍스트에 표현되지 않은 것으로 확인되었다. 이는 REBEL의 70%와 45%에 비해 상당히 우수한 수준이다.
  • 인간 평가를 통해 합성 데이터의 품질이 REBEL 데이터셋보다 뚜렷이 뛰어나며, 일관성과 사실 커버리지 면에서 개선된 것으로 확인되었다.
  • 합성 데이터셋에 대해 미세조정된 SynthIE 모델은 Wiki-cIE Text 테스트 세트에서 기존 최고 기술 수준 대비 마이크로-F1에서 57점, 마크로-F1에서 79점의 절대적 향상을 달성했다.
  • REBEL Clean에서 SynthIE의 마크로-F1은 원본 REBEL 골드 어노테이션을 초월하여, 합성 데이터가 인간 어노테이션 기반 베이스라인을 품질 면에서 능가할 수 있음을 보여주었다.
  • 이 방법은 훈련 데이터 내 관계의 분포를 완전히 제어할 수 있어, 기존 데이터셋에서 관찰되는 장꼬리 문제를 완화시킬 수 있다.
  • 이 방법은 확장 가능하고 비용 효율적이며, 고비용 수작업 어노테이션 없이 대규모 데이터 생성이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.