[논문 리뷰] CLASP: Few-Shot Cross-Lingual Data Augmentation for Semantic Parsing
CLASP는 저자원 환경에서 비정형적 의미 분석 학습 데이터를 생성하기 위해 대규모 언어 모델(에이박스TM 20B)을 사용하는 소수의 예제 기반 이종어 의미 분석 데이터 증강 방법을 제안한다. 같은 언어 또는 목표 언어에서 슬롯 치환, 번역, 또는 동시 생성을 통해 텍스트와 분석을 동시에 생성함으로써 CLASP는 제로샷 이종어 일반화 성능을 향상시키며, 단지 16개의 학습 예제로 mTOP에서 6.1점, 영어 피자 데이터셋에서 4.79점의 점수 향상을 달성한다.
A bottleneck to developing Semantic Parsing (SP) models is the need for a large volume of human-labeled training data. Given the complexity and cost of human annotation for SP, labeled data is often scarce, particularly in multilingual settings. Large Language Models (LLMs) excel at SP given only a few examples, however LLMs are unsuitable for runtime systems which require low latency. In this work, we propose CLASP, a simple method to improve low-resource SP for moderate-sized models: we generate synthetic data from AlexaTM 20B to augment the training set for a model 40x smaller (500M parameters). We evaluate on two datasets in low-resource settings: English PIZZA, containing either 348 or 16 real examples, and mTOP cross-lingual zero-shot, where training data is available only in English, and the model must generalize to four new languages. On both datasets, we show significant improvements over strong baseline methods.
연구 동기 및 목표
- 의미 분석에서 인간이 주석 처리한 학습 데이터의 부족 문제, 특히 多국어 환경에서의 문제를 해결하기 위해.
- 기존 의미 분석에서의 데이터 증강 기법은 텍스트 수정이 분석 일관성에 영향을 주기 때문에 이를 해결하기 위해.
- 대규모 언어 모델을 사용해 고품질의 합성 학습 예제를 생성함으로써 효과적인 소수의 예제 기반 이종어 일반화를 가능하게 하기 위해.
- 대규모 미리 훈련된 모델이나 런타임 LLM에 의존하지 않고도 중간 크기의 모델(예: 500M 파라미터)이 저자원 환경에서 성능을 향상시키기 위해.
- 언어 간 텍스트-분석 일치를 유지하고 슬롯 일치 실패나 대소문자 오류 등의 실패 모드를 처리하는 종단 간 데이터 증강 파이프라인을 개발하기 위해.
제안 방법
- CLASP는 네 가지 프롬프팅 전략을 사용한다: RS(슬롯을 교체하고 동일 언어에서 텍스트를 생성), TS(슬롯을 번역하고 새로운 언어에서 텍스트를 생성), GB(동일 언어에서 분석과 텍스트를 동시에 생성), TB(이종어 환경에서 분석과 텍스트를 모두 번역).
- 각 방법에 대해 LLM은 몇 개의 맥락 예제(예: '의미 분석: ... 영어 번역: ...')로 구성된 프롬프트를 제공하여 일관된 출력 형식을 확보하고 제로샷 일반화 성능을 향상시킨다.
- 문자 대소문자 불일치 문제를 수정하기 위해 '대소문자 수정' 복구 메커니즘을 포함한다. 이는 생성된 텍스트에서 대소문자 무시 비교를 통해 슬롯 값의 잘못된 대소문자 표현(예: 'nicole' → 'Nicole')을 수정한다.
- 이종어 생성을 위해 CLASP는 기계 번역(Opus 또는 LLM 기반)을 수행한 후 Sim-Align를 사용해 번역된 텍스트를 원본 분석 구조에 일치시킨다.
- 출력은 네 가지 실패 모드 히우리스틱을 사용해 필터링된다: 슬롯 값 누락, 비연속적인 타겟, 입력의 그대로 복사, 출력에 'Sentence'라는 단어 포함.
- 최종 합성 데이터셋은 소형 모델(예: 500M 파라미터)을 미세 조정하는 데 사용되어 저자원 및 제로샷 이종어 의미 분석 환경에서의 성능 향상을 도모한다.

실험 결과
연구 질문
- RQ1LLM 기반 데이터 증강이 저자원 환경에서 소수의 예제 기반 의미 분석 성능을 크게 향상시킬 수 있는가?
- RQ2LLM 프롬프팅을 통한 이종어 데이터 생성이 언어 간 텍스트-분석 일치를 유지하는 데 얼마나 효과적인가?
- RQ3기계 번역 기반 의미 분석에서 지배적인 실패 모드는 무엇이며, 필터링 및 복구 메커니즘으로 이를 완화할 수 있는가?
- RQ4순차적 생성(RS/TS) 대비 동시 생성(GB/TB)이 의미 일관성을 유지하는 데 더 우수한가?
- RQ520B 파라미터 LLM에서 생성된 합성 데이터가 500M 파라미터 모델의 제로샷 이종어 의미 분석 성능 향상에 효과적으로 기여하는가?
주요 결과
- 영어 피자 데이터셋에서 단지 16개의 학습 예제로 CLASP는 순서 없는 정확 일치 점수를 80.40에서 85.19로 향상시켜 4.79점 향상.
- mTOP 이종어 제로샷 벤치마크에서 CLASP는 슬롯 일치를 통한 기계 번역 대비 정확 일치 점수를 60.3에서 66.4로 6.1점 향상.
- 필터링된 기계 번역 출력의 성공률은 히누어의 58.3%에서 독일어의 86.7%까지 변동하여, 특히 거리가 먼 언어 쌍에서 이종어 일치 문제의 심각성을 보여준다.
- '대소문자 수정' 복구 메커니즘은 20B가 생성한 출력 중 13.4%에서 발생하는 대소문자 오류로 인한 실패를 성공적으로 복구했다.
- 출력에 'Sentence'라는 단어가 포함된 경우(히누어의 13.4%)를 필터링하는 것이 핵심이었으며, 이는 프롬프트 설계와 출력 형식 제약 조건이 신뢰성 있는 생성을 위해 필수적임을 시사한다.
- CLASP는 두 데이터셋 모두에서 강력한 베이스라인을 능가했으며, 대규모 LLM에서 생성된 합성 데이터가 저자원 의미 분석에서 소형 모델의 성능 향상에 효과적으로 기여할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.