[논문 리뷰] Let Me Speak Freely? A Study on the Impact of Format Restrictions on Performance of Large Language Models
이 연구는 JSON, XML, YAML과 같은 형식 제약 조건이 대규모 언어 모델(Large Language Models, LLMs)의 성능에 미치는 영향을 조사한다. 형식 제약이 강화될수록 추론 능력이著しく 떨어지며, 이는 더 엄격한 형식에서 더 큰 성능 저하를 초래함을 발견하였고, 형식 일관성과 높은 모델 성능을 유지하기 위해 유연한 프롬프팅 전략을 제안한다.
Structured generation, the process of producing content in standardized formats like JSON and XML, is widely utilized in real-world applications to extract key output information from large language models (LLMs). This study investigates whether such constraints on generation space impact LLMs abilities, including reasoning and domain knowledge comprehension. Specifically, we evaluate LLMs performance when restricted to adhere to structured formats versus generating free-form responses across various common tasks. Surprisingly, we observe a significant decline in LLMs reasoning abilities under format restrictions. Furthermore, we find that stricter format constraints generally lead to greater performance degradation in reasoning tasks.
연구 동기 및 목표
- 구조화된 생성에서의 형식 제약 조건이 추론 및 지식 작업에서 LLM 성능에 악영향을 미치는지 조사하는 것.
- 제약 있는 디코딩(JSON-모드), 형식 제약 지시(FRI), 자연어(NL)에서 형식으로의 프롬프팅과 같은 다양한 구조화된 생성 방법의 영향을 비교하는 것.
- 형식 제약 조건 하에서 성능 저하의 근본 원인을 규명하고 보완 전략을 제안하는 것.
- 다양한 작업과 LLM들 간의 형식 준수와 모델 품질 간의 상충 관계에 대한 실증적 증거를 제공하는 것.
제안 방법
- API 플래그를 통해 제약 있는 디코딩(JSON-모드)을 적용하여 생성 중에 유효한 JSON 출력을 강제화했다.
- 형식 제약 지시(FRI)는 모델이 JSON, XML, YAML과 같은 특정 형식으로 응답을 생성하도록 명시적인 형식 제약 조건을 제공했다.
- NL-to-Format 프롬프팅은 내용 생성과 형식화를 분리하여 먼저 자연어를 생성한 후 목표 스키마로 변환하는 방식이었다.
- GSM8K, Last Letter, Shuffled Objects, DDXPlus, Sports, Task280, MultiFin 등의 다양한 데이터셋에서 제로샷 프롬프팅을 적용했다.
- 표준 평가 지표(정확도, F1)를 사용하여 성능을 평가하였으며, 다수의 런과 표준편차를 통한 통계적 보고를 수행했다.
- 테스트된 모델로는 GPT-3.5-turbo, Gemini 1.5 Flash, Claude 3 Haiku, LLaMA 3 8B, Gemma2-9B-IT 등이 있으며, 추론 및 분류 작업에서 평가되었다.

실험 결과
연구 질문
- RQ1JSON, XML, YAML과 같은 구조화된 형식으로 제약을 둘 경우 LLM의 추론 성능이 떨어지는가?
- RQ2형식 제약의 엄격함이 다양한 작업에서 모델 성능에 어떤 영향을 미치는가?
- RQ3형식 제약 조건 하에서 성능 저하의 근본 원인은 무엇인가?
- RQ4유연한 프롬프팅 전략은 구조화된 출력을 유지하면서도 높은 성능을 유지할 수 있는가?
주요 결과
- GPT-3.5-turbo의 GSM8K 정확도는 자연어에서 76.60%에서 JSON-모드로 전환 시 49.25%로 떨어져 27.35%p 감소했다.
- Gemini 1.5 Flash는 자연어에서 65.45%에서 JSON-모드로 전환 시 Last Letter 정확도가 77.02%로 상승하여 20.12%p 상승했지만, 이는 추세에서의 이례적인 결과였다.
- LLaMA 3 8B의 GSM8K 점수는 자연어에서 74.73%에서 JSON-모드로 전환 시 48.90%로 떨어져 25.83%p 감소했다.
- NL-to-Format 프롬프팅은 추론 작업에서 FRI 및 JSON-모드를 항상 앞서며, 모든 모델에서 평균 정확도가 가장 높았다.
- 분류 작업에서는 일부 모델(예: DDXPlus에서 Gemini 1.5 Flash)에서 JSON-모드가 자연어보다 성능이 뛰어났지만, 모든 모델과 작업에서 일관되게 나타나지 않았다.
- YAML 형식은 추론 작업에서 가장 높은 변동성을 보이며 최악의 성능을 보였으며, LLaMA 3 8B는 Shuffled Objects에서 단지 9.57%의 점수를 기록했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.