Skip to main content
QUICK REVIEW

[논문 리뷰] Struc-Bench: Are Large Language Models Really Good at Generating Complex Structured Data?

Xiangru Tang, Yiming Zong|arXiv (Cornell University)|2023. 09. 16.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 원시 텍스트, HTML, LaTeX 형식에서 복잡한 구조적 데이터를 생성하는 데 있어 대규모 언어 모델(Large Language Models, LLMs)을 평가하기 위한 벤치마크인 Struc-Bench를 소개한다. GPT-3.5와 GPT-4에서 발생하는 심각한 오류, 특히 서식, 내용 정확도, 추론 능력 측면에서의 결함을 규명한 후, FormatCoT를 활용한 구조 인식 미세조정 방법을 제안하여 LLaMA-7B의 서식 제약 준수 능력을 향상시켰으며, 이는 볼 수 있는 데이터뿐 아니라 볼 수 없는 데이터 모두에서 기존 LLM보다 뛰어난 성능을 보였다.

ABSTRACT

Despite the remarkable capabilities of Large Language Models (LLMs) like GPT-4, producing complex, structured tabular data remains challenging. Our study assesses LLMs' proficiency in structuring tables and introduces a novel fine-tuning method, cognizant of data structures, to bolster their performance. We unveil Struc-Bench, a comprehensive benchmark featuring prominent LLMs (GPT-NeoX-20B, GPT-3.5, GPT-4, and Vicuna), which spans text tables, HTML, and LaTeX formats. Our proposed FormatCoT aids in crafting format-specific instructions from the intended outputs to populate this benchmark. Addressing the gap in task-centered evaluation, we propose two innovative metrics, P-Score (Prompting Score) and H-Score (Heuristical Score), to more accurately gauge LLM performance. Our experiments show that applying our structure-aware fine-tuning to LLaMA-7B leads to substantial performance gains, outshining its LLM counterparts across most measures. In-depth error analysis and creating an ability map across six dimensions -- coverage, formatting, reasoning, comprehension, pragmatics, and hallucination -- highlight areas for future enhancements and suggest forthcoming research trajectories. Our code and models can be found at https://github.com/gersteinlab/Struc-Bench.

연구 동기 및 목표

  • 현재의 LLM이 원시 텍스트, HTML, LaTeX 형식을 포함한 다양한 형식에서 복잡한 구조적 데이터를 생성하는 능력을 체계적으로 평가하는 것.
  • GPT-3.5와 GPT-4와 같은 최신 LLM에서 발생하는 특정 실패 유형, 특히 서식, 내용 정확도, 수치 추론, 장표 처리 능력 측면에서의 결함을 규명하는 것.
  • 실제 세계의 다양한 구조적 데이터 예제를 포함한 포괄적인 벤치마크인 Struc-Bench를 개발하여, 단순한 내용 겹침 지표를 넘어서는 세밀한 평가를 가능하게 하는 것.
  • 목표 출력에서 형식 지침을 생성하는 FormatCoT를 활용한 구조 인식 지시 미세조정 방법을 제안하고, 이로 인해 LLM의 구조적 형식에 대한 일반화 능력이 향상됨을 검증하는 것.
  • 커버리지, 서식, 추론, 이해, 실용성, 환상 제어의 여섯 차원에 걸친 능력 맵을 구성하여, LLM의 구조적 생성 능력에서의 강점과 약점을 특성화하는 것.

제안 방법

  • 원시 텍스트, HTML, LaTeX 테이블을 포함한 다양한 데이터셋을 수록한 Struc-Bench를 개발하여, 복잡한 구조적 출력 생성 능력을 테스트할 수 있도록 설계하였다.
  • GPT-3.5를 활용해 목표 출력에서 세부적인 서식 기술(FormatCoT)을 생성하여, 인간이 읽을 수 있는 서식 요구사항을 구조화된 지시로 변환하였다.
  • 이러한 서식 지시를 사용해 LLaMA-7B를 미세조정하여, 훈련 과정에서 서식 특화 제약 조건을 학습할 수 있도록 하였다.
  • 두 단계 평가 파이프라인을 도입: GPT-4 기반 유사도 프롬프트를 통한 자동 평가(내용 및 구조 유사도 0–10 척도)와 수동 오류 분석.
  • 내용 커버리지, 서식, 추론, 이해, 실용성, 환상 제어 등 다양한 오류 분석 기반으로 다차원 능력 맵을 구성하였다.
  • 형식 및 내용 기술을 입력으로 사용해 제로샷 추론을 적용하여, 모델이 지정된 구조 템플릿을 엄격히 따르는 출력을 생성하도록 보장하였다.
Figure 1: A system for describing complex structured formats and learning to follow this format in human language. We use zero-shot for inference.
Figure 1: A system for describing complex structured formats and learning to follow this format in human language. We use zero-shot for inference.

실험 결과

연구 질문

  • RQ1GPT-3.5와 GPT-4와 같은 현재의 LLM은 원시 텍스트, HTML, LaTeX 형식에서 복잡한 구조적 데이터 생성 능력이 얼마나 뛰어나게 작동하는가?
  • RQ2LLM이 생성한 구조적 출력에서 주로 발생하는 실패 유형은 무엇인가? 특히 서식, 내용 정확도, 수치 추론, 장표 처리 능력 측면에서의 문제점은 무엇인가?
  • RQ3FormatCoT를 활용해 형식 지침을 생성하는 구조 인식 지시 미세조정 방법은 LLM의 정확한 구조적 출력 생성 능력을 상당히 향상시킬 수 있는가?
  • RQ4미세조정된 LLaMA-7B의 성능은 GPT-3.5, GPT-4, Vicuna와 같은 모델의 제로샷 추론과 비교해 봤을 때, 볼 수 있는 데이터와 볼 수 없는 데이터 형식 모두에서 어떻게 나타나는가?
  • RQ5커버리지, 서식, 추론, 환상 제어 등의 모델 능력 차원 중 어떤 것이 LLM의 구조적 데이터 생성 능력에 가장 치명적인 제약을 가하는가?

주요 결과

  • GPT-3.5와 GPT-4는 구조적 생성에서 심각한 실패율을 보이며, GPT-3.5의 출력 중 유일하게 완전히 정확한 출력은 3%에 불과했으며, 주로 서식 오류와 내용 정확도 결함 탓이었다.
  • 제안된 구조 인식 미세조정 방법은 LLaMA-7B의 구조적 데이터 생성 능력을 향상시켜, GPT-4를 포함한 평가된 모든 LLM보다 볼 수 있는 데이터뿐 아니라 볼 수 없는 데이터 모두에서 뛰어난 성능을 보였다.
  • FormatCoT로 생성된 지시를 통해 LLaMA-7B는 높은 수준의 서식 준수 정확도를 달성하였으며, 이는 모델 성능이 표적 지시 미세조정을 통해 상당히 향상될 수 있음을 보여주었다.
  • 능력 맵 분석 결과, LLM은 특히 장표와 수치 추론 작업에서 서식 추론, 복잡한 입력 이해, 환상 제어 능력에서 가장 어려움을 겪고 있었다.
  • GPT-3.5와 GPT-4의 출력 평균 내용 유사도 점수는 5.2, 구조 유사도 점수는 4.8였으며, 내용과 구조 양 측면에서 기준값과 상당한 이격이 있음을 시사했다.
  • 벤치마크는 기존의 단어 겹침에 의존하는 평가 지표가 구조적 데이터에선 부적절하며, 형식 수준의 오류와 구조적 일관성 문제를 포착하지 못함을 밝혀냈다.
Figure 2: Error analysis by human annotation. Some error types are explained in Appendix A .
Figure 2: Error analysis by human annotation. Some error types are explained in Appendix A .

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.