[논문 리뷰] LayoutPrompter: Awaken the Design Ability of Large Language Models
LayoutPrompter는 사전 훈련된 대규모 언어 모델(LLM)을 활용하여 컨텍스트 내 학습을 통해 조건부 그래픽 레이아웃 생성을 수행하는 훈련 불필요하고 다재다능한 방법이다. 세 가지 핵심 구성 요소인 입력-출력 직렬화, 동적 예시 선택, 레이아웃 랭킹을 포함한다. 모델 미세조정 없이도 일곱 가지 레이아웃 생성 작업에서 최고 수준 또는 그 이상의 성능을 달성하며, 낮은 데이터 환경에서도 높은 데이터 효율성과 강건성을 보여준다.
Conditional graphic layout generation, which automatically maps user constraints to high-quality layouts, has attracted widespread attention today. Although recent works have achieved promising performance, the lack of versatility and data efficiency hinders their practical applications. In this work, we propose LayoutPrompter, which leverages large language models (LLMs) to address the above problems through in-context learning. LayoutPrompter is made up of three key components, namely input-output serialization, dynamic exemplar selection and layout ranking. Specifically, the input-output serialization component meticulously designs the input and output formats for each layout generation task. Dynamic exemplar selection is responsible for selecting the most helpful prompting exemplars for a given input. And a layout ranker is used to pick the highest quality layout from multiple outputs of LLMs. We conduct experiments on all existing layout generation tasks using four public datasets. Despite the simplicity of our approach, experimental results show that LayoutPrompter can compete with or even outperform state-of-the-art approaches on these tasks without any model training or fine-tuning. This demonstrates the effectiveness of this versatile and training-free approach. In addition, the ablation studies show that LayoutPrompter is significantly superior to the training-based baseline in a low-data regime, further indicating the data efficiency of LayoutPrompter. Our project is available at https://github.com/microsoft/LayoutGeneration/tree/main/LayoutPrompter.
연구 동기 및 목표
- 기존의 레이아웃 생성 방법은 일반적으로 작업에 특화되어 있으며, 광범위한 훈련 데이터가 필요하다는 한계를 해결한다.
- 모델 재훈련 없이도 다양한 조건부 레이아웃 생성 작업(예: 텍스트-레이아웃, 콘텐츠 기반, 제약 조건 명시)을 통합하고 다용도적으로 처리할 수 있는 접근법을 제공한다.
- 특히 자원이 제한된 레이아웃 도메인에서 대규모 애너테이션 데이터셋에 의존도를 줄이며 데이터 효율성을 향상시킨다.
- 사전 훈련된 LLM의 컨텍스트 내 학습 능력을 활용해 파rameter 업데이트 없이도 고품질의 레이아웃을 생성한다.
- 전용 레이아웃 랭킹 기반 및 동적 예시 선택을 통해 레이아웃 품질과 제약 조건 준수도 향상시킨다.
제안 방법
- 입력-출력 직렬화는 레이아웃 제약 조건과 출력을 구조화된 토큰 시퀀스로 변환하여 LLM이 이를 시퀀스-투-시퀀스 작업으로 처리할 수 있도록 한다.
- 동적 예시 선택은 입력 제약 조건과 의미적 유사도를 기반으로 검색 풀에서 가장 관련성이 높은 예시를 검색한다.
- 레이아웃 랭커는 여러 LLM 생성 레이아웃을 평가하고 mIoU, FID, 정렬도 등의 지표를 사용해 품질이 가장 높은 출력을 선택한다.
- 이 방법은 완전히 컨텍스트 내 학습 설정에서 작동하며, 미세조정이나 모델 업데이트가 필요 없다.
- 동일한 LLM과 프롬프트 프레임워크를 사용해 UI, 포스터, 문서 등 다양한 레이아웃 도메인과 작업에 동일하게 적용된다.
- 예시 검색은 밀도 기반 벡터 검색 방법을 사용하여 각 입력에 대해 관련성이 높은 예시가 선택되도록 보장한다.
실험 결과
연구 질문
- RQ1LLM 기반의 통합적이고 훈련 불필요한 접근법이 작업에 특화된 모델 적응 없이도 여러 조건부 레이아웃 생성 작업을 효과적으로 처리할 수 있는가?
- RQ2특히 데이터 효율성 측면에서, LayoutPrompter는 미세조정된 베이스라인과 비교해 낮은 데이터 환경에서 어떻게 성능을 내는가?
- RQ3입력-출력 직렬화와 동적 예시 선택이 레이아웃 품질 향상과 제약 조건 준수에 얼마나 기여하는가?
- RQ4레이아웃 랭킹 구성 요소는 무작위 선택 대비 출력 품질을 얼마나 크게 향상시키는가?
- RQ5적절한 프롬프트를 제공받는 LLM은 레이아웃 데이터에 대한 명시적 훈련 없이도 시각적으로 일관되고 미적으로 매력적인 레이아웃을 생성할 수 있는가?
주요 결과
- LayoutPrompter는 모델 미세조정 없이도 네 개의 공개 데이터셋에서 일곱 가지 레이아웃 생성 작업 전반에서 최고 성능 또는 그 이상의 성능을 달성한다.
- RICO 데이터셋에서 LayoutPrompter는 Gen-TS 작업에서 mIoU 0.552, Refinement 작업에서 0.745를 기록하며, 낮은 데이터 환경에서 훈련 기반 베이스라인인 LayoutFormer++를 능가한다.
- 제거 실험에서 레이아웃 랭커를 제거하면 Gen-T에서 mIoU가 최대 0.08 감소하고 Refinement에서는 0.04 감소하여, 출력 품질 향상에 핵심적인 역할을 함을 입증한다.
- 동적 예시 선택은 필수적이다: 이를 제거하면 Gen-T에서 mIoU가 0.251로 떨어지고 Gen-TS에서는 0.337로 떨어지며, 관련 예시가 없을 경우 성능이 떨어짐을 시사한다.
- 훈련 데이터가 제한적일 경우(500개 샘플), LayoutPrompter는 LayoutFormer++를 크게 앞서며, 예를 들어 Gen-T에서 mIoU 0.343 대비 0.176로 성능을 뛰어넘어 뛰어난 데이터 효율성을 확인한다.
- UI, 포스터, 문서 등 다양한 레이아웃 도메인에서 높은 성능을 유지하여 높은 다용도성과 일반화 능력을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.