[논문 리뷰] Neurosymbolic Repair for Low-Code Formula Languages
LaMirage는 Excel과 PowerFx와 같은 저코드 수식 언어에서 문법적 및 의미적 오류를 수정하기 위해 기호적 수리 생성과 신경망 기반 오류 위치 특정 및 순위 매기기를 결합한 신경기호 프레임워크이다. 문법과 도메인 제약 조건을 활용하여 효율적으로 올바른 수정을 생성함으로써 400개의 실제 수식에서 최신 기술 기반의 기호적 및 신경망 기반 베이스라인을 능가한다.
Most users of low-code platforms, such as Excel and PowerApps, write programs in domain-specific formula languages to carry out nontrivial tasks. Often users can write most of the program they want, but introduce small mistakes that yield broken formulas. These mistakes, which can be both syntactic and semantic, are hard for low-code users to identify and fix, even though they can be resolved with just a few edits. We formalize the problem of producing such edits as the last-mile repair problem. To address this problem, we developed LaMirage, a LAst-MIle RepAir-engine GEnerator that combines symbolic and neural techniques to perform last-mile repair in low-code formula languages. LaMirage takes a grammar and a set of domain-specific constraints/rules, which jointly approximate the target language, and uses these to generate a repair engine that can fix formulas in that language. To tackle the challenges of localizing the errors and ranking the candidate repairs, LaMirage leverages neural techniques, whereas it relies on symbolic methods to generate candidate repairs. This combination allows LaMirage to find repairs that satisfy the provided grammar and constraints, and then pick the most natural repair. We compare LaMirage to state-of-the-art neural and symbolic approaches on 400 real Excel and PowerFx formulas, where LaMirage outperforms all baselines. We release these benchmarks to encourage subsequent work in low-code domains.
연구 동기 및 목표
- 저코드 플랫폼에서 사용자가 Excel과 PowerApps와 같은 수식 언어에서 작은, 감지하기 어려운 오류를 범할 때 발생하는 '마지막 마일 수리 문제'를 해결하기 위해.
- 일반적으로 도움이 되지 않는 방식으로 보고되는 문법적 및 의미적 오류에 대해 정확하고 맥락 인식 기반의 수리 제안을 제공함으로써 사용자 경험을 향상시키기 위해.
- 문법과 도메인 전용 제약 조건을 사용하여 다양한 저코드 수식 언어에 적용 가능한 수리 엔진 생성기 개발을 위해.
- 伝통적 프로그래머들이 이용 가능한 피드백 수준에 도달하기 위해 저코드 개발자들을 위한 도구 부족을 메우기 위해.
제안 방법
- LaMirage는 공식 문법과 도메인 제약 조건에 의해 이끌리는 기호적 프레임워크를 사용하여 문법적으로나 의미적으로 타당한 후보 수리를 생성한다.
- 오류 위치를 가장 가능성이 높은 곳으로 특정하기 위해 신경망 기반 국소화 모델을 사용하며, 기호 추적과 신경망 예측을 결합한 패러다임 전환 전략을 적용한다.
- 균형 잡힌 반복적 분류 기반 학습 목표를 사용하여 후보 수리를 평가하는 신경망 순위 매기기 모델을 도입하여 편향된 토큰 시퀀스 문제를 해결한다.
- 정확성과 효율성을 보장하기 위해 신경망 구성 요소를 기호적 수리 생성 파이프라인에 통합한다.
- 작고 효율적인 모델을 사용하여 도움말 포럼 데이터와 제품 텔레메트리 데이터의 조합을 기반으로 학습한다.
- 프레임워크는 수리 엔진 생성기로 설계되어, 최소한의 재구성으로 여러 저코드 플랫폼에 쉽게 배포할 수 있다.
실험 결과
연구 질문
- RQ1신경기호 접근 방식이 높은 정확도와 낮은 계산 비용으로 저코드 수식 오류의 수리 위치를 효과적으로 특정하고 순위를 매길 수 있는가?
- RQ2기호적 수리 생성과 신경망 기반 오류 위치 특정 및 순위 매기기를 융합함으로써 순수 기호적 또는 신경망 기반 방법에 비해 수리 품질이 어떻게 향상되는가?
- RQ3왜곡되고 신뢰할 수 없는 학습 데이터가 존재하는 저코드 수리 환경에서 효과적인 신경망 구성 요소 학습 전략은 무엇인가?
- RQ4문법과 제약 조건을 활용하여 단일 프레임워크가 다양한 저코드 수식 언어에 얼마나 일반화될 수 있는가?
- RQ5기호적 요소와 신경망 요소 간의 패러다임 전환 전략이 검색 공간 크기와 수리 커버리지에 어떤 영향을 미치는가?
주요 결과
- LaMirage는 400개의 실제 Excel 및 PowerFx 수식에서 최신 기술 기반의 기호적 및 신경망 기반 베이스라인을 능가하며, 뛰어난 수리 정확도를 입증한다.
- 균형 잡힌 학습 목표와 분류 기반 손실을 사용한 신경망 순위 매기기 모델은 표준 인과적 언어 모델링에 비해 수리 순위 매기기 성능을 크게 향상시킨다.
- 기호 추적에 실패할 경우에만 신경망 기반 국소화를 사용하는 패러다임 전환 전략은 검색 공간 크기를 관리 가능하게 유지하면서도 수리 커버리지를 증가시킨다.
- 작고 효율적인 신경망 모델을 사용하여 높은 성능을 달성함으로써, 실용적인 저코드 플랫폼 내 배포에 적합하다.
- 제거 분석 결과, 신경망 국소화기와 순위 매기기 모두 전체 성능 향상에 기여하며, 기호적 핵심 요소가 정확성을 보장한다.
- 저작자들은 향후 저코드 수리 분야 연구를 위해 실제 오류 수식과 정확한 수정을 포함한 두 개의 벤치마크 데이터셋을 공개하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.