Skip to main content
QUICK REVIEW

[论文解读] A System for Automated Image Editing from Natural Language Commands

Jacqueline Brixey, Ramesh Manuvinakurike|arXiv (Cornell University)|Dec 3, 2018
Multimodal Machine Learning Applications参考文献 11被引用 6
一句话总结

本文提出了一种两级系统,通过首先分类编辑操作,然后使用机器学习检测相关实体,来解释自然语言图像编辑命令。表现最佳的模型在操作分类任务中为LSTM和SVM(F1 = 0.89),在实体序列检测任务中为BiLSTM-CRF(对最内层实体的F1 = 0.73),从而实现了无需技术专长的用户请求自动化执行。

ABSTRACT

This work presents the task of modifying images in an image editing program using natural language written commands. We utilize a corpus of over 6000 image edit text requests to alter real world images collected via crowdsourcing. A novel framework composed of actions and entities to map a user's natural language request to executable commands in an image editing program is described. We resolve previously labeled annotator disagreement through a voting process and complete annotation of the corpus. We experimented with different machine learning models and found that the LSTM, the SVM, and the bidirectional LSTM-CRF joint models are the best to detect image editing actions and associated entities in a given utterance.

研究动机与目标

  • 使非专业用户能够使用自然语言而非技术软件命令来编辑图像。
  • 解决大规模图像编辑请求语料库中的标注分歧,并完成其标注工作。
  • 开发一个机器学习流程,将自然语言语句映射到可执行的图像编辑操作和实体。
  • 评估各种模型在分类图像编辑操作和检测相关实体方面的性能。
  • 为未来在图像编辑对话中联合建模操作与实体奠定基础。

提出的方法

  • 该系统采用两级框架:首先对图像编辑操作(如裁剪、调整、删除)进行分类,然后检测与这些操作相关的实体(如区域、对象、修饰语/值)。
  • 提出了一种新颖的标注框架,将自然语言短语映射到18种预定义操作和5种实体类型,支持嵌套和重叠标注。
  • 操作分类模型使用TensorFlow和Scikit-learn评估LSTM、SVM、逻辑回归和随机森林模型。
  • 实体检测模型对比标准CRF与最先进的BiLSTM-CRF模型,以提升实体序列标注性能。
  • 9,101条编辑请求的语料库被划分为训练集(75%)、验证集(10%)和测试集(15%)用于操作分类;实体数据使用80%训练、10%验证、10%测试。
  • 对于嵌套实体,仅使用最内层标签进行评估,以确保性能比较的一致性。

实验结果

研究问题

  • RQ1自然语言图像编辑请求能否被准确映射到图像编辑软件中的可执行操作和实体?
  • RQ2哪些机器学习模型在从非结构化文本中分类图像编辑操作方面表现最佳?
  • RQ3BiLSTM-CRF模型在检测实体序列方面(尤其是在嵌套或模糊请求中)的效率如何?
  • RQ4两级模型架构在通过过滤模糊或不可执行操作来提升鲁棒性方面,其改进程度如何?
  • RQ5该系统能否在不依赖技术术语的情况下,处理多样化的现实世界自然语言变体的图像编辑请求?

主要发现

  • LSTM和SVM模型在操作分类任务中取得了0.89的最高F1分数,优于逻辑回归(0.87)和随机森林(0.58)。
  • 当仅检测最内层实体时,BiLSTM-CRF模型取得了0.73的F1分数,显著优于基线CRF模型(0.66)。
  • 尽管数据集中存在类别不平衡,LSTM模型仍能以高准确率正确分类低频操作(如“旋转”)。
  • 该系统对语言变体表现出鲁棒性,包括祈使句、情态句和描述性语句,例如“这张图片模糊”或“放大斑马”。
  • 该框架支持重叠和嵌套标注,允许同一个词同时被标注为操作和修饰语/值实体,从而增强解释的灵活性。
  • 结果表明,联合建模操作与实体的模型可进一步提升性能,且在对话式编辑场景中应用迁移学习是一个可行的未来方向。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。