NUS&深大提出VisorGPT：为可控文本图像生成定制空间条件

CVer 2023-06-11 938

描述

图像生成

代码：https://github.com/Sierkinhane/VisorGPT

论文：https://arxiv.org/abs/2305.13777

论文简介

可控扩散模型如ControlNet、T2I-Adapter和GLIGEN等可通过额外添加的空间条件如人体姿态、目标框来控制生成图像中内容的具体布局。使用从已有的图像中提取的人体姿态、目标框或者数据集中的标注作为空间限制条件，上述方法已经获得了非常好的可控图像生成效果。那么如何更友好、方便地获得空间限制条件？或者说如何自定义空间条件用于可控图像生成呢？例如自定义空间条件中物体的类别、大小、数量、以及表示形式（目标框、关键点、和实例掩码）。

本文将空间条件中物体的形状、位置以及它们之间的关系等性质总结为视觉先验（Visual Prior），并使用Transformer Decoder以Generative Pre-Training的方式来建模上述视觉先验。因此，我们可以从学习好的先验中通过Prompt从多个层面，例如表示形式（目标框、关键点、实例掩码）、物体类别、大小和数量，来采样空间限制条件。我们设想，随着可控扩散模型生成能力的提升，以此可以针对性地生成图像用于特定场景下的数据补充，例如拥挤场景下的人体姿态估计和目标检测。

方法介绍

表1 训练数据

图像生成