Generative Adversarial Text to Image Synthesis --- 文本生成图像
发布时间
阅读量:
阅读量
总说
简而言之,这一过程是依据文本内容生成对应的图像。
接下来展示实际效果:

架构

首先,通过一个文本嵌入网络将文字转化为向量形式,其中\phi(t)表示一个1024维的向量,并进一步将其映射为128维的向量。随后,这128维的向量被分别引入到生成器G和判别器D的网络结构中。在生成器G中,该向量直接与后续层进行拼接;而在判别器D中,由于中间层输出的空间尺寸为4x4,因此需要将该向量复制成4x4份后再进行拼接操作。
传统的GAN模型通常直接由随机噪声z生成图像,而本研究的目标是使生成的图像能够符合给定文本t所描述的内容。显然,为了实现这一目标,必须将文本信息转换为嵌入向量并将其整合进模型中。值得注意的是,在此过程中判别器D同样引入了该嵌入向量,个人认为这种设计与条件GAN(CGAN)具有一定的相似性。
此外,作者还提出了两种新
全部评论 (0)
还没有任何评论哟~
