#今日论文推荐#文本生成图像新“天花板”？谷歌研究人员研发图像生成器Imagen，评分超OpenAI同类模型

发布时间：2022-08-19 12:14

当前，多模态学习成为 AI 的热门技术趋势之一，尤其是在文本生成图像的应用方面。前不久，OpenAI 开发了升级版的 DALL-E 2，不仅可以将文字转换成具有高分辨率与低延迟的真实图像，还能对所生成的图像进行二次的编辑。近日，谷歌研究（Google Research）推出了一个具有类似功能的图像生成器“Imagen”，其能够根据输入的文字描述生成油画、照片、绘制和 CGI 渲染图像。值得一提的是，相比 OpenAI 的 DALL-E 2，Imagen 所带来的图像真实感更强，对于语言理解的准确度也更高。

据了解，谷歌通过引入测试基准 DrawBench，对 Imagen、DALL-E 2、VQ-GAN+CLIP和 LDM（Latent Diffusion Models）几类模型进行了深入地评估与对比。结果得出，无论是在样本质量还是图文对齐方面，Imagen 的评分都位居第一。

例如，DALL-E 2 在面对一些同时出现两个颜色的文本时表现不佳，而 Imagen 可以很好地应对这些情况。此外，当文本中出现有位置和效果指向的具体字样时，Imagen 也比 DALL-E 2 的表现更好。

论文题目：Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding
详细解读:https://www.aminer.cn/research_report/62957a157cb68b460fc66ffe?download=falsehttps://www.aminer.cn/research_report/62957a157cb68b460fc66ffe?download=false
AMiner链接：https://www.aminer.cn/?f=cs

#今日论文推荐#文本生成图像新“天花板”？谷歌研究人员研发图像生成器Imagen，评分超OpenAI同类模型

相关推荐