发布时间:2022-08-19 12:14
#今日论文推荐#文本生成图像新“天花板”?谷歌研究人员研发图像生成器Imagen,评分超OpenAI同类模型
当前,多模态学习成为 AI 的热门技术趋势之一,尤其是在文本生成图像的应用方面。前不久,OpenAI 开发了升级版的 DALL-E 2,不仅可以将文字转换成具有高分辨率与低延迟的真实图像,还能对所生成的图像进行二次的编辑。近日,谷歌研究(Google Research)推出了一个具有类似功能的图像生成器“Imagen”,其能够根据输入的文字描述生成油画、照片、绘制和 CGI 渲染图像。值得一提的是,相比 OpenAI 的 DALL-E 2,Imagen 所带来的图像真实感更强,对于语言理解的准确度也更高。
据了解,谷歌通过引入测试基准 DrawBench,对 Imagen、DALL-E 2、VQ-GAN+CLIP和 LDM(Latent Diffusion Models)几类模型进行了深入地评估与对比。结果得出,无论是在样本质量还是图文对齐方面,Imagen 的评分都位居第一。
例如,DALL-E 2 在面对一些同时出现两个颜色的文本时表现不佳,而 Imagen 可以很好地应对这些情况。此外,当文本中出现有位置和效果指向的具体字样时,Imagen 也比 DALL-E 2 的表现更好。
论文题目:Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding
详细解读:https://www.aminer.cn/research_report/62957a157cb68b460fc66ffe?download=falsehttps://www.aminer.cn/research_report/62957a157cb68b460fc66ffe?download=false
AMiner链接:https://www.aminer.cn/?f=cs
集成websocket即时通讯 java聊天源码 代码下载 java后台框架源码 websocket源码 IM
Vue中.env|.env.development|.env.production文件说明
从数据集成到分析实践开发,Apache SeaTunnel & Apache Doris7月联合Meetup
亚马逊重组游戏开发部门:数个未发布游戏被“扼杀”;台积电明年开始为苹果iPhone生产5nm处理器……...
COSCon'22 社区召集令来啦!Open the World,邀请所有社区一起拥抱开源,打开新世界~
横空出世!SpringBoot应用自动化部署神器,IDEA版Jenkins?