融合自注意力机制和相对鉴别的无监督图像翻译
2021-11-13林泓任硕杨益张杨忆
自动化学报 2021年9期
林泓 任硕 杨益 张杨忆
1.武汉理工大学计算机科学与技术学院武汉430063
图像翻译(Image-to-image translation)[1]是一类将源图像域的输入图像转化为目标图像域输出图像的计算机视觉处理任务,其应用包括图像风格转换[2]、图片域适应和数据预处理等多个领域.生成对抗网络[3]作为当前图像翻译任务的主流模型,通过生成器和判别器之间的零和博弈,提高判别器鉴别真伪的能力,指导生成器学习真实的数据分布从而生成逼真图像.
根据训练数据集中输入图像和输出图像的对应关系,图像翻译分为有监督和无监督两种[4].Isola等[1]在2017年基于条件生成对抗网络(Conditional generative adversarial network,CGAN)[5]提出的pix2pix 是典型的有监督图像翻译方法,其模型将U-net[6]作为生成器、PatchGAN 作为判别器,在保持图像结构一致性的情况下完成有标注的成对数据间转换工作.
有监督的图像翻译方法需要一一配对的训练图像,然而在艺术风格转换、目标转换等任务中难以得到大规模匹配成对的有标注图像数据集.
无监督的图像翻译任务避免了需要获取配对训练数据集的问题,其目标是学习两个图像域(Image domain)之间的映射,训练集中输入图像和目标图像不必拥有明确的对应关系.Zhu 等[7]结合对偶学习提出CycleGAN 无监督图像翻译方法,使用相互对应的生成器和判别器完成图像域转换,并使用循环重构一致性的约束条件保留图像内容结构信息,从而只改变目标图像域.为更好地建立图像域之间的映射关系,Liu 等[8]提出UNIT 方法共享中间层的网……
登录APP查看全文
