轻量级注意力约束对齐网络的视频超分重建
2022-10-21靳雨桐宋慧慧刘青山
靳雨桐,宋慧慧,刘青山
南京信息工程大学,江苏省大气环境与装备技术协同创新中心,江苏省大数据分析技术重点实验室,南京 210044
0 引 言
视频超分辨率(video super-resolution,VSR)重建的目标是从LR(low-resolution)帧(参考帧)和其对应的多个相邻帧中恢复出逼真的HR(high-resolution)帧。视频超分重建应用十分广泛,例如视频监控、高清电视和视频后期制作等。Dai等人(2017)提出了可变形的卷积网络(deformable convolutional networks,DCNs),突破了卷积神经网络(convolutional neural networks,CNNs)中感受野采用固定几何结构的局限性。DCNs能够从目标任务中学习偏移量来增加空间采样位置,从而学习出自适应的感受野。随后,Zhu等人(2018)提出了DCNs的进阶版本DCNs v2,通过增强建模能力和更强的训练,提高其专注于相关图像区域的能力。随着DCNs的发展,其在视频超分重建领域取得重大突破。例如,Tian等人(2020)提出的TDAN(temporally-deformable alignment network)首次将DCNs应用到视频超分领域。TDAN网络无需计算光流,能够在特征层面自适应地对齐相邻帧。
传统的VSR算法通过考虑相邻LR帧之间的亚像素运动,将多个LR帧作为输入得到HR帧。Liu和Sun(2014)引入了贝叶斯方法,在重建原始的高分辨率帧的同时,估计底层运动、模糊核和噪声。Farsiu等人(2004)提出了一种基于双边先验知识来处理不同的数据和噪声模型。但是,由于这些方法是将输入的视频帧当做单幅图像进行重建,并没有考虑帧与帧之间的时序关系,极有可能无法处理连续帧。考虑到VSR的特性,对LR参考帧和相邻LR帧之间的时序关系进行建模对于提高重建性能至关重要。Tao等人(2017)提出了亚像素运动补偿(sub-pixel motion compensation,SPMC)层,并分析了该层在视频超分中的实用性,通过有效融合SPMC层与多帧信息来重建图像细节。……
