一种优化多种视觉任务模型的神经网络模块
2021-09-22赵钊龚霁程
电子技术与软件工程 2021年13期
赵钊 龚霁程
(上海西井信息科技有限公司研发部 上海市 200050)
1 引言
近年来,目标检测[1-6]和实例分割[7-9]已经成为一个充满挑战性且十分热门的研究领域。文献[7]通过Mask R-CNN首次将两个任务整合到同一个框架中,并且在这两个任务上均取得了较好的结果。在此基础上,文献[10]又提出了Cascade R-CNN架构。其相对简单且直观的设计思路使得它很容易应用于大多数两阶段模型,如Faster R-CNN[11]、R-FCN[12]、FPN[13]、Mask R-CNN[7]和GCNet[14]。因为以上所有模型的检测模块在根据这个设计级联之后,其性能都会有较为明显的提升,级联模型已经成为一种广泛使用的架构设计优化思路。该优化思路之所以应用广泛,可以归结为以下两点原因:
(1)多阶段检测产生高质量的检测结果;
(2)避免了训练时的过拟合和推理时的质量不匹配问题。
然而,多阶段目标检测[15,16]架构仍有许多可以被改进的方面。首先,级联的方法是基于多套不同参数的回归模块构建的,这使得具有超过三个阶段的级联模型代价高昂。因为这将使模型拥有过多的参数。考虑到大多数级联模型重复添加检测模块会大幅增加模型复杂度,因此绝大部分的基于级联思路的检测模型通常只级联3次。另一个问题是,级联模型所执行的检测迭代步长是固定的。例如,一个三级级联模型在训练和测试次数上都只能进行最多三个阶段的检测。这使得模型严重缺乏平衡精度和速度的灵活性。
为了解决这些问题,本文提出了一个基于注意力机制的卷积长短时记忆模块(A-ConvLSTM)。……
登录APP查看全文
